VoiceChat 11B
कॉज़ल FastConformer परसेप्शन Nemotron-H के टेक्स्ट और फ़ंक्शन चैनलों को इनपुट देता है। वाणी भाषा मॉडल के हेड से नहीं, बल्कि अलग टेक्स्ट-कंडीशंड EAR-TTS डिकोडर और 22.05 kHz न्यूरल कोडेक से बनती है।
वॉइस-फ़र्स्ट इंटरफ़ेस के तीन रूप — नेटिव फ़ुल-डुप्लेक्स speech-to-speech मॉडल, एक कंपोज़ेबल wake → VAD → ASR → LLM → TTS पाइपलाइन जिस पर पूरा नियंत्रण आपका, और बिना हाथ लगाए प्रवेश के लिए वेक-वर्ड एक्टिवेशन। सब ऑन-डिवाइस, कोई क्लाउड API नहीं, ऑडियो डिवाइस से बाहर नहीं।
ड्रॉप-इन डायलॉग मॉडल, प्रति-स्टेज नियंत्रण वाली कंपोज़ेबल पाइपलाइन, या केवल पतला वेक-वर्ड ट्रिगर। हर रूप पूरी तरह डिवाइस पर चलता है।
नेटिव मॉडल पारंपरिक ASR → LLM → TTS टर्न सीमा के बिना माइक्रोफ़ोन ऑडियो को बोलकर आउटपुट में स्ट्रीम करते हैं। VoiceChat का असममित स्टैक या PersonaPlex के Moshi-परिवार स्ट्रीम चुनें।
वेक-वर्ड → VAD → स्ट्रीमिंग ASR → ऑन-डिवाइस LLM → TTS। हर स्टेज पर नियंत्रण, ट्रांसक्रिप्ट दृश्यमान, इंजन आज़ाद बदलें। अपनी ख़ुद की Siri बनाएँ।
किसी भी वॉइस फ़्लो के लिए बिना हाथ का ट्रिगर। प्रति-फ़्रेज़ थ्रेसहोल्ड वाले कस्टम कीवर्ड, डिवाइस पर 5 MB से कम, रियल-टाइम से 26×।
दोनों निरंतर वाणी लेते हैं और पारंपरिक ASR → LLM → TTS टर्न सीमा के बिना वाणी बनाते हैं। टेक्स्ट फिर भी मॉडल के भीतर संरेखित रीजनिंग और कंट्रोल स्ट्रीम के रूप में रह सकता है।
कॉज़ल FastConformer परसेप्शन Nemotron-H के टेक्स्ट और फ़ंक्शन चैनलों को इनपुट देता है। वाणी भाषा मॉडल के हेड से नहीं, बल्कि अलग टेक्स्ट-कंडीशंड EAR-TTS डिकोडर और 22.05 kHz न्यूरल कोडेक से बनती है।
PersonaPlex Moshi वेट्स से शुरू होकर Mimi और Depformer स्ट्रीम में यूज़र ऑडियो, एजेंट टेक्स्ट और एजेंट ऑडियो को साथ मॉडल करता है। यह एक साथ सुनने-बोलने, टेक्स्ट रोल प्रॉम्प्ट और ऑडियो वॉइस प्रॉम्प्ट को सपोर्ट करता है।
BESTOW NVIDIA की पहले की स्ट्रीमिंग SpeechLLM वंशावली को दिखाता है, लेकिन यह वाणी को टेक्स्ट में बदलता है; यह डुप्लेक्स S2S मॉडल नहीं है। Moshi और PersonaPlex मल्टी-स्ट्रीम परिवार का वर्णन करते हैं, जबकि SALM-Duplex कुशल असममित डुप्लेक्स मॉडलिंग का। Full-Duplex-Bench विराम, बैकचैनल, टर्न-टेकिंग और रुकावटों का मूल्यांकन करता है—इन व्यवहारों को RTF नहीं पकड़ता।
NVIDIA Nemotron VoiceChat 11B को स्थानीय रूप से चलाने वाला एक वास्तविक सत्र: एक बोला गया टर्न, वाक्य के बीच में टोकाटाकी, और Apple Reminders में एक पूर्ण MCP टूल कॉल। M5 Pro पर RTF 0.92, 7.5 GB रेजिडेंट, और कुछ भी मशीन से बाहर नहीं जाता।
वॉइस एजेंट के तीन फैसलों पर हालिया काम: कब रुकना है, कब बोलना है और कब काम करना है। यह सब डिवाइस पर ही चलता है।
VoiceChat जवाब देते हुए भी सुनता रहता है, और इसका function head बोले गए अनुरोध को MCP टूल कॉल में बदल देता है। Mac पर यह Apple Reminders को दिखाता, बनाता और अपडेट करता है — कुछ भी डिवाइस से बाहर नहीं जाता।
Smart Turn v3.2 अनुरोध पूरा करने से पहले जाँचता है कि बोलने वाला खत्म कर चुका है या नहीं, ताकि “अं, शुक्रवार” अब भी गुरुवार की जगह ले सके। 23 भाषाओं वाला यह मॉडल CoreML और Swift पर, speech-core के C++ रनटाइम में और Android पर चलता है — M5 Pro पर कुछ ही मिलीसेकंड में।
Android पर एक ही फोन में आवाज़ असली डिवाइस एक्शन और बोले गए जवाब में बदल जाती है: Silero VAD, Parakeet STT, FunctionGemma टूल कॉल और Pocket TTS — पूरी तरह ऑफलाइन, 1.2 GB RAM में।