VoiceChat 11B
कॉज़ल FastConformer परसेप्शन Nemotron-H के टेक्स्ट और फ़ंक्शन चैनलों को इनपुट देता है। वाणी भाषा मॉडल के हेड से नहीं, बल्कि अलग टेक्स्ट-कंडीशंड EAR-TTS डिकोडर और 22.05 kHz न्यूरल कोडेक से बनती है।
वॉइस-फ़र्स्ट इंटरफ़ेस के तीन रूप — नेटिव फ़ुल-डुप्लेक्स speech-to-speech मॉडल, एक कंपोज़ेबल wake → VAD → ASR → LLM → TTS पाइपलाइन जिस पर पूरा नियंत्रण आपका, और बिना हाथ लगाए प्रवेश के लिए वेक-वर्ड एक्टिवेशन। सब ऑन-डिवाइस, कोई क्लाउड API नहीं, ऑडियो डिवाइस से बाहर नहीं।
ड्रॉप-इन डायलॉग मॉडल, प्रति-स्टेज नियंत्रण वाली कंपोज़ेबल पाइपलाइन, या केवल पतला वेक-वर्ड ट्रिगर। हर रूप पूरी तरह डिवाइस पर चलता है।
नेटिव मॉडल पारंपरिक ASR → LLM → TTS टर्न सीमा के बिना माइक्रोफ़ोन ऑडियो को बोलकर आउटपुट में स्ट्रीम करते हैं। VoiceChat का असममित स्टैक या PersonaPlex के Moshi-परिवार स्ट्रीम चुनें।
वेक-वर्ड → VAD → स्ट्रीमिंग ASR → ऑन-डिवाइस LLM → TTS। हर स्टेज पर नियंत्रण, ट्रांसक्रिप्ट दृश्यमान, इंजन आज़ाद बदलें। अपनी ख़ुद की Siri बनाएँ।
किसी भी वॉइस फ़्लो के लिए बिना हाथ का ट्रिगर। प्रति-फ़्रेज़ थ्रेसहोल्ड वाले कस्टम कीवर्ड, डिवाइस पर 5 MB से कम, रियल-टाइम से 26×।
दोनों निरंतर वाणी लेते हैं और पारंपरिक ASR → LLM → TTS टर्न सीमा के बिना वाणी बनाते हैं। टेक्स्ट फिर भी मॉडल के भीतर संरेखित रीजनिंग और कंट्रोल स्ट्रीम के रूप में रह सकता है।
कॉज़ल FastConformer परसेप्शन Nemotron-H के टेक्स्ट और फ़ंक्शन चैनलों को इनपुट देता है। वाणी भाषा मॉडल के हेड से नहीं, बल्कि अलग टेक्स्ट-कंडीशंड EAR-TTS डिकोडर और 22.05 kHz न्यूरल कोडेक से बनती है।
PersonaPlex Moshi वेट्स से शुरू होकर Mimi और Depformer स्ट्रीम में यूज़र ऑडियो, एजेंट टेक्स्ट और एजेंट ऑडियो को साथ मॉडल करता है। यह एक साथ सुनने-बोलने, टेक्स्ट रोल प्रॉम्प्ट और ऑडियो वॉइस प्रॉम्प्ट को सपोर्ट करता है।
BESTOW NVIDIA की पहले की स्ट्रीमिंग SpeechLLM वंशावली को दिखाता है, लेकिन यह वाणी को टेक्स्ट में बदलता है; यह डुप्लेक्स S2S मॉडल नहीं है। Moshi और PersonaPlex मल्टी-स्ट्रीम परिवार का वर्णन करते हैं, जबकि SALM-Duplex कुशल असममित डुप्लेक्स मॉडलिंग का। Full-Duplex-Bench विराम, बैकचैनल, टर्न-टेकिंग और रुकावटों का मूल्यांकन करता है—इन व्यवहारों को RTF नहीं पकड़ता।