यूज़-केस · कन्वर्सेशनल

आवाज़ अंदर।
आवाज़ बाहर।

वॉइस-फ़र्स्ट इंटरफ़ेस के तीन रूप — नेटिव फ़ुल-डुप्लेक्स speech-to-speech मॉडल, एक कंपोज़ेबल wake → VAD → ASR → LLM → TTS पाइपलाइन जिस पर पूरा नियंत्रण आपका, और बिना हाथ लगाए प्रवेश के लिए वेक-वर्ड एक्टिवेशन। सब ऑन-डिवाइस, कोई क्लाउड API नहीं, ऑडियो डिवाइस से बाहर नहीं।

तीन सब-यूज़-केस

अपने प्रोडक्ट से मेल खाता रूप चुनें।

ड्रॉप-इन डायलॉग मॉडल, प्रति-स्टेज नियंत्रण वाली कंपोज़ेबल पाइपलाइन, या केवल पतला वेक-वर्ड ट्रिगर। हर रूप पूरी तरह डिवाइस पर चलता है।

नेटिव स्पीच-टू-स्पीच

दो मॉडल परिवार, दो डुप्लेक्स डिज़ाइन।

दोनों निरंतर वाणी लेते हैं और पारंपरिक ASR → LLM → TTS टर्न सीमा के बिना वाणी बनाते हैं। टेक्स्ट फिर भी मॉडल के भीतर संरेखित रीजनिंग और कंट्रोल स्ट्रीम के रूप में रह सकता है।

SALM-Duplex वंश · असममित

VoiceChat 11B

कॉज़ल FastConformer परसेप्शन Nemotron-H के टेक्स्ट और फ़ंक्शन चैनलों को इनपुट देता है। वाणी भाषा मॉडल के हेड से नहीं, बल्कि अलग टेक्स्ट-कंडीशंड EAR-TTS डिकोडर और 22.05 kHz न्यूरल कोडेक से बनती है।

आर्किटेक्चर
16 kHz → causal FastConformer
Nemotron-H · text + function
separate EAR-TTS → 22.05 kHz codec
लोकल माप
RTF 0.92–0.94
M5 Pro · 48 GB · Release · protected-head INT5
44.3–46.7 ms first spoken text token · 74.0–76.4 ms first playable audio
76.2–78.6 ms frame p95 · ~8.70 GB peak RSS
Moshi परिवार · मल्टी-स्ट्रीम

PersonaPlex 7B

PersonaPlex Moshi वेट्स से शुरू होकर Mimi और Depformer स्ट्रीम में यूज़र ऑडियो, एजेंट टेक्स्ट और एजेंट ऑडियो को साथ मॉडल करता है। यह एक साथ सुनने-बोलने, टेक्स्ट रोल प्रॉम्प्ट और ऑडियो वॉइस प्रॉम्प्ट को सपोर्ट करता है।

आर्किटेक्चर
Moshi weights
Mimi RVQ + Depformer
user audio ↔ agent text ↔ agent audio
लोकल माप
RTF ~1.4
M2 Max · 8-bit
~112 ms / step · 18 selectable voices
~9.1 GB bundle · ~11 GB peak RAM
RTF, जनरेशन के वास्तविक समय को आउटपुट ऑडियो की अवधि से भाग देने पर मिलता है; 1 से कम होने पर टेस्ट किए गए डिवाइस पर स्ट्रीमिंग लगातार चल सकती है। ये रन अलग-अलग Mac पर हैं, इसलिए मॉडल रैंकिंग नहीं हैं। पहला आउटपुट और फ़्रेम थ्रूपुट वार्म-कम्प्यूट माप हैं, सीखी हुई टर्न-टेकिंग लेटेंसी नहीं।
प्रासंगिक शोध

आर्किटेक्चर वंश और डुप्लेक्स मूल्यांकन।

BESTOW NVIDIA की पहले की स्ट्रीमिंग SpeechLLM वंशावली को दिखाता है, लेकिन यह वाणी को टेक्स्ट में बदलता है; यह डुप्लेक्स S2S मॉडल नहीं है। Moshi और PersonaPlex मल्टी-स्ट्रीम परिवार का वर्णन करते हैं, जबकि SALM-Duplex कुशल असममित डुप्लेक्स मॉडलिंग का। Full-Duplex-Bench विराम, बैकचैनल, टर्न-टेकिंग और रुकावटों का मूल्यांकन करता है—इन व्यवहारों को RTF नहीं पकड़ता।

सेटअप, API, बंडल और बेंचमार्क की तुलना करें
speech voice-chat · रिकॉर्ड किया गया सत्र

MacBook पर फुल-डुप्लेक्स, असली टूल कॉल करते हुए।

NVIDIA Nemotron VoiceChat 11B को स्थानीय रूप से चलाने वाला एक वास्तविक सत्र: एक बोला गया टर्न, वाक्य के बीच में टोकाटाकी, और Apple Reminders में एक पूर्ण MCP टूल कॉल। M5 Pro पर RTF 0.92, 7.5 GB रेजिडेंट, और कुछ भी मशीन से बाहर नहीं जाता।

और गहराई में पढ़ें

कॉम्पोनेंट गाइड्स।