यूज़-केस · कन्वर्सेशनल

आवाज़ अंदर।
आवाज़ बाहर।

वॉइस-फ़र्स्ट इंटरफ़ेस के तीन रूप — नेटिव फ़ुल-डुप्लेक्स speech-to-speech मॉडल, एक कंपोज़ेबल wake → VAD → ASR → LLM → TTS पाइपलाइन जिस पर पूरा नियंत्रण आपका, और बिना हाथ लगाए प्रवेश के लिए वेक-वर्ड एक्टिवेशन। सब ऑन-डिवाइस, कोई क्लाउड API नहीं, ऑडियो डिवाइस से बाहर नहीं।

तीन सब-यूज़-केस

अपने प्रोडक्ट से मेल खाता रूप चुनें।

ड्रॉप-इन डायलॉग मॉडल, प्रति-स्टेज नियंत्रण वाली कंपोज़ेबल पाइपलाइन, या केवल पतला वेक-वर्ड ट्रिगर। हर रूप पूरी तरह डिवाइस पर चलता है।

नेटिव स्पीच-टू-स्पीच

दो मॉडल परिवार, दो डुप्लेक्स डिज़ाइन।

दोनों निरंतर वाणी लेते हैं और पारंपरिक ASR → LLM → TTS टर्न सीमा के बिना वाणी बनाते हैं। टेक्स्ट फिर भी मॉडल के भीतर संरेखित रीजनिंग और कंट्रोल स्ट्रीम के रूप में रह सकता है।

SALM-Duplex वंश · असममित

VoiceChat 11B

कॉज़ल FastConformer परसेप्शन Nemotron-H के टेक्स्ट और फ़ंक्शन चैनलों को इनपुट देता है। वाणी भाषा मॉडल के हेड से नहीं, बल्कि अलग टेक्स्ट-कंडीशंड EAR-TTS डिकोडर और 22.05 kHz न्यूरल कोडेक से बनती है।

आर्किटेक्चर
16 kHz → causal FastConformer
Nemotron-H · text + function
separate EAR-TTS → 22.05 kHz codec
लोकल माप
RTF 0.92–0.94
M5 Pro · 48 GB · Release · protected-head INT5
44.3–46.7 ms first spoken text token · 74.0–76.4 ms first playable audio
76.2–78.6 ms frame p95 · ~8.70 GB peak RSS
Moshi परिवार · मल्टी-स्ट्रीम

PersonaPlex 7B

PersonaPlex Moshi वेट्स से शुरू होकर Mimi और Depformer स्ट्रीम में यूज़र ऑडियो, एजेंट टेक्स्ट और एजेंट ऑडियो को साथ मॉडल करता है। यह एक साथ सुनने-बोलने, टेक्स्ट रोल प्रॉम्प्ट और ऑडियो वॉइस प्रॉम्प्ट को सपोर्ट करता है।

आर्किटेक्चर
Moshi weights
Mimi RVQ + Depformer
user audio ↔ agent text ↔ agent audio
लोकल माप
RTF ~1.4
M2 Max · 8-bit
~112 ms / step · 18 selectable voices
~9.1 GB bundle · ~11 GB peak RAM
RTF, जनरेशन के वास्तविक समय को आउटपुट ऑडियो की अवधि से भाग देने पर मिलता है; 1 से कम होने पर टेस्ट किए गए डिवाइस पर स्ट्रीमिंग लगातार चल सकती है। ये रन अलग-अलग Mac पर हैं, इसलिए मॉडल रैंकिंग नहीं हैं। पहला आउटपुट और फ़्रेम थ्रूपुट वार्म-कम्प्यूट माप हैं, सीखी हुई टर्न-टेकिंग लेटेंसी नहीं।
प्रासंगिक शोध

आर्किटेक्चर वंश और डुप्लेक्स मूल्यांकन।

BESTOW NVIDIA की पहले की स्ट्रीमिंग SpeechLLM वंशावली को दिखाता है, लेकिन यह वाणी को टेक्स्ट में बदलता है; यह डुप्लेक्स S2S मॉडल नहीं है। Moshi और PersonaPlex मल्टी-स्ट्रीम परिवार का वर्णन करते हैं, जबकि SALM-Duplex कुशल असममित डुप्लेक्स मॉडलिंग का। Full-Duplex-Bench विराम, बैकचैनल, टर्न-टेकिंग और रुकावटों का मूल्यांकन करता है—इन व्यवहारों को RTF नहीं पकड़ता।

सेटअप, API, बंडल और बेंचमार्क की तुलना करें
speech voice-chat · रिकॉर्ड किया गया सत्र

MacBook पर फुल-डुप्लेक्स, असली टूल कॉल करते हुए।

NVIDIA Nemotron VoiceChat 11B को स्थानीय रूप से चलाने वाला एक वास्तविक सत्र: एक बोला गया टर्न, वाक्य के बीच में टोकाटाकी, और Apple Reminders में एक पूर्ण MCP टूल कॉल। M5 Pro पर RTF 0.92, 7.5 GB रेजिडेंट, और कुछ भी मशीन से बाहर नहीं जाता।

डिवाइस पर नया

रुकना, बोलना और काम करना — सब लोकल।

वॉइस एजेंट के तीन फैसलों पर हालिया काम: कब रुकना है, कब बोलना है और कब काम करना है। यह सब डिवाइस पर ही चलता है।

टूल कॉल करने वाला फुल-डुप्लेक्स

VoiceChat जवाब देते हुए भी सुनता रहता है, और इसका function head बोले गए अनुरोध को MCP टूल कॉल में बदल देता है। Mac पर यह Apple Reminders को दिखाता, बनाता और अपडेट करता है — कुछ भी डिवाइस से बाहर नहीं जाता।

लेख पढ़ें
बात पूरी होने का इंतज़ार

Smart Turn v3.2 अनुरोध पूरा करने से पहले जाँचता है कि बोलने वाला खत्म कर चुका है या नहीं, ताकि “अं, शुक्रवार” अब भी गुरुवार की जगह ले सके। 23 भाषाओं वाला यह मॉडल CoreML और Swift पर, speech-core के C++ रनटाइम में और Android पर चलता है — M5 Pro पर कुछ ही मिलीसेकंड में।

Smart Turn गाइड
1.2 GB में कमांड लूप

Android पर एक ही फोन में आवाज़ असली डिवाइस एक्शन और बोले गए जवाब में बदल जाती है: Silero VAD, Parakeet STT, FunctionGemma टूल कॉल और Pocket TTS — पूरी तरह ऑफलाइन, 1.2 GB RAM में।

डेमो देखें
और गहराई में पढ़ें

कॉम्पोनेंट गाइड्स।