यूज़-केस · कन्वर्सेशनल

आवाज़ अंदर।
आवाज़ बाहर।

वॉइस-फ़र्स्ट इंटरफ़ेस के तीन रूप — नेटिव फ़ुल-डुप्लेक्स speech-to-speech मॉडल, एक कंपोज़ेबल wake → VAD → ASR → LLM → TTS पाइपलाइन जिस पर पूरा नियंत्रण आपका, और बिना हाथ लगाए प्रवेश के लिए वेक-वर्ड एक्टिवेशन। सब ऑन-डिवाइस, कोई क्लाउड API नहीं, ऑडियो डिवाइस से बाहर नहीं।

तीन सब-यूज़-केस

अपने प्रोडक्ट से मेल खाता रूप चुनें।

ड्रॉप-इन डायलॉग मॉडल, प्रति-स्टेज नियंत्रण वाली कंपोज़ेबल पाइपलाइन, या केवल पतला वेक-वर्ड ट्रिगर। हर रूप पूरी तरह डिवाइस पर चलता है।

नेटिव स्पीच-टू-स्पीच

दो मॉडल परिवार, दो डुप्लेक्स डिज़ाइन।

दोनों निरंतर वाणी लेते हैं और पारंपरिक ASR → LLM → TTS टर्न सीमा के बिना वाणी बनाते हैं। टेक्स्ट फिर भी मॉडल के भीतर संरेखित रीजनिंग और कंट्रोल स्ट्रीम के रूप में रह सकता है।

SALM-Duplex वंश · असममित

VoiceChat 11B

कॉज़ल FastConformer परसेप्शन Nemotron-H के टेक्स्ट और फ़ंक्शन चैनलों को इनपुट देता है। वाणी भाषा मॉडल के हेड से नहीं, बल्कि अलग टेक्स्ट-कंडीशंड EAR-TTS डिकोडर और 22.05 kHz न्यूरल कोडेक से बनती है।

आर्किटेक्चर
16 kHz → causal FastConformer
Nemotron-H · text + function
separate EAR-TTS → 22.05 kHz codec
लोकल माप
RTF 0.92–0.94
M5 Pro · 48 GB · Release · protected-head INT5
44.3–46.7 ms first spoken text token · 74.0–76.4 ms first playable audio
76.2–78.6 ms frame p95 · ~8.70 GB peak RSS
Moshi परिवार · मल्टी-स्ट्रीम

PersonaPlex 7B

PersonaPlex Moshi वेट्स से शुरू होकर Mimi और Depformer स्ट्रीम में यूज़र ऑडियो, एजेंट टेक्स्ट और एजेंट ऑडियो को साथ मॉडल करता है। यह एक साथ सुनने-बोलने, टेक्स्ट रोल प्रॉम्प्ट और ऑडियो वॉइस प्रॉम्प्ट को सपोर्ट करता है।

आर्किटेक्चर
Moshi weights
Mimi RVQ + Depformer
user audio ↔ agent text ↔ agent audio
लोकल माप
RTF ~1.4
M2 Max · 8-bit
~112 ms / step · 18 selectable voices
~9.1 GB bundle · ~11 GB peak RAM
RTF, जनरेशन के वास्तविक समय को आउटपुट ऑडियो की अवधि से भाग देने पर मिलता है; 1 से कम होने पर टेस्ट किए गए डिवाइस पर स्ट्रीमिंग लगातार चल सकती है। ये रन अलग-अलग Mac पर हैं, इसलिए मॉडल रैंकिंग नहीं हैं। पहला आउटपुट और फ़्रेम थ्रूपुट वार्म-कम्प्यूट माप हैं, सीखी हुई टर्न-टेकिंग लेटेंसी नहीं।
प्रासंगिक शोध

आर्किटेक्चर वंश और डुप्लेक्स मूल्यांकन।

BESTOW NVIDIA की पहले की स्ट्रीमिंग SpeechLLM वंशावली को दिखाता है, लेकिन यह वाणी को टेक्स्ट में बदलता है; यह डुप्लेक्स S2S मॉडल नहीं है। Moshi और PersonaPlex मल्टी-स्ट्रीम परिवार का वर्णन करते हैं, जबकि SALM-Duplex कुशल असममित डुप्लेक्स मॉडलिंग का। Full-Duplex-Bench विराम, बैकचैनल, टर्न-टेकिंग और रुकावटों का मूल्यांकन करता है—इन व्यवहारों को RTF नहीं पकड़ता।

सेटअप, API, बंडल और बेंचमार्क की तुलना करें
और गहराई में पढ़ें

कॉम्पोनेंट गाइड्स।