VoiceChat 11B
Nedensel FastConformer algısı Nemotron-H metin ve işlev kanallarını besler. Konuşma, dil modelinin üzerindeki bir head ile değil, ayrı bir metin koşullu EAR-TTS decoder ve 22,05 kHz nöral codec ile üretilir.
Ses öncelikli arayüzlerin üç biçimi — yerel tam çift yönlü speech-to-speech modelleri, tümüyle kontrol ettiğiniz wake → VAD → ASR → LLM → TTS birleşik pipeline’ı ve eller serbest giriş için uyandırma kelimesi. Hepsi cihazda çalışır; bulut API yoktur ve ses cihazdan çıkmaz.
Hazır diyalog modeli, aşama bazında kontrol sunan birleşik pipeline veya ince bir uyandırma kelimesi tetikleyicisi. Her biri tamamen cihazda çalışır.
Yerel modeller, klasik ASR → LLM → TTS tur sınırı olmadan mikrofon sesini konuşma çıktısına aktarır. VoiceChat’in asimetrik stack’ini veya PersonaPlex’in Moshi ailesi akışlarını seçin.
Uyandırma kelimesi → VAD → akışlı ASR → cihazda LLM → TTS. Aşama bazında kontrol, görünür transkript ve serbest engine değişimi. Kendi Siri’nizi kurun.
Her ses akışı için eller serbest tetikleyici. İfade başına eşikli özel anahtar kelimeler, cihazda 5 MB altı, gerçek zamanın 26 katı.
İkisi de sürekli konuşma alıp klasik ASR → LLM → TTS tur sınırı olmadan konuşma üretir. Metin, model içinde hizalanmış düşünme ve kontrol akışı olarak yine bulunabilir.
Nedensel FastConformer algısı Nemotron-H metin ve işlev kanallarını besler. Konuşma, dil modelinin üzerindeki bir head ile değil, ayrı bir metin koşullu EAR-TTS decoder ve 22,05 kHz nöral codec ile üretilir.
PersonaPlex, Moshi ağırlıklarından başlar ve Mimi ile Depformer akışlarında kullanıcı sesini, ajan metnini ve ajan sesini birlikte modeller. Aynı anda dinleme-konuşma, metin rol promptları ve sesli voice promptları destekler.
BESTOW, NVIDIA’nın önceki akışlı SpeechLLM soyunu temsil eder; ancak konuşmayı metne dönüştürür ve duplex bir S2S modeli değildir. Moshi ve PersonaPlex çok akışlı aileyi, SALM-Duplex ise verimli asimetrik duplex modellemeyi açıklar. Full-Duplex-Bench duraklamaları, backchannel tepkilerini, tur almayı ve söz kesmeleri değerlendirir; RTF bu etkileşim davranışlarını ölçmez.
NVIDIA Nemotron VoiceChat 11B modelini yerel olarak çalıştıran gerçek bir oturum: konuşma sırası, cümle ortasında araya girme ve Apple Anımsatıcılar’a tam bir MCP araç çağrısı. M5 Pro üzerinde RTF 0,92, 7,5 GB bellek kullanımı ve hiçbir veri makineden çıkmıyor.