Kullanım durumu · Sohbet

Ses girer.
Ses çıkar.

Ses öncelikli arayüzlerin üç biçimi — yerel tam çift yönlü speech-to-speech modelleri, tümüyle kontrol ettiğiniz wake → VAD → ASR → LLM → TTS birleşik pipeline’ı ve eller serbest giriş için uyandırma kelimesi. Hepsi cihazda çalışır; bulut API yoktur ve ses cihazdan çıkmaz.

Üç alt kullanım

Ürününüze uyan biçimi seçin.

Hazır diyalog modeli, aşama bazında kontrol sunan birleşik pipeline veya ince bir uyandırma kelimesi tetikleyicisi. Her biri tamamen cihazda çalışır.

Yerel speech-to-speech

İki model ailesi, iki duplex tasarımı.

İkisi de sürekli konuşma alıp klasik ASR → LLM → TTS tur sınırı olmadan konuşma üretir. Metin, model içinde hizalanmış düşünme ve kontrol akışı olarak yine bulunabilir.

SALM-Duplex soyu · asimetrik

VoiceChat 11B

Nedensel FastConformer algısı Nemotron-H metin ve işlev kanallarını besler. Konuşma, dil modelinin üzerindeki bir head ile değil, ayrı bir metin koşullu EAR-TTS decoder ve 22,05 kHz nöral codec ile üretilir.

Mimari
16 kHz → causal FastConformer
Nemotron-H · text + function
separate EAR-TTS → 22.05 kHz codec
Yerel ölçüm
RTF 0.92–0.94
M5 Pro · 48 GB · Release · protected-head INT5
44.3–46.7 ms first spoken text token · 74.0–76.4 ms first playable audio
76.2–78.6 ms frame p95 · ~8.70 GB peak RSS
Moshi ailesi · çok akışlı

PersonaPlex 7B

PersonaPlex, Moshi ağırlıklarından başlar ve Mimi ile Depformer akışlarında kullanıcı sesini, ajan metnini ve ajan sesini birlikte modeller. Aynı anda dinleme-konuşma, metin rol promptları ve sesli voice promptları destekler.

Mimari
Moshi weights
Mimi RVQ + Depformer
user audio ↔ agent text ↔ agent audio
Yerel ölçüm
RTF ~1.4
M2 Max · 8-bit
~112 ms / step · 18 selectable voices
~9.1 GB bundle · ~11 GB peak RAM
RTF, gerçek üretim süresinin çıktı sesinin süresine oranıdır; 1’in altında test edilen cihazda akış sürdürülebilir. Ölçümler farklı Mac’lerde yapıldığı için bir model sıralaması değildir. İlk çıktı ve frame throughput sıcak hesaplama değerleridir, öğrenilmiş tur alma gecikmesi değildir.
İlgili araştırma

Mimari soyu ve duplex değerlendirmesi.

BESTOW, NVIDIA’nın önceki akışlı SpeechLLM soyunu temsil eder; ancak konuşmayı metne dönüştürür ve duplex bir S2S modeli değildir. Moshi ve PersonaPlex çok akışlı aileyi, SALM-Duplex ise verimli asimetrik duplex modellemeyi açıklar. Full-Duplex-Bench duraklamaları, backchannel tepkilerini, tur almayı ve söz kesmeleri değerlendirir; RTF bu etkileşim davranışlarını ölçmez.

Kurulum, API, bundle ve benchmarkları karşılaştır
speech voice-chat · kayıtlı oturum

MacBook üzerinde tam çift yönlü, gerçek araç çağrılarıyla.

NVIDIA Nemotron VoiceChat 11B modelini yerel olarak çalıştıran gerçek bir oturum: konuşma sırası, cümle ortasında araya girme ve Apple Anımsatıcılar’a tam bir MCP araç çağrısı. M5 Pro üzerinde RTF 0,92, 7,5 GB bellek kullanımı ve hiçbir veri makineden çıkmıyor.

Daha fazla bilgi

Bileşen rehberleri.