Use Case · Konversation

Sprache rein.
Sprache raus.

Drei Ausprägungen von Voice-First-Interfaces — native Full-Duplex-Speech-to-Speech-Modelle, eine kompositorische wake → VAD → ASR → LLM → TTS-Pipeline, die du vollständig kontrollierst, und Wake-Word-Aktivierung für freihändigen Einstieg. Alles auf dem Gerät, keine Cloud-APIs, kein Audio verlässt das Gerät.

Drei Sub-Use-Cases

Wähle die Form, die zu deinem Produkt passt.

Drop-in-Dialogmodell, kompositorische Pipeline mit Kontrolle pro Stufe oder ein schlanker Wake-Word-Trigger. Jede Variante läuft vollständig auf dem Gerät.

Natives Speech-to-Speech

Zwei Modellfamilien, zwei Duplex-Designs.

Beide nehmen kontinuierliche Sprache an und erzeugen Sprache ohne die klassische ASR → LLM → TTS-Turngrenze. Text kann im Modell weiterhin als ausgerichteter Denk- und Steuerungsstrom vorkommen.

SALM-Duplex-Linie · asymmetrisch

VoiceChat 11B

Kausale FastConformer-Wahrnehmung speist die Text- und Funktionskanäle von Nemotron-H. Sprache wird durch einen separaten, textkonditionierten EAR-TTS-Decoder — nicht durch einen Head auf dem Sprachmodell — und einen neuronalen 22,05-kHz-Codec erzeugt.

Architektur
16 kHz → causal FastConformer
Nemotron-H · text + function
separate EAR-TTS → 22.05 kHz codec
Lokal gemessen
RTF 0.92–0.94
M5 Pro · 48 GB · Release · protected-head INT5
44.3–46.7 ms first spoken text token · 74.0–76.4 ms first playable audio
76.2–78.6 ms frame p95 · ~8.70 GB peak RSS
Moshi-Familie · Multi-Stream

PersonaPlex 7B

PersonaPlex startet mit Moshi-Gewichten und modelliert Nutzeraudio, Agententext und Agentenaudio gemeinsam über Mimi- und Depformer-Streams. Es unterstützt gleichzeitiges Hören und Sprechen sowie textbasierte Rollen- und audiobasierte Stimmen-Prompts.

Architektur
Moshi weights
Mimi RVQ + Depformer
user audio ↔ agent text ↔ agent audio
Lokal gemessen
RTF ~1.4
M2 Max · 8-bit
~112 ms / step · 18 selectable voices
~9.1 GB bundle · ~11 GB peak RAM
RTF ist die Generierungszeit geteilt durch die Dauer des Ausgabesignals; unter 1 kann Streaming auf dem getesteten Gerät aufrechterhalten werden. Die Läufe verwenden verschiedene Macs und sind daher kein Modellranking. Erste Ausgabe und Frame-Durchsatz sind Warm-Compute-Werte, keine erlernte Turn-Taking-Latenz.
Relevante Forschung

Architekturlinie und Duplex-Evaluation.

BESTOW steht für NVIDIAs vorgelagerte, streambare SpeechLLM-Linie, bildet Sprache jedoch auf Text ab und ist kein Duplex-S2S-Modell. Moshi und PersonaPlex beschreiben die Multi-Stream-Familie, SALM-Duplex die effiziente asymmetrische Duplex-Modellierung. Full-Duplex-Bench bewertet Pausen, Backchannels, Sprecherwechsel und Unterbrechungen — Interaktionsverhalten, das RTF nicht erfasst.

Setup, APIs, Bundles und Benchmarks vergleichen
Vertiefende Lektüre

Komponenten-Guides.