Cas d’usage · Conversationnel

Voix en entrée.
Voix en sortie.

Trois formes d’interfaces voice-first — des modèles speech-to-speech full-duplex natifs, un pipeline composable wake → VAD → ASR → LLM → TTS que vous contrôlez entièrement, et une activation par mot-clé pour une entrée mains libres. Tout sur l’appareil, aucune API cloud, aucun audio ne quitte l’appareil.

Trois sous-cas d’usage

Choisissez la forme qui colle à votre produit.

Modèle de dialogue clé en main, pipeline composable avec contrôle par étape, ou simple déclencheur par mot-clé. Chaque option tourne entièrement sur l’appareil.

Speech-to-speech natif

Deux familles de modèles, deux conceptions duplex.

Toutes deux reçoivent la parole en continu et génèrent de la parole sans frontière de tour ASR → LLM → TTS classique. Le texte peut néanmoins subsister dans le modèle comme flux aligné de raisonnement et de contrôle.

Lignée SALM-Duplex · asymétrique

VoiceChat 11B

La perception FastConformer causale alimente les canaux texte et fonction de Nemotron-H. La parole est produite par un décodeur EAR-TTS séparé et conditionné par le texte — pas par une tête sur le modèle de langage — puis par un codec neuronal à 22,05 kHz.

Architecture
16 kHz → causal FastConformer
Nemotron-H · text + function
separate EAR-TTS → 22.05 kHz codec
Mesure locale
RTF 0.92–0.94
M5 Pro · 48 GB · Release · protected-head INT5
44.3–46.7 ms first spoken text token · 74.0–76.4 ms first playable audio
76.2–78.6 ms frame p95 · ~8.70 GB peak RSS
Famille Moshi · multi-flux

PersonaPlex 7B

PersonaPlex part des poids de Moshi et modélise conjointement l’audio utilisateur, le texte agent et l’audio agent via les flux Mimi et Depformer. Il permet d’écouter et parler simultanément, avec prompts de rôle textuels et prompts de voix audio.

Architecture
Moshi weights
Mimi RVQ + Depformer
user audio ↔ agent text ↔ agent audio
Mesure locale
RTF ~1.4
M2 Max · 8-bit
~112 ms / step · 18 selectable voices
~9.1 GB bundle · ~11 GB peak RAM
Le RTF est le temps de génération réel divisé par la durée de l’audio produit ; sous 1, le streaming peut être soutenu sur l’appareil testé. Les essais utilisent des Mac différents et ne constituent donc pas un classement des modèles. Première sortie et débit par trame mesurent le calcul à chaud, pas la latence de prise de tour apprise.
Recherche pertinente

Filiation des architectures et évaluation duplex.

BESTOW représente la lignée antérieure des SpeechLLM streamables de NVIDIA, mais transforme la parole en texte : ce n’est pas un modèle S2S duplex. Moshi et PersonaPlex décrivent la famille multi-flux, tandis que SALM-Duplex décrit une modélisation duplex asymétrique efficace. Full-Duplex-Bench évalue pauses, signaux de retour, tours de parole et interruptions — des comportements que le RTF ne mesure pas.

Comparer installation, API, bundles et benchmarks
Pour aller plus loin

Guides des composants.