Caso de uso · Conversacional

Voz entra.
Voz sale.

Tres formas de interfaces voice-first — modelos speech-to-speech full-duplex nativos, un pipeline compositivo wake → VAD → ASR → LLM → TTS que controlas por completo, y activación por palabra clave para entrada manos libres. Todo en el dispositivo, sin APIs en la nube, sin audio saliendo del dispositivo.

Tres subcasos de uso

Elige la forma que encaja con tu producto.

Modelo de diálogo plug-and-play, pipeline compositivo con control por etapa, o un disparador delgado por palabra clave. Cada uno corre íntegramente en el dispositivo.

Speech-to-speech nativo

Dos familias de modelos, dos diseños dúplex.

Ambas reciben voz continua y generan voz sin el límite de turno clásico ASR → LLM → TTS. El texto puede seguir existiendo dentro del modelo como flujo alineado de razonamiento y control.

Linaje SALM-Duplex · asimétrico

VoiceChat 11B

La percepción FastConformer causal alimenta los canales de texto y funciones de Nemotron-H. La voz se genera con un decodificador EAR-TTS independiente condicionado por texto — no con un cabezal sobre el modelo de lenguaje — y un códec neuronal de 22,05 kHz.

Arquitectura
16 kHz → causal FastConformer
Nemotron-H · text + function
separate EAR-TTS → 22.05 kHz codec
Medición local
RTF 0.92–0.94
M5 Pro · 48 GB · Release · protected-head INT5
44.3–46.7 ms first spoken text token · 74.0–76.4 ms first playable audio
76.2–78.6 ms frame p95 · ~8.70 GB peak RSS
Familia Moshi · multiflujo

PersonaPlex 7B

PersonaPlex parte de los pesos de Moshi y modela conjuntamente el audio del usuario, el texto del agente y el audio del agente mediante flujos Mimi y Depformer. Permite escuchar y hablar a la vez, prompts de rol en texto y prompts de voz en audio.

Arquitectura
Moshi weights
Mimi RVQ + Depformer
user audio ↔ agent text ↔ agent audio
Medición local
RTF ~1.4
M2 Max · 8-bit
~112 ms / step · 18 selectable voices
~9.1 GB bundle · ~11 GB peak RAM
El RTF es el tiempo de generación de reloj dividido por la duración del audio de salida; por debajo de 1 puede sostener streaming en el dispositivo probado. Las pruebas usan Macs distintos, por lo que no son un ranking de modelos. La primera salida y el rendimiento por trama son medidas de cómputo en caliente, no latencia de turnos aprendida.
Investigación relevante

Linaje arquitectónico y evaluación dúplex.

BESTOW representa el linaje anterior de SpeechLLM con streaming de NVIDIA, pero convierte voz en texto; no es un modelo S2S dúplex. Moshi y PersonaPlex describen la familia multiflujo, mientras SALM-Duplex describe un modelado dúplex asimétrico eficiente. Full-Duplex-Bench evalúa pausas, respuestas breves, turnos e interrupciones: comportamientos de interacción que el RTF no captura.

Comparar configuración, API, bundles y benchmarks
Lectura adicional

Guías de componentes.