Caso de uso · Conversacional

Voz entra.
Voz sai.

Três formas de interfaces voice-first — modelos speech-to-speech full-duplex nativos, um pipeline composável wake → VAD → ASR → LLM → TTS sob seu controle total, e ativação por palavra-chave para entrada mãos-livres. Tudo no dispositivo, sem APIs na nuvem, sem áudio saindo do dispositivo.

Três subcasos de uso

Escolha a forma que combina com seu produto.

Modelo de diálogo drop-in, pipeline composável com controle por etapa, ou um gatilho enxuto por palavra-chave. Cada um roda inteiramente no dispositivo.

Speech-to-speech nativo

Duas famílias de modelos, dois desenhos duplex.

Ambas recebem fala contínua e geram fala sem a fronteira de turno clássica ASR → LLM → TTS. O texto ainda pode existir dentro do modelo como fluxo alinhado de raciocínio e controle.

Linhagem SALM-Duplex · assimétrica

VoiceChat 11B

A percepção FastConformer causal alimenta os canais de texto e função do Nemotron-H. A fala é produzida por um decoder EAR-TTS separado e condicionado por texto — não por uma head no modelo de linguagem — e um codec neural de 22,05 kHz.

Arquitetura
16 kHz → causal FastConformer
Nemotron-H · text + function
separate EAR-TTS → 22.05 kHz codec
Medição local
RTF 0.92–0.94
M5 Pro · 48 GB · Release · protected-head INT5
44.3–46.7 ms first spoken text token · 74.0–76.4 ms first playable audio
76.2–78.6 ms frame p95 · ~8.70 GB peak RSS
Família Moshi · multi-stream

PersonaPlex 7B

O PersonaPlex parte dos pesos do Moshi e modela em conjunto o áudio do usuário, o texto do agente e o áudio do agente por streams Mimi e Depformer. Ele permite ouvir e falar ao mesmo tempo, com prompts de papel em texto e prompts de voz em áudio.

Arquitetura
Moshi weights
Mimi RVQ + Depformer
user audio ↔ agent text ↔ agent audio
Medição local
RTF ~1.4
M2 Max · 8-bit
~112 ms / step · 18 selectable voices
~9.1 GB bundle · ~11 GB peak RAM
RTF é o tempo de geração de relógio dividido pela duração do áudio de saída; abaixo de 1, o streaming pode ser sustentado no dispositivo testado. Os testes usam Macs diferentes e não formam um ranking de modelos. Primeira saída e throughput por frame são medições de computação aquecida, não latência aprendida de troca de turno.
Pesquisa relevante

Linhagem de arquitetura e avaliação duplex.

BESTOW representa a linhagem anterior de SpeechLLM com streaming da NVIDIA, mas converte fala em texto; não é um modelo S2S duplex. Moshi e PersonaPlex descrevem a família multi-stream, enquanto SALM-Duplex descreve modelagem duplex assimétrica eficiente. Full-Duplex-Bench avalia pausas, backchannels, troca de turno e interrupções — comportamentos que o RTF não captura.

Comparar configuração, APIs, bundles e benchmarks
Leitura adicional

Guias dos componentes.