VoiceChat 11B
因果 FastConformer 感知为 Nemotron-H 的文本与函数通道提供输入。语音由独立的文本条件 EAR-TTS 解码器生成——它不是语言模型上的输出头——再经 22.05 kHz 神经音频编解码器输出。
三种以语音为先的界面形态 —— 原生全双工 speech-to-speech 模型、一条由你完全掌控的 wake → VAD → ASR → LLM → TTS 可组合流水线,以及用于免手操作启动的唤醒词激活。全部端侧运行,无云端 API,音频不离开设备。
即插即用的对话模型、可逐级控制的可组合流水线,或一个轻量的唤醒词触发器。每一种都完全在设备端运行。
两者都持续接收语音并生成语音,不经过传统 ASR → LLM → TTS 的话轮边界。文本仍可在模型内部作为对齐的推理与控制流存在。
因果 FastConformer 感知为 Nemotron-H 的文本与函数通道提供输入。语音由独立的文本条件 EAR-TTS 解码器生成——它不是语言模型上的输出头——再经 22.05 kHz 神经音频编解码器输出。
PersonaPlex 从 Moshi 权重初始化,并通过 Mimi 与 Depformer 流联合建模用户音频、代理文本和代理音频。它支持同时听说、文本角色提示和音频音色提示。
BESTOW 代表 NVIDIA 较早的可流式 SpeechLLM 路线,但它将语音映射为文本,并非双工 S2S 模型。Moshi 与 PersonaPlex 描述多流家族;SALM-Duplex 描述高效的非对称双工建模。Full-Duplex-Bench 评估停顿、回应信号、话轮切换和打断——这些交互行为无法由 RTF 反映。