用例 · 对话式

声音进。
声音出。

三种以语音为先的界面形态 —— 原生全双工 speech-to-speech 模型、一条由你完全掌控的 wake → VAD → ASR → LLM → TTS 可组合流水线,以及用于免手操作启动的唤醒词激活。全部端侧运行,无云端 API,音频不离开设备。

三个子用例

挑选最契合你产品的形态。

即插即用的对话模型、可逐级控制的可组合流水线,或一个轻量的唤醒词触发器。每一种都完全在设备端运行。

原生语音到语音

两个模型家族,两种双工设计。

两者都持续接收语音并生成语音,不经过传统 ASR → LLM → TTS 的话轮边界。文本仍可在模型内部作为对齐的推理与控制流存在。

SALM-Duplex 脉络 · 非对称

VoiceChat 11B

因果 FastConformer 感知为 Nemotron-H 的文本与函数通道提供输入。语音由独立的文本条件 EAR-TTS 解码器生成——它不是语言模型上的输出头——再经 22.05 kHz 神经音频编解码器输出。

架构
16 kHz → causal FastConformer
Nemotron-H · text + function
separate EAR-TTS → 22.05 kHz codec
本地实测
RTF 0.92–0.94
M5 Pro · 48 GB · Release · protected-head INT5
44.3–46.7 ms first spoken text token · 74.0–76.4 ms first playable audio
76.2–78.6 ms frame p95 · ~8.70 GB peak RSS
Moshi 家族 · 多流

PersonaPlex 7B

PersonaPlex 从 Moshi 权重初始化,并通过 Mimi 与 Depformer 流联合建模用户音频、代理文本和代理音频。它支持同时听说、文本角色提示和音频音色提示。

架构
Moshi weights
Mimi RVQ + Depformer
user audio ↔ agent text ↔ agent audio
本地实测
RTF ~1.4
M2 Max · 8-bit
~112 ms / step · 18 selectable voices
~9.1 GB bundle · ~11 GB peak RAM
RTF 是生成耗时除以输出音频时长;低于 1 才能在受测设备上持续流式运行。两组测试使用不同的 Mac,因此不能据此给模型排名。首个输出与帧吞吐量是热态计算数据,不是模型学到的话轮切换延迟。
相关研究

架构脉络与双工评测。

BESTOW 代表 NVIDIA 较早的可流式 SpeechLLM 路线,但它将语音映射为文本,并非双工 S2S 模型。Moshi 与 PersonaPlex 描述多流家族;SALM-Duplex 描述高效的非对称双工建模。Full-Duplex-Bench 评估停顿、回应信号、话轮切换和打断——这些交互行为无法由 RTF 反映。

比较设置、API、模型包与基准
深入阅读

组件指南。