Кейс · Диалоговый

Голос на входе.
Голос на выходе.

Три формы voice-first интерфейсов — нативные полнодуплексные speech-to-speech модели, компонуемый пайплайн wake → VAD → ASR → LLM → TTS под вашим полным контролем, и активация по ключевому слову для бесконтактного входа. Всё на устройстве, никаких облачных API, аудио не покидает устройство.

Три подкейса

Выберите форму под ваш продукт.

Готовая диалоговая модель, компонуемый пайплайн с контролем на каждой стадии или лёгкий триггер по ключевому слову. Каждый вариант полностью работает на устройстве.

Нативный speech-to-speech

Два семейства моделей, две дуплексные архитектуры.

Обе модели непрерывно принимают речь и генерируют речь без классической границы хода ASR → LLM → TTS. Текст при этом может оставаться внутри модели как согласованный поток рассуждений и управления.

Линия SALM-Duplex · асимметричная

VoiceChat 11B

Каузальное восприятие FastConformer подаёт данные в текстовый и функциональный каналы Nemotron-H. Речь создаёт отдельный текст-обусловленный декодер EAR-TTS — не head языковой модели — вместе с нейронным кодеком 22,05 кГц.

Архитектура
16 kHz → causal FastConformer
Nemotron-H · text + function
separate EAR-TTS → 22.05 kHz codec
Локальное измерение
RTF 0.92–0.94
M5 Pro · 48 GB · Release · protected-head INT5
44.3–46.7 ms first spoken text token · 74.0–76.4 ms first playable audio
76.2–78.6 ms frame p95 · ~8.70 GB peak RSS
Семейство Moshi · несколько потоков

PersonaPlex 7B

PersonaPlex инициализирован весами Moshi и совместно моделирует аудио пользователя, текст агента и аудио агента в потоках Mimi и Depformer. Поддерживаются одновременное слушание и речь, текстовые role-промпты и аудиопромпты голоса.

Архитектура
Moshi weights
Mimi RVQ + Depformer
user audio ↔ agent text ↔ agent audio
Локальное измерение
RTF ~1.4
M2 Max · 8-bit
~112 ms / step · 18 selectable voices
~9.1 GB bundle · ~11 GB peak RAM
RTF — отношение реального времени генерации к длительности выходного аудио; значение ниже 1 позволяет поддерживать стриминг на протестированном устройстве. Запуски выполнены на разных Mac и не являются рейтингом моделей. Первый вывод и пропускная способность кадров — прогретые вычислительные метрики, а не выученная задержка смены хода.
Связанные исследования

Происхождение архитектур и оценка дуплекса.

BESTOW представляет предшествующую стриминговую линию SpeechLLM от NVIDIA, но преобразует речь в текст и не является дуплексной S2S-моделью. Moshi и PersonaPlex описывают многопоточное семейство, а SALM-Duplex — эффективное асимметричное дуплексное моделирование. Full-Duplex-Bench оценивает паузы, короткие реакции, смену хода и перебивания — то, чего не показывает RTF.

Сравнить настройку, API, бандлы и бенчмарки
Глубже

Гайды по компонентам.