VoiceChat 11B
Каузальное восприятие FastConformer подаёт данные в текстовый и функциональный каналы Nemotron-H. Речь создаёт отдельный текст-обусловленный декодер EAR-TTS — не head языковой модели — вместе с нейронным кодеком 22,05 кГц.
Три формы voice-first интерфейсов — нативные полнодуплексные speech-to-speech модели, компонуемый пайплайн wake → VAD → ASR → LLM → TTS под вашим полным контролем, и активация по ключевому слову для бесконтактного входа. Всё на устройстве, никаких облачных API, аудио не покидает устройство.
Готовая диалоговая модель, компонуемый пайплайн с контролем на каждой стадии или лёгкий триггер по ключевому слову. Каждый вариант полностью работает на устройстве.
Нативные модели преобразуют поток с микрофона в речь без классической границы хода ASR → LLM → TTS. Выберите асимметричный стек VoiceChat или потоки семейства Moshi в PersonaPlex.
Ключевое слово → VAD → потоковый ASR → on-device LLM → TTS. Контроль на каждой стадии, прозрачные транскрипты, движки свободно меняются. Соберите свою Siri.
Бесконтактный триггер для любого голосового флоу. Кастомные ключевые фразы с пофразными порогами, меньше 5 МБ на устройстве, в 26× быстрее реального времени.
Обе модели непрерывно принимают речь и генерируют речь без классической границы хода ASR → LLM → TTS. Текст при этом может оставаться внутри модели как согласованный поток рассуждений и управления.
Каузальное восприятие FastConformer подаёт данные в текстовый и функциональный каналы Nemotron-H. Речь создаёт отдельный текст-обусловленный декодер EAR-TTS — не head языковой модели — вместе с нейронным кодеком 22,05 кГц.
PersonaPlex инициализирован весами Moshi и совместно моделирует аудио пользователя, текст агента и аудио агента в потоках Mimi и Depformer. Поддерживаются одновременное слушание и речь, текстовые role-промпты и аудиопромпты голоса.
BESTOW представляет предшествующую стриминговую линию SpeechLLM от NVIDIA, но преобразует речь в текст и не является дуплексной S2S-моделью. Moshi и PersonaPlex описывают многопоточное семейство, а SALM-Duplex — эффективное асимметричное дуплексное моделирование. Full-Duplex-Bench оценивает паузы, короткие реакции, смену хода и перебивания — то, чего не показывает RTF.