VoiceChat 11B
Каузальное восприятие FastConformer подаёт данные в текстовый и функциональный каналы Nemotron-H. Речь создаёт отдельный текст-обусловленный декодер EAR-TTS — не head языковой модели — вместе с нейронным кодеком 22,05 кГц.
Три формы voice-first интерфейсов — нативные полнодуплексные speech-to-speech модели, компонуемый пайплайн wake → VAD → ASR → LLM → TTS под вашим полным контролем, и активация по ключевому слову для бесконтактного входа. Всё на устройстве, никаких облачных API, аудио не покидает устройство.
Готовая диалоговая модель, компонуемый пайплайн с контролем на каждой стадии или лёгкий триггер по ключевому слову. Каждый вариант полностью работает на устройстве.
Нативные модели преобразуют поток с микрофона в речь без классической границы хода ASR → LLM → TTS. Выберите асимметричный стек VoiceChat или потоки семейства Moshi в PersonaPlex.
Ключевое слово → VAD → потоковый ASR → on-device LLM → TTS. Контроль на каждой стадии, прозрачные транскрипты, движки свободно меняются. Соберите свою Siri.
Бесконтактный триггер для любого голосового флоу. Кастомные ключевые фразы с пофразными порогами, меньше 5 МБ на устройстве, в 26× быстрее реального времени.
Обе модели непрерывно принимают речь и генерируют речь без классической границы хода ASR → LLM → TTS. Текст при этом может оставаться внутри модели как согласованный поток рассуждений и управления.
Каузальное восприятие FastConformer подаёт данные в текстовый и функциональный каналы Nemotron-H. Речь создаёт отдельный текст-обусловленный декодер EAR-TTS — не head языковой модели — вместе с нейронным кодеком 22,05 кГц.
PersonaPlex инициализирован весами Moshi и совместно моделирует аудио пользователя, текст агента и аудио агента в потоках Mimi и Depformer. Поддерживаются одновременное слушание и речь, текстовые role-промпты и аудиопромпты голоса.
BESTOW представляет предшествующую стриминговую линию SpeechLLM от NVIDIA, но преобразует речь в текст и не является дуплексной S2S-моделью. Moshi и PersonaPlex описывают многопоточное семейство, а SALM-Duplex — эффективное асимметричное дуплексное моделирование. Full-Duplex-Bench оценивает паузы, короткие реакции, смену хода и перебивания — то, чего не показывает RTF.
Реальная сессия с NVIDIA Nemotron VoiceChat 11B, запущенная локально: речевой ход, перебивание на середине фразы и полный вызов инструмента MCP в Напоминания Apple. RTF 0,92 на M5 Pro, 7,5 ГБ в памяти, и ничего не покидает машину.
Свежая работа над тремя решениями голосового агента: когда подождать, когда заговорить и когда выполнить. Всё это работает на устройстве.
VoiceChat продолжает слушать, пока отвечает, а его function head превращает произнесённый запрос в вызов инструмента по MCP. На Mac он показывает, создаёт и обновляет напоминания Apple, и ничего не покидает компьютер.
Smart Turn v3.2 проверяет, договорил ли человек, прежде чем выполнить запрос, — чтобы «э-э, в пятницу» ещё успело заменить четверг. Модель на 23 языка работает на CoreML и Swift, в C++-рантайме speech-core и на Android, отвечая за несколько миллисекунд на M5 Pro.
На Android речь превращается в реальное действие и произнесённый ответ на одном телефоне: Silero VAD, Parakeet STT, вызовы инструментов FunctionGemma и Pocket TTS — полностью офлайн, в 1,2 ГБ оперативной памяти.