VoiceChat 11B
인과 FastConformer 인식이 Nemotron-H 텍스트·함수 채널에 입력됩니다. 음성은 언어 모델의 헤드가 아니라 별도의 텍스트 조건부 EAR-TTS 디코더와 22.05 kHz 신경 코덱으로 생성됩니다.
음성 우선 인터페이스의 세 가지 형태 —— 네이티브 풀듀플렉스 speech-to-speech 모델, 단계마다 완전한 제어가 가능한 wake → VAD → ASR → LLM → TTS 컴포저블 파이프라인, 그리고 핸즈프리 진입용 웨이크 워드 활성화. 모두 온디바이스, 클라우드 API 없음, 오디오는 기기 밖으로 나가지 않음.
드롭인 대화 모델, 단계별 제어가 가능한 컴포저블 파이프라인, 또는 가벼운 웨이크 워드 트리거. 모두 전적으로 온디바이스에서 동작합니다.
네이티브 모델은 전통적인 ASR → LLM → TTS 턴 경계 없이 마이크 오디오를 음성 출력으로 스트리밍합니다. VoiceChat의 비대칭 스택 또는 PersonaPlex의 Moshi 계열 멀티스트림을 선택할 수 있습니다.
웨이크 워드 → VAD → 스트리밍 ASR → 온디바이스 LLM → TTS. 단계마다 제어, 전사 가시성, 엔진 자유 교체. 나만의 Siri를 만드세요.
어떤 음성 플로우든 핸즈프리로 트리거. 문구별 임계값을 가진 커스텀 키워드, 온디바이스 5 MB 미만, 실시간 대비 26배.
두 모델 모두 연속 음성을 받아 전통적인 ASR → LLM → TTS 턴 경계 없이 음성을 생성합니다. 텍스트는 정렬된 추론·제어 스트림으로 모델 내부에 남을 수 있습니다.
인과 FastConformer 인식이 Nemotron-H 텍스트·함수 채널에 입력됩니다. 음성은 언어 모델의 헤드가 아니라 별도의 텍스트 조건부 EAR-TTS 디코더와 22.05 kHz 신경 코덱으로 생성됩니다.
PersonaPlex는 Moshi 가중치에서 시작해 Mimi와 Depformer 스트림으로 사용자 오디오, 에이전트 텍스트, 에이전트 오디오를 공동 모델링합니다. 동시 듣기·말하기, 텍스트 역할 프롬프트, 오디오 음성 프롬프트를 지원합니다.
BESTOW는 NVIDIA의 선행 스트리밍 SpeechLLM 계보이지만 음성을 텍스트로 변환하며 듀플렉스 S2S 모델은 아닙니다. Moshi와 PersonaPlex는 멀티스트림 계열을, SALM-Duplex는 효율적인 비대칭 듀플렉스 모델링을 설명합니다. Full-Duplex-Bench는 RTF가 포착하지 못하는 일시 정지, 백채널, 턴테이킹, 끼어들기를 평가합니다.
NVIDIA Nemotron VoiceChat 11B를 로컬에서 실행한 실제 세션: 음성 턴, 문장 중간 끼어들기, 그리고 Apple 미리 알림으로 이어지는 완전한 MCP 도구 호출. M5 Pro에서 RTF 0.92, 상주 메모리 7.5 GB, 어떤 데이터도 기기를 벗어나지 않습니다.
음성 에이전트가 내리는 세 가지 결정, 즉 언제 기다리고 언제 말하며 언제 실행할지에 대한 최근 작업입니다. 모두 기기에서 동작합니다.
VoiceChat은 답하는 동안에도 계속 듣고, function head가 음성 요청을 MCP 도구 호출로 바꿉니다. Mac에서는 Apple 미리 알림을 조회·생성·수정하며, 아무것도 기기를 떠나지 않습니다.
Smart Turn v3.2는 요청을 확정하기 전에 사용자가 말을 마쳤는지 확인합니다. 덕분에 “어, 금요일”이 목요일을 대체할 수 있습니다. 23개 언어 모델이 CoreML과 Swift, speech-core의 C++ 런타임, Android에서 동작하며 M5 Pro에서는 몇 밀리초면 됩니다.
Android에서는 한 대의 기기에서 음성이 실제 동작과 음성 응답으로 이어집니다. Silero VAD, Parakeet STT, FunctionGemma 도구 호출, Pocket TTS를 사용해 완전 오프라인으로 1.2 GB RAM 안에서 실행됩니다.