VoiceChat 11B
인과 FastConformer 인식이 Nemotron-H 텍스트·함수 채널에 입력됩니다. 음성은 언어 모델의 헤드가 아니라 별도의 텍스트 조건부 EAR-TTS 디코더와 22.05 kHz 신경 코덱으로 생성됩니다.
음성 우선 인터페이스의 세 가지 형태 —— 네이티브 풀듀플렉스 speech-to-speech 모델, 단계마다 완전한 제어가 가능한 wake → VAD → ASR → LLM → TTS 컴포저블 파이프라인, 그리고 핸즈프리 진입용 웨이크 워드 활성화. 모두 온디바이스, 클라우드 API 없음, 오디오는 기기 밖으로 나가지 않음.
드롭인 대화 모델, 단계별 제어가 가능한 컴포저블 파이프라인, 또는 가벼운 웨이크 워드 트리거. 모두 전적으로 온디바이스에서 동작합니다.
네이티브 모델은 전통적인 ASR → LLM → TTS 턴 경계 없이 마이크 오디오를 음성 출력으로 스트리밍합니다. VoiceChat의 비대칭 스택 또는 PersonaPlex의 Moshi 계열 멀티스트림을 선택할 수 있습니다.
웨이크 워드 → VAD → 스트리밍 ASR → 온디바이스 LLM → TTS. 단계마다 제어, 전사 가시성, 엔진 자유 교체. 나만의 Siri를 만드세요.
어떤 음성 플로우든 핸즈프리로 트리거. 문구별 임계값을 가진 커스텀 키워드, 온디바이스 5 MB 미만, 실시간 대비 26배.
두 모델 모두 연속 음성을 받아 전통적인 ASR → LLM → TTS 턴 경계 없이 음성을 생성합니다. 텍스트는 정렬된 추론·제어 스트림으로 모델 내부에 남을 수 있습니다.
인과 FastConformer 인식이 Nemotron-H 텍스트·함수 채널에 입력됩니다. 음성은 언어 모델의 헤드가 아니라 별도의 텍스트 조건부 EAR-TTS 디코더와 22.05 kHz 신경 코덱으로 생성됩니다.
PersonaPlex는 Moshi 가중치에서 시작해 Mimi와 Depformer 스트림으로 사용자 오디오, 에이전트 텍스트, 에이전트 오디오를 공동 모델링합니다. 동시 듣기·말하기, 텍스트 역할 프롬프트, 오디오 음성 프롬프트를 지원합니다.
BESTOW는 NVIDIA의 선행 스트리밍 SpeechLLM 계보이지만 음성을 텍스트로 변환하며 듀플렉스 S2S 모델은 아닙니다. Moshi와 PersonaPlex는 멀티스트림 계열을, SALM-Duplex는 효율적인 비대칭 듀플렉스 모델링을 설명합니다. Full-Duplex-Bench는 RTF가 포착하지 못하는 일시 정지, 백채널, 턴테이킹, 끼어들기를 평가합니다.