VoiceChat 11B
因果 FastConformer の知覚が Nemotron-H のテキスト/関数チャンネルへ入力されます。音声は言語モデル上のヘッドではなく、独立したテキスト条件付き EAR-TTS デコーダーと 22.05 kHz ニューラルコーデックで生成されます。
音声優先インターフェースの 3 つの形 —— ネイティブのフルデュプレックス speech-to-speech モデル、完全に制御できる wake → VAD → ASR → LLM → TTS のコンポーザブル・パイプライン、ハンズフリー起動用のウェイクワード。すべてオンデバイス、クラウド API なし、音声はデバイスから出ません。
ドロップイン型の対話モデル、ステージごとに制御できるコンポーザブル・パイプライン、あるいは軽量なウェイクワード・トリガー。いずれも完全にオンデバイスで動作します。
ネイティブモデルは、従来の ASR → LLM → TTS ターン境界を介さず、マイク音声を音声出力へストリーミングします。VoiceChat の非対称スタックか、PersonaPlex の Moshi 系マルチストリームを選べます。
ウェイクワード → VAD → ストリーミング ASR → オンデバイス LLM → TTS。各段で制御でき、書き起こしも可視化、エンジン差し替え自由。自分専用の Siri を構築。
あらゆる音声フローのハンズフリー・トリガー。フレーズごとの閾値を持つカスタムキーワード、オンデバイスで 5 MB 未満、26× 実時間。
どちらも連続音声を受け取り、従来の ASR → LLM → TTS というターン境界を介さずに音声を生成します。テキストは、整列された推論・制御ストリームとしてモデル内部に存在する場合があります。
因果 FastConformer の知覚が Nemotron-H のテキスト/関数チャンネルへ入力されます。音声は言語モデル上のヘッドではなく、独立したテキスト条件付き EAR-TTS デコーダーと 22.05 kHz ニューラルコーデックで生成されます。
PersonaPlex は Moshi の重みから初期化され、Mimi と Depformer のストリームでユーザー音声、エージェントテキスト、エージェント音声を共同モデル化します。同時に聞く・話す動作、テキストの役割プロンプト、音声のボイスプロンプトに対応します。
BESTOW は NVIDIA による先行するストリーミング SpeechLLM の系譜ですが、音声をテキストへ変換するもので、デュプレックス S2S モデルではありません。Moshi と PersonaPlex はマルチストリーム系統を、SALM-Duplex は効率的な非対称デュプレックスを説明します。Full-Duplex-Bench は、RTF では捉えられないポーズ、相づち、ターンテイキング、割り込みを評価します。
NVIDIA Nemotron VoiceChat 11B をローカルで動かした実際のセッション。発話ターン、文の途中での割り込み、そして Apple リマインダーへの完全な MCP ツール呼び出し。M5 Pro で RTF 0.92、常駐メモリ 7.5 GB、データは一切マシンの外に出ません。
音声エージェントが行う 3 つの判断 —— いつ待つか、いつ話すか、いつ実行するか —— についての最近の成果。すべて端末上で動作します。
VoiceChat は応答中も聞き続け、function head が話し言葉のリクエストを MCP のツール呼び出しに変換します。Mac では Apple リマインダーの一覧・作成・更新を行い、データは端末から出ません。
Smart Turn v3.2 はリクエストを確定する前に話し終えたかどうかを判定します。だから「えっと、金曜日」で木曜日を上書きできます。23 言語対応のモデルは CoreML と Swift、speech-core の C++ ランタイム、そして Android で動作し、M5 Pro では数ミリ秒で応答します。
Android では 1 台の端末で音声が実際のデバイス操作と音声応答になります。Silero VAD、Parakeet STT、FunctionGemma のツール呼び出し、Pocket TTS を使い、完全オフラインで 1.2 GB の RAM に収まります。