VoiceChat 11B
因果 FastConformer の知覚が Nemotron-H のテキスト/関数チャンネルへ入力されます。音声は言語モデル上のヘッドではなく、独立したテキスト条件付き EAR-TTS デコーダーと 22.05 kHz ニューラルコーデックで生成されます。
音声優先インターフェースの 3 つの形 —— ネイティブのフルデュプレックス speech-to-speech モデル、完全に制御できる wake → VAD → ASR → LLM → TTS のコンポーザブル・パイプライン、ハンズフリー起動用のウェイクワード。すべてオンデバイス、クラウド API なし、音声はデバイスから出ません。
ドロップイン型の対話モデル、ステージごとに制御できるコンポーザブル・パイプライン、あるいは軽量なウェイクワード・トリガー。いずれも完全にオンデバイスで動作します。
ネイティブモデルは、従来の ASR → LLM → TTS ターン境界を介さず、マイク音声を音声出力へストリーミングします。VoiceChat の非対称スタックか、PersonaPlex の Moshi 系マルチストリームを選べます。
ウェイクワード → VAD → ストリーミング ASR → オンデバイス LLM → TTS。各段で制御でき、書き起こしも可視化、エンジン差し替え自由。自分専用の Siri を構築。
あらゆる音声フローのハンズフリー・トリガー。フレーズごとの閾値を持つカスタムキーワード、オンデバイスで 5 MB 未満、26× 実時間。
どちらも連続音声を受け取り、従来の ASR → LLM → TTS というターン境界を介さずに音声を生成します。テキストは、整列された推論・制御ストリームとしてモデル内部に存在する場合があります。
因果 FastConformer の知覚が Nemotron-H のテキスト/関数チャンネルへ入力されます。音声は言語モデル上のヘッドではなく、独立したテキスト条件付き EAR-TTS デコーダーと 22.05 kHz ニューラルコーデックで生成されます。
PersonaPlex は Moshi の重みから初期化され、Mimi と Depformer のストリームでユーザー音声、エージェントテキスト、エージェント音声を共同モデル化します。同時に聞く・話す動作、テキストの役割プロンプト、音声のボイスプロンプトに対応します。
BESTOW は NVIDIA による先行するストリーミング SpeechLLM の系譜ですが、音声をテキストへ変換するもので、デュプレックス S2S モデルではありません。Moshi と PersonaPlex はマルチストリーム系統を、SALM-Duplex は効率的な非対称デュプレックスを説明します。Full-Duplex-Bench は、RTF では捉えられないポーズ、相づち、ターンテイキング、割り込みを評価します。