
MacBook 上で全二重、実際のツールを呼び出す
NVIDIA Nemotron VoiceChat 11B をローカルで動かした実際のセッション。発話ターン、文の途中での割り込み、そして Apple リマインダーへの完全な MCP ツール呼び出し。M5 Pro で RTF 0.92、データは一切マシンの外に出ません。

NVIDIA Nemotron VoiceChat 11B をローカルで動かした実際のセッション。発話ターン、文の途中での割り込み、そして Apple リマインダーへの完全な MCP ツール呼び出し。M5 Pro で RTF 0.92、データは一切マシンの外に出ません。

話せば Android が実行:音声から実際のデバイス操作、音声での返答までの完全なコマンドループが 1 台のスマホ・RAM 1.2 GB で動作 — Silero VAD、Parakeet STT、FunctionGemma ツールコール、Pocket TTS。

4 分のオープンソースライブラリツアー:Nemotron Streaming のリアルタイム文字起こし、PersonaPlex のローカル音声対話、VoxCPM2 の 48 kHz クローン — すべてラップトップ上で動作。
スマホと Mac で VAD → STT → LLM → TTS · iPhone 約 1.2 GB · S23 約 1.5 GB · デスクトップ <4 GB
同じ VAD → STT → LLM → TTS エージェントパイプラインを iPhone・Galaxy S23・Mac で実行し、各メモリ予算の実測値を掲載。
各グループは Soniqo コンポーネントを組み合わせた複数のサブユースケースをカバーします。音声を投入すれば、対話・文字起こし・合成音声がローカルかつリアルタイムに得られます。
上記のユースケース・パイプラインはこれらのモデルから構成されます。コンポーネントを選んでアーキテクチャ、CLI、Swift API、ベンチマークをご覧ください。すべて Apple Silicon で動作し、多くは Android と Linux にも対応。
52 langs, RTF 0.06, 4-/8-bit
Native CoreML: 1.40% WER, 6 s model load
MLX INT5: 128K offline context, RTF 0.028
Small, medium, large-v3, and turbo exports
32× real-time on Neural Engine
120M, 25 langs, streaming partials + EOU, ~232 MB on-device
1,672 languages, 300M–7B
14 langs, INT5 default, RTF 0.015
8 langs, INT5 default, RTF 0.074
Word-level timestamps, 80 ms
Streaming with punctuation
9 langs, zero-shot cloning, bf16 / 8-bit
12 Hz codec LM, faster than real-time
48 kHz, 30 langs, voice design + cloning
Zero-shot cloning, emotion + tempo controls, RTF 1.0
99M, 31 langs, 44.1 kHz
CoreML voice cloning, TTFT 0.27s, RTF 0.59
600+ langs, NAR diffusion cloning
Hindi emotion TTS + raw reference cloning
Style markers + zero-shot cloning
Zero-shot cloning in 16 flow steps, RTF 0.57
4B conversational cloning, emotion tags, RTF 0.78
54 voices, iOS-ready, 10 langs
English, ~130 ms streaming TTFA
90-min podcasts / audiobooks
9 langs, 5 baked voices, streaming
IndexTTS2, CosyVoice, Chatterbox Flash, Qwen3-TTS ICL
SpeechBrain ECAPA, 107 languages, 21M
Masked WeSpeaker + native PLDA/VBx, ~32 MB
Community-1 + Pyannote + Sortformer
WeSpeaker / CAM++ for ID
Silero v6.2.1, Pyannote, FireRedVAD
KWS Zipformer, 26× real-time
44.1 kHz stereo, variable-length music
Text → 30 s music, RTF 0.36
Open-Unmix + HTDemucs v4, 4 stems
DeepFilterNet3, 48 kHz real-time
Two-stream echo cancellation, 16 ms latency
Sidon denoise + dereverb → 48 kHz
48 kHz audio super-resolution
Streaming on-device LLM
Structured tool / function-call grammar
Many-to-many translation, 400+ languages
Streaming speech translation, FR/ES/PT/DE → EN
Moshi-family full-duplex speech-to-speech
Asymmetric duplex speech-to-speech, INT5 / INT8