
ازدواج كامل على جهاز MacBook مع استدعاء أدوات حقيقية
جلسة حقيقية تشغّل NVIDIA Nemotron VoiceChat 11B محليًا: دور كلامي، ومقاطعة في منتصف الجملة، واستدعاء أداة MCP كامل إلى تطبيق التذكيرات من Apple. معامل RTF 0.92 على M5 Pro، ولا شيء يغادر الجهاز.
تفريغ مع تحديد المتحدّثين، واستنساخ صوت بصفر-إطلاق، وتركيب كلام طويل المدى — يعمل على Apple Silicon وAndroid وWindows وLinux المضمّن. بدون واجهات سحابية، بدون تسعير بالدقيقة، وبدون خروج أي بيانات من الجهاز.
brew install speechimplementation("audio.soniqo:speech:0.0.9")
جلسة حقيقية تشغّل NVIDIA Nemotron VoiceChat 11B محليًا: دور كلامي، ومقاطعة في منتصف الجملة، واستدعاء أداة MCP كامل إلى تطبيق التذكيرات من Apple. معامل RTF 0.92 على M5 Pro، ولا شيء يغادر الجهاز.

قلها — وAndroid ينفّذها: حلقة أوامر كاملة من الكلام إلى إجراء حقيقي على الجهاز ثم ردّ منطوق، على هاتف واحد بذاكرة 1.2 GB. Silero VAD وParakeet STT ونداءات أدوات FunctionGemma وPocket TTS.

جولة 4 دقائق في المكتبة مفتوحة المصدر: تفريغ فوري مع Nemotron Streaming، وكلام إلى كلام محلي مع PersonaPlex، واستنساخ 48 kHz مع VoxCPM2 — كل ذلك على الحاسوب المحمول.
VAD ← STT ← LLM ← TTS على الهاتف وMac · iPhone ~1.2 GB · S23 ~1.5 GB · سطح المكتب <4 GB
نفس خط أنابيب الوكيل VAD → STT → LLM → TTS على iPhone وGalaxy S23 وMac — مع ذاكرة مقيسة لكل ميزانية.
كل مجموعة تغطّي عدة حالات فرعية مبنية من مكوّنات Soniqo. مرّر صوتك واحصل على محادثة أو نصوص أو صوت مُولَّد — محلياً وفي الزمن الحقيقي.
ابنِ واجهات تعتمد على الصوت — من نموذج كلام إلى كلام ثنائي الاتجاه كامل إلى خطوط أنابيب تركيبية مُفعَّلة بكلمة استيقاظ، تعمل كلها محلياً.
حوِّل الصوت إلى نص منظَّم — بثّ زمن حقيقي للترجمة الفورية والإملاء، ودقة عالية بالدُفعات للأرشيف، مع تحديد كل متحدّث بالاسم.
ركِّب الكلام بأي صوت — استنسخ صوتاً في ثوانٍ، أو اقرأ كتباً صوتية لساعات، أو أنتج بودكاست متعدّد المتحدّثين، كل ذلك دون اتصال بالإنترنت.
خطوط الأنابيب المعروضة أعلاه مبنية من هذه النماذج. اختر مكوّناً لترى بنيته وواجهة سطر الأوامر وSwift API ونتائج الأداء. كلها تعمل على Apple Silicon، ومعظمها على Android وLinux أيضاً.
52 langs, RTF 0.06, 4-/8-bit
Native CoreML: 1.40% WER, 6 s model load
MLX INT5: 128K offline context, RTF 0.028
Small, medium, large-v3, and turbo exports
32× real-time on Neural Engine
120M, 25 langs, streaming partials + EOU, ~232 MB on-device
1,672 languages, 300M–7B
14 langs, INT5 default, RTF 0.015
8 langs, INT5 default, RTF 0.074
Word-level timestamps, 80 ms
Streaming with punctuation
9 langs, zero-shot cloning, bf16 / 8-bit
12 Hz codec LM, faster than real-time
48 kHz, 30 langs, voice design + cloning
Zero-shot cloning, emotion + tempo controls, RTF 1.0
99M, 31 langs, 44.1 kHz
CoreML voice cloning, TTFT 0.27s, RTF 0.59
600+ langs, NAR diffusion cloning
Hindi emotion TTS + raw reference cloning
Style markers + zero-shot cloning
Zero-shot cloning in 16 flow steps, RTF 0.57
4B conversational cloning, emotion tags, RTF 0.78
54 voices, iOS-ready, 10 langs
English, ~130 ms streaming TTFA
90-min podcasts / audiobooks
9 langs, 5 baked voices, streaming
IndexTTS2, CosyVoice, Chatterbox Flash, Qwen3-TTS ICL
SpeechBrain ECAPA, 107 languages, 21M
Masked WeSpeaker + native PLDA/VBx, ~32 MB
Community-1 + Pyannote + Sortformer
WeSpeaker / CAM++ for ID
Silero v6.2.1, Pyannote, FireRedVAD
KWS Zipformer, 26× real-time
44.1 kHz stereo, variable-length music
Text → 30 s music, RTF 0.36
Open-Unmix + HTDemucs v4, 4 stems
DeepFilterNet3, 48 kHz real-time
Two-stream echo cancellation, 16 ms latency
Sidon denoise + dereverb → 48 kHz
48 kHz audio super-resolution
Streaming on-device LLM
Structured tool / function-call grammar
Many-to-many translation, 400+ languages
Streaming speech translation, FR/ES/PT/DE → EN
Moshi-family full-duplex speech-to-speech
Asymmetric duplex speech-to-speech, INT5 / INT8