VoiceChat 11B
يغذّي إدراك FastConformer السببي قناتي النص والوظيفة في Nemotron-H. ويولّد الكلام decoder مستقل من EAR-TTS مشروطاً بالنص — وليس head على نموذج اللغة — مع codec عصبي بتردد 22.05 kHz.
ثلاث صور لواجهات تعتمد على الصوت — نماذج كلام-إلى-كلام أصلية كاملة الازدواج، خط أنابيب تركيبي wake → VAD → ASR → LLM → TTS تتحكّم فيه بالكامل، وتفعيل بكلمة استيقاظ للإدخال دون يدين. كله على الجهاز، بدون واجهات سحابية، وبدون خروج صوت.
نموذج حوار جاهز للتشغيل، أو خط أنابيب تركيبي بتحكّم لكل مرحلة، أو مُحفِّز كلمة استيقاظ نحيف. كلٌّ منها يعمل بالكامل على الجهاز.
تحوّل النماذج الأصلية صوت الميكروفون المتدفق إلى كلام من دون حدّ الدور التقليدي ASR → LLM → TTS. اختر بنية VoiceChat غير المتماثلة أو تدفقات عائلة Moshi في PersonaPlex.
كلمة استيقاظ → VAD → ASR بالبث → LLM على الجهاز → TTS. تحكّم لكل مرحلة، رؤية للنص، محرّكات قابلة للتبديل. ابنِ Siri الخاص بك.
مُحفِّز دون يدين لأي تدفق صوتي. كلمات استيقاظ مخصّصة بعتبات لكل عبارة، أقل من 5 ميغابايت على الجهاز، 26× الزمن الحقيقي.
يستقبل كلاهما الكلام باستمرار ويولّد الكلام من دون حدّ الدور التقليدي ASR → LLM → TTS. وقد يبقى النص داخل النموذج كتدفق متزامن للاستدلال والتحكم.
يغذّي إدراك FastConformer السببي قناتي النص والوظيفة في Nemotron-H. ويولّد الكلام decoder مستقل من EAR-TTS مشروطاً بالنص — وليس head على نموذج اللغة — مع codec عصبي بتردد 22.05 kHz.
يبدأ PersonaPlex من أوزان Moshi ويصوغ صوت المستخدم ونص الوكيل وصوت الوكيل معاً عبر تدفقات Mimi وDepformer. ويدعم الاستماع والكلام في الوقت نفسه، وموجّهات الدور النصية وموجّهات الصوت السمعية.
يمثل BESTOW السلالة السابقة من SpeechLLM القابل للبث لدى NVIDIA، لكنه يحوّل الكلام إلى نص وليس نموذج S2S مزدوجاً. يصف Moshi وPersonaPlex العائلة متعددة التدفقات، بينما يصف SALM-Duplex ازدواجاً غير متماثل عالي الكفاءة. ويقيّم Full-Duplex-Bench التوقفات والإشارات الراجعة وتبادل الأدوار والمقاطعات — وهي سلوكيات لا يقيسها RTF.
جلسة حقيقية تشغّل NVIDIA Nemotron VoiceChat 11B محليًا: دور كلامي، ومقاطعة في منتصف الجملة، واستدعاء أداة MCP كامل إلى تطبيق التذكيرات من Apple. معامل RTF 0.92 على M5 Pro، و7.5 غيغابايت في الذاكرة، ولا شيء يغادر الجهاز.