حالة استخدام · محادثة

صوت يدخل.
صوت يخرج.

ثلاث صور لواجهات تعتمد على الصوت — نماذج كلام-إلى-كلام أصلية كاملة الازدواج، خط أنابيب تركيبي wake → VAD → ASR → LLM → TTS تتحكّم فيه بالكامل، وتفعيل بكلمة استيقاظ للإدخال دون يدين. كله على الجهاز، بدون واجهات سحابية، وبدون خروج صوت.

ثلاث حالات استخدام فرعية

اختر الصورة التي تناسب منتجك.

نموذج حوار جاهز للتشغيل، أو خط أنابيب تركيبي بتحكّم لكل مرحلة، أو مُحفِّز كلمة استيقاظ نحيف. كلٌّ منها يعمل بالكامل على الجهاز.

كلام إلى كلام أصلي

عائلتان من النماذج وتصميمان للازدواج.

يستقبل كلاهما الكلام باستمرار ويولّد الكلام من دون حدّ الدور التقليدي ASR → LLM → TTS. وقد يبقى النص داخل النموذج كتدفق متزامن للاستدلال والتحكم.

سلالة SALM-Duplex · غير متماثلة

VoiceChat 11B

يغذّي إدراك FastConformer السببي قناتي النص والوظيفة في Nemotron-H. ويولّد الكلام decoder مستقل من EAR-TTS مشروطاً بالنص — وليس head على نموذج اللغة — مع codec عصبي بتردد 22.05 kHz.

البنية
16 kHz → causal FastConformer
Nemotron-H · text + function
separate EAR-TTS → 22.05 kHz codec
قياس محلي
RTF 0.92–0.94
M5 Pro · 48 GB · Release · protected-head INT5
44.3–46.7 ms first spoken text token · 74.0–76.4 ms first playable audio
76.2–78.6 ms frame p95 · ~8.70 GB peak RSS
عائلة Moshi · متعددة التدفقات

PersonaPlex 7B

يبدأ PersonaPlex من أوزان Moshi ويصوغ صوت المستخدم ونص الوكيل وصوت الوكيل معاً عبر تدفقات Mimi وDepformer. ويدعم الاستماع والكلام في الوقت نفسه، وموجّهات الدور النصية وموجّهات الصوت السمعية.

البنية
Moshi weights
Mimi RVQ + Depformer
user audio ↔ agent text ↔ agent audio
قياس محلي
RTF ~1.4
M2 Max · 8-bit
~112 ms / step · 18 selectable voices
~9.1 GB bundle · ~11 GB peak RAM
RTF هو زمن التوليد الفعلي مقسوماً على مدة الصوت الناتج؛ وتسمح القيمة الأقل من 1 باستمرار البث على الجهاز المختبَر. أُجريت القياسات على أجهزة Mac مختلفة، لذا فهي ليست ترتيباً للنماذج. أول خرج ومعدل الإطارات قياسات حساب بعد الإحماء، وليسا زمن تبديل الأدوار المتعلّم.
أبحاث ذات صلة

سلالة البنى وتقييم الازدواج.

يمثل BESTOW السلالة السابقة من SpeechLLM القابل للبث لدى NVIDIA، لكنه يحوّل الكلام إلى نص وليس نموذج S2S مزدوجاً. يصف Moshi وPersonaPlex العائلة متعددة التدفقات، بينما يصف SALM-Duplex ازدواجاً غير متماثل عالي الكفاءة. ويقيّم Full-Duplex-Bench التوقفات والإشارات الراجعة وتبادل الأدوار والمقاطعات — وهي سلوكيات لا يقيسها RTF.

قارن الإعداد وواجهات API والحزم والاختبارات
speech voice-chat · جلسة مسجّلة

ازدواج كامل على جهاز MacBook مع استدعاء أدوات حقيقية.

جلسة حقيقية تشغّل NVIDIA Nemotron VoiceChat 11B محليًا: دور كلامي، ومقاطعة في منتصف الجملة، واستدعاء أداة MCP كامل إلى تطبيق التذكيرات من Apple. معامل RTF 0.92 على M5 Pro، و7.5 غيغابايت في الذاكرة، ولا شيء يغادر الجهاز.

قراءة معمّقة

أدلّة المكوّنات.