Chatterbox Multilingual
توثق هذه الصفحة من Soniqo نموذج Chatterbox Multilingual كما هو منفذ في speech-swift / speech-core. روابط Hugging Face موجودة أدناه بعد ملاحظات الدمج.
الصفحة الداخلية أولا
بطاقات الصفحة الرئيسية وقوائم الوثائق تشير إلى هذه الصفحة أولا؛ وتبقى روابط النموذج والحزم داخلها.
لمحة سريعة
| النموذج | Chatterbox Multilingual |
|---|---|
| الدور | Multilingual zero-shot voice-cloning TTS |
| Backend | MLX fp16 on Apple; LiteRT default-voice runtime in Speech Core |
| الإخراج | 24 kHz mono waveform |
| اللغات | 23 languages |
| الرخصة | MIT |
| الحالة | MLX cloning runtime; LiteRT greedy/default-voice runtime for edge deployments |
| المصدر | Resemble AI Chatterbox |
| منتج Swift | ChatterboxTTS |
| CLI / runtime | Programmatic speech-swift runtime; LiteRT example CLI in speech-core/examples/litert |
الاستخدام
المقتطف أدناه يطابق API أو الأمر الحالي في speech-swift.
import ChatterboxTTS
let model = try await ChatterboxTTSModel.fromPretrained()
let pcm = try model.clone(
referenceSamples: reference,
sampleRate: 24_000,
text: "The cloned voice now speaks a new sentence.",
languageId: "en"
)
روابط النموذج
ملاحظات التنفيذ
- ينقسم التنزيل بين حزمة Chatterbox الرئيسية ومستودع S3 tokenizer المنفصل.
- يمر المسار عبر T3 text-to-speech tokens ثم S3Gen flow mel decoder ثم vocoder من HiFi-GAN / HiFTGenerator.
- تُعاد عيّنة المقاطع المرجعية إلى 24 kHz لـ S3Gen وإلى 16 kHz من أجل speaker/token conditioning.
- يستخدم مسار الاستنساخ MLX وتوليد S3Gen المستقل افتراضياً balanced memory policy: حد مؤقت لذاكرة MLX cache يصل إلى 512 MB ولا يرفع cap أكثر صرامة عيّنه المستدعي، مع تنظيف cache بين مراحل T3 وS3Gen flow وvocoder. مرّر
memoryOptions: .unrestrictedللاحتفاظ بسلوك cache الافتراضي في MLX. - يستخدم استنساخ Flash Core ML وحدات MLX reference-audio encoders لتحضير conditioning، ثم يشغّل رسوم T3/S3Gen Core ML المصدّرة. يبقى CFG متوقفاً افتراضياً ما لم تحتوِ الحزمة على
t3/NullTextPrefill.mlmodelc؛ أما audio export العام بسعة 192-token فيحد prompt المرجعي في Flash إلى 6 ثوانٍ كي تبقى مساحة للكلام المولّد. - مسار LiteRT في speech-core يتضمن صوتاً افتراضياً؛ ويوصى باستخدام fp16 T3 لجودة العربية.