Chatterbox Multilingual
Cette page Soniqo documente Chatterbox Multilingual tel qu'il est implémenté dans speech-swift / speech-core. Les liens Hugging Face sont placés après les notes d'intégration.
Page interne d'abord
Les cartes et menus pointent d'abord ici; les liens vers le modèle source et les bundles restent disponibles sur cette page.
Aperçu
| Modèle | Chatterbox Multilingual |
|---|---|
| Rôle | Multilingual zero-shot voice-cloning TTS |
| Backend | MLX fp16 on Apple; LiteRT default-voice runtime in Speech Core |
| Sortie | 24 kHz mono waveform |
| Langues | 23 languages |
| Licence | MIT |
| État | MLX cloning runtime; LiteRT greedy/default-voice runtime for edge deployments |
| Source | Resemble AI Chatterbox |
| Produit Swift | ChatterboxTTS |
| CLI / runtime | Programmatic speech-swift runtime; LiteRT example CLI in speech-core/examples/litert |
Utilisation
L'extrait ci-dessous suit l'API ou la commande actuellement exposée par speech-swift.
import ChatterboxTTS
let model = try await ChatterboxTTSModel.fromPretrained()
let pcm = try model.clone(
referenceSamples: reference,
sampleRate: 24_000,
text: "The cloned voice now speaks a new sentence.",
languageId: "en"
)
Liens du modèle
Notes d'implémentation
- Le téléchargement est réparti entre le bundle Chatterbox principal et le dépôt séparé du S3 tokenizer.
- La pipeline enchaîne T3 text-to-speech tokens, S3Gen flow mel decoder, puis le vocoder HiFi-GAN / HiFTGenerator.
- Les clips de référence sont rééchantillonnés à 24 kHz pour S3Gen et à 16 kHz pour speaker/token conditioning.
- Le chemin de clonage MLX et la synthèse S3Gen autonome utilisent par défaut une balanced memory policy : une limite temporaire jusqu'à 512 MB pour le cache MLX qui n'augmente pas une limite plus stricte définie par l'appelant, plus des nettoyages de cache entre T3, S3Gen flow et le vocoder. Passez
memoryOptions: .unrestrictedpour conserver le comportement de cache par défaut de MLX. - Le clonage Flash Core ML utilise les MLX reference-audio encoders pour préparer le conditioning, puis exécute les graphes T3/S3Gen Core ML exportés. CFG reste désactivé par défaut sauf si le bundle contient
t3/NullTextPrefill.mlmodelc; l'audio export public à 192 tokens limite le prompt de référence Flash à 6 secondes afin de garder de la place pour la parole générée. - Le chemin LiteRT de speech-core fournit une voix par défaut ; fp16 T3 est recommandé pour la qualité en arabe.