Chatterbox Multilingual
Diese Soniqo-Seite dokumentiert Chatterbox Multilingual aus der lokalen speech-swift- / speech-core-Implementierung. Hugging-Face-Bundles sind nach den Integrationshinweisen verlinkt.
Zuerst interne Seite
Landing-Karten und Docs-Menüs führen zuerst hierher; Quellen- und Bundle-Links bleiben auf dieser Seite verfügbar.
Überblick
| Modell | Chatterbox Multilingual |
|---|---|
| Rolle | Multilingual zero-shot voice-cloning TTS |
| Backend | MLX fp16 on Apple; LiteRT default-voice runtime in Speech Core |
| Ausgabe | 24 kHz mono waveform |
| Sprachen | 23 languages |
| Lizenz | MIT |
| Status | MLX cloning runtime; LiteRT greedy/default-voice runtime for edge deployments |
| Quelle | Resemble AI Chatterbox |
| Swift-Produkt | ChatterboxTTS |
| CLI / Laufzeit | Programmatic speech-swift runtime; LiteRT example CLI in speech-core/examples/litert |
Verwendung
Das folgende Snippet entspricht der aktuellen API oder dem aktuellen Befehl aus speech-swift.
import ChatterboxTTS
let model = try await ChatterboxTTSModel.fromPretrained()
let pcm = try model.clone(
referenceSamples: reference,
sampleRate: 24_000,
text: "The cloned voice now speaks a new sentence.",
languageId: "en"
)
Modelllinks
Implementierungsnotizen
- Der Download ist zwischen dem Haupt-Bundle von Chatterbox und dem separaten S3 tokenizer Repository aufgeteilt.
- Die Pipeline nutzt T3 text-to-speech tokens, den S3Gen flow mel decoder und danach den HiFi-GAN / HiFTGenerator Vocoder.
- Referenzclips werden für S3Gen auf 24 kHz und für speaker/token conditioning auf 16 kHz resampelt.
- Der MLX-Cloning-Pfad und die eigenständige S3Gen-Synthese verwenden standardmäßig eine balanced memory policy: ein temporäres Limit von bis zu 512 MB für den MLX cache, das ein strengeres Limit des Aufrufers nicht anhebt, plus Cache-Bereinigungen zwischen T3, S3Gen flow und Vocoder. Mit
memoryOptions: .unrestrictedbleibt das Standard-Cache-Verhalten von MLX erhalten. - Flash Core ML Cloning verwendet MLX reference-audio encoders zur Vorbereitung des conditioning und führt danach die exportierten T3/S3Gen Core ML Graphen aus. CFG bleibt standardmäßig aus, sofern das Bundle nicht
t3/NullTextPrefill.mlmodelcenthält; der öffentliche 192-token audio export begrenzt Flash-Referenzprompts auf 6 Sekunden, damit Platz für generierte Sprache bleibt. - Der LiteRT-Pfad von speech-core liefert eine Standardstimme mit; für arabische Qualität wird fp16 T3 empfohlen.