Chatterbox Multilingual
Esta página da Soniqo documenta Chatterbox Multilingual conforme a implementação local em speech-swift / speech-core. Os links do Hugging Face ficam abaixo das notas de integração.
Página interna primeiro
Cards e menus apontam primeiro para cá; os links do modelo fonte e dos bundles continuam disponíveis nesta página.
Visão geral
| Modelo | Chatterbox Multilingual |
|---|---|
| Papel | Multilingual zero-shot voice-cloning TTS |
| Backend | MLX fp16 on Apple; LiteRT default-voice runtime in Speech Core |
| Saída | 24 kHz mono waveform |
| Idiomas | 23 languages |
| Licença | MIT |
| Status | MLX cloning runtime; LiteRT greedy/default-voice runtime for edge deployments |
| Fonte | Resemble AI Chatterbox |
| Produto Swift | ChatterboxTTS |
| CLI / runtime | Programmatic speech-swift runtime; LiteRT example CLI in speech-core/examples/litert |
Uso
O trecho abaixo reflete a API ou comando atual exposto por speech-swift.
import ChatterboxTTS
let model = try await ChatterboxTTSModel.fromPretrained()
let pcm = try model.clone(
referenceSamples: reference,
sampleRate: 24_000,
text: "The cloned voice now speaks a new sentence.",
languageId: "en"
)
Links do modelo
Notas de implementação
- O download é dividido entre o bundle principal do Chatterbox e o repositório separado do S3 tokenizer.
- O pipeline usa T3 text-to-speech tokens, o S3Gen flow mel decoder e depois o vocoder HiFi-GAN / HiFTGenerator.
- Os clipes de referência são reamostrados para 24 kHz no S3Gen e para 16 kHz no speaker/token conditioning.
- O caminho de clonagem MLX e a síntese S3Gen independente usam por padrão uma balanced memory policy: limite temporário de até 512 MB para o cache MLX que não aumenta um limite mais estrito do chamador, além de limpeza de cache entre T3, S3Gen flow e vocoder. Passe
memoryOptions: .unrestrictedpara manter o comportamento padrão de cache do MLX. - A clonagem com Flash Core ML usa MLX reference-audio encoders para preparar conditioning e então executa os grafos T3/S3Gen Core ML exportados. CFG fica desligado por padrão, a menos que o bundle inclua
t3/NullTextPrefill.mlmodelc; o audio export público de 192 tokens limita o prompt de referência Flash a 6 segundos para deixar espaço para a fala gerada. - O caminho LiteRT do speech-core inclui uma voz padrão; fp16 T3 é recomendado para qualidade em árabe.