Chatterbox Multilingual
Trang Soniqo này ghi lại Chatterbox Multilingual theo triển khai hiện có trong speech-swift / speech-core. Liên kết Hugging Face nằm bên dưới phần ghi chú tích hợp.
Ưu tiên trang nội bộ
Thẻ trên trang chính và menu tài liệu trỏ vào đây trước; liên kết model nguồn và bundle vẫn có trong trang này.
Tổng quan
| Model | Chatterbox Multilingual |
|---|---|
| Vai trò | Multilingual zero-shot voice-cloning TTS |
| Backend | MLX fp16 on Apple; LiteRT default-voice runtime in Speech Core |
| Đầu ra | 24 kHz mono waveform |
| Ngôn ngữ | 23 languages |
| Giấy phép | MIT |
| Trạng thái | MLX cloning runtime; LiteRT greedy/default-voice runtime for edge deployments |
| Nguồn | Resemble AI Chatterbox |
| Sản phẩm Swift | ChatterboxTTS |
| CLI / runtime | Programmatic speech-swift runtime; LiteRT example CLI in speech-core/examples/litert |
Cách dùng
Đoạn dưới đây khớp với API hoặc lệnh hiện tại do speech-swift cung cấp.
import ChatterboxTTS
let model = try await ChatterboxTTSModel.fromPretrained()
let pcm = try model.clone(
referenceSamples: reference,
sampleRate: 24_000,
text: "The cloned voice now speaks a new sentence.",
languageId: "en"
)
Liên kết model
Ghi chú triển khai
- Phần tải xuống được chia giữa bundle Chatterbox chính và kho S3 tokenizer riêng.
- Pipeline chạy T3 text-to-speech tokens, S3Gen flow mel decoder, rồi vocoder HiFi-GAN / HiFTGenerator.
- Các clip tham chiếu được resample về 24 kHz cho S3Gen và 16 kHz cho speaker/token conditioning.
- Đường clone MLX và tổng hợp S3Gen độc lập dùng balanced memory policy theo mặc định: giới hạn tạm thời MLX cache tối đa 512 MB, không nâng một cap nghiêm ngặt hơn do caller đặt, và dọn cache giữa các giai đoạn T3, S3Gen flow và vocoder. Truyền
memoryOptions: .unrestrictedđể giữ hành vi cache mặc định của MLX. - Cloning bằng Flash Core ML dùng MLX reference-audio encoders để chuẩn bị conditioning, rồi chạy các graph T3/S3Gen Core ML đã export. CFG mặc định tắt trừ khi bundle có
t3/NullTextPrefill.mlmodelc; audio export công khai 192-token giới hạn prompt tham chiếu Flash ở 6 giây để còn chỗ cho tiếng nói được tạo. - Đường LiteRT của speech-core có sẵn một giọng mặc định; nên dùng fp16 T3 cho chất lượng tiếng Ả Rập.