Chatterbox Multilingual
Эта страница Soniqo описывает Chatterbox Multilingual из локальной реализации speech-swift / speech-core. Ссылки на Hugging Face находятся ниже после заметок по интеграции.
Сначала внутренняя страница
Карточки и меню документации сначала ведут сюда; ссылки на исходную модель и бандлы остаются на этой странице.
Кратко
| Модель | Chatterbox Multilingual |
|---|---|
| Роль | Multilingual zero-shot voice-cloning TTS |
| Backend | MLX fp16 on Apple; LiteRT default-voice runtime in Speech Core |
| Вывод | 24 kHz mono waveform |
| Языки | 23 languages |
| Лицензия | MIT |
| Статус | MLX cloning runtime; LiteRT greedy/default-voice runtime for edge deployments |
| Источник | Resemble AI Chatterbox |
| Swift-продукт | ChatterboxTTS |
| CLI / runtime | Programmatic speech-swift runtime; LiteRT example CLI in speech-core/examples/litert |
Использование
Фрагмент ниже соответствует текущему API или команде из speech-swift.
import ChatterboxTTS
let model = try await ChatterboxTTSModel.fromPretrained()
let pcm = try model.clone(
referenceSamples: reference,
sampleRate: 24_000,
text: "The cloned voice now speaks a new sentence.",
languageId: "en"
)
Ссылки модели
Заметки реализации
- Загрузка разделена между основным bundle Chatterbox и отдельным репозиторием S3 tokenizer.
- Пайплайн использует T3 text-to-speech tokens, S3Gen flow mel decoder, затем вокодер HiFi-GAN / HiFTGenerator.
- Референсные клипы ресемплируются до 24 kHz для S3Gen и до 16 kHz для speaker/token conditioning.
- Путь клонирования MLX и отдельный синтез S3Gen по умолчанию используют balanced memory policy: временный лимит MLX cache до 512 MB, который не повышает более строгий cap вызывающего кода, и очистку cache между стадиями T3, S3Gen flow и vocoder. Передайте
memoryOptions: .unrestricted, чтобы сохранить стандартное поведение кэша MLX. - Клонирование Flash Core ML использует MLX reference-audio encoders для подготовки conditioning, затем запускает экспортированные графы T3/S3Gen Core ML. CFG по умолчанию выключен, если bundle не содержит
t3/NullTextPrefill.mlmodelc; публичный 192-token audio export ограничивает Flash reference prompt 6 секундами, чтобы оставить место для сгенерированной речи. - Путь LiteRT в speech-core поставляется с голосом по умолчанию; для качества арабского рекомендуется fp16 T3.