Chatterbox Multilingual
此 Soniqo 页面记录本地 speech-swift / speech-core 实现中的 Chatterbox Multilingual。Hugging Face 包链接放在集成说明之后。
先进入站内页面
首页卡片和文档菜单先指向这里;源模型和权重包链接仍在本页提供。
概览
| 模型 | Chatterbox Multilingual |
|---|---|
| 用途 | Multilingual zero-shot voice-cloning TTS |
| 后端 | MLX fp16 on Apple; LiteRT default-voice runtime in Speech Core |
| 输出 | 24 kHz mono waveform |
| 语言 | 23 languages |
| 许可证 | MIT |
| 状态 | MLX cloning runtime; LiteRT greedy/default-voice runtime for edge deployments |
| 来源 | Resemble AI Chatterbox |
| Swift 产品 | ChatterboxTTS |
| CLI / 运行时 | Programmatic speech-swift runtime; LiteRT example CLI in speech-core/examples/litert |
使用
下面的片段对应当前 speech-swift 仓库暴露的 API 或命令。
import ChatterboxTTS
let model = try await ChatterboxTTSModel.fromPretrained()
let pcm = try model.clone(
referenceSamples: reference,
sampleRate: 24_000,
text: "The cloned voice now speaks a new sentence.",
languageId: "en"
)
模型链接
实现说明
- 下载分为主 Chatterbox 包和独立的 S3 tokenizer 仓库。
- 管线依次使用 T3 text-to-speech tokens、S3Gen flow mel decoder,然后进入 HiFi-GAN / HiFTGenerator vocoder。
- 参考音频会为 S3Gen 重采样到 24 kHz,并为 speaker/token conditioning 重采样到 16 kHz。
- MLX 克隆路径和独立 S3Gen 合成默认使用 balanced memory policy:临时最高 512 MB 的 MLX cache cap,不会提高调用方已设置的更严格 cap,并在 T3、S3Gen flow 和 vocoder 阶段之间清理 cache。需要 MLX 默认缓存行为时传入
memoryOptions: .unrestricted。 - Flash Core ML 克隆先用 MLX reference-audio encoders 准备 conditioning,然后运行导出的 T3/S3Gen Core ML 图。除非包包含
t3/NullTextPrefill.mlmodelc,否则默认关闭 CFG;公共 192-token audio export 会把 Flash 参考提示限制为 6 秒,以便为生成语音留出空间。 - speech-core 的 LiteRT 路径内置默认声音;阿拉伯语质量建议使用 fp16 T3。