Chatterbox Multilingual
この Soniqo ページは、ローカルの speech-swift / speech-core 実装にある Chatterbox Multilingual を説明します。Hugging Face バンドルへのリンクは統合メモの後にあります。
まずサイト内ページへ
ランディングカードとドキュメントメニューは先にこのページへ向け、ソースモデルとバンドルのリンクは本ページ内に残します。
概要
| モデル | Chatterbox Multilingual |
|---|---|
| 役割 | Multilingual zero-shot voice-cloning TTS |
| バックエンド | MLX fp16 on Apple; LiteRT default-voice runtime in Speech Core |
| 出力 | 24 kHz mono waveform |
| 言語 | 23 languages |
| ライセンス | MIT |
| 状態 | MLX cloning runtime; LiteRT greedy/default-voice runtime for edge deployments |
| ソース | Resemble AI Chatterbox |
| Swift プロダクト | ChatterboxTTS |
| CLI / ランタイム | Programmatic speech-swift runtime; LiteRT example CLI in speech-core/examples/litert |
使い方
以下のスニペットは、現在の speech-swift リポジトリが公開している API またはコマンドに合わせています。
import ChatterboxTTS
let model = try await ChatterboxTTSModel.fromPretrained()
let pcm = try model.clone(
referenceSamples: reference,
sampleRate: 24_000,
text: "The cloned voice now speaks a new sentence.",
languageId: "en"
)
モデルリンク
実装メモ
- ダウンロードはメインの Chatterbox バンドルと、別個の S3 tokenizer リポジトリに分かれています。
- パイプラインは T3 text-to-speech tokens、S3Gen flow mel decoder、HiFi-GAN / HiFTGenerator vocoder の順に進みます。
- 参照クリップは S3Gen 用に 24 kHz、speaker/token conditioning 用に 16 kHz へリサンプリングされます。
- MLX クローン経路と単体の S3Gen 合成は既定で balanced memory policy を使います。生成中だけ MLX cache を最大 512 MB に制限し、呼び出し側が設定したより厳しい cap は引き上げず、T3、S3Gen flow、vocoder の各段階の間で cache をクリアします。MLX の既定キャッシュ動作を使う場合は
memoryOptions: .unrestrictedを渡します。 - Flash Core ML のクローンは、MLX reference-audio encoders で conditioning を作成してから、エクスポート済みの T3/S3Gen Core ML グラフを実行します。バンドルに
t3/NullTextPrefill.mlmodelcがない限り CFG は既定で無効です。公開 192-token audio export では、生成音声の余地を残すため Flash の参照プロンプトは 6 秒に制限されます。 - speech-core の LiteRT パスにはデフォルト音声が含まれます。アラビア語品質には fp16 T3 を推奨します。