Chatterbox Multilingual
이 Soniqo 페이지는 로컬 speech-swift / speech-core 구현의 Chatterbox Multilingual을 설명합니다. Hugging Face 번들 링크는 통합 메모 뒤에 있습니다.
내부 페이지 우선
랜딩 카드와 문서 메뉴는 먼저 이 페이지로 이동하고, 원본 모델과 번들 링크는 이 페이지 안에 둡니다.
개요
| 모델 | Chatterbox Multilingual |
|---|---|
| 역할 | Multilingual zero-shot voice-cloning TTS |
| 백엔드 | MLX fp16 on Apple; LiteRT default-voice runtime in Speech Core |
| 출력 | 24 kHz mono waveform |
| 언어 | 23 languages |
| 라이선스 | MIT |
| 상태 | MLX cloning runtime; LiteRT greedy/default-voice runtime for edge deployments |
| 소스 | Resemble AI Chatterbox |
| Swift 제품 | ChatterboxTTS |
| CLI / 런타임 | Programmatic speech-swift runtime; LiteRT example CLI in speech-core/examples/litert |
사용
아래 스니펫은 현재 speech-swift 저장소의 API 또는 명령과 일치합니다.
import ChatterboxTTS
let model = try await ChatterboxTTSModel.fromPretrained()
let pcm = try model.clone(
referenceSamples: reference,
sampleRate: 24_000,
text: "The cloned voice now speaks a new sentence.",
languageId: "en"
)
모델 링크
구현 메모
- 다운로드는 기본 Chatterbox 번들과 별도의 S3 tokenizer 저장소로 나뉩니다.
- 파이프라인은 T3 text-to-speech tokens, S3Gen flow mel decoder, HiFi-GAN / HiFTGenerator vocoder 순서로 실행됩니다.
- 참조 클립은 S3Gen용으로 24 kHz, speaker/token conditioning용으로 16 kHz로 리샘플링됩니다.
- MLX 클론 경로와 독립 S3Gen 합성은 기본적으로 balanced memory policy를 사용합니다. 생성 중에만 MLX cache를 최대 512 MB로 제한하고 호출자가 더 엄격하게 설정한 cap은 올리지 않으며, T3, S3Gen flow, vocoder 단계 사이에서 cache를 정리합니다. MLX 기본 캐시 동작이 필요하면
memoryOptions: .unrestricted를 전달합니다. - Flash Core ML 클로닝은 MLX reference-audio encoders로 conditioning을 준비한 뒤 내보낸 T3/S3Gen Core ML 그래프를 실행합니다. 번들에
t3/NullTextPrefill.mlmodelc가 없으면 CFG는 기본적으로 꺼져 있습니다. 공개 192-token audio export는 생성 음성을 위한 공간을 남기기 위해 Flash 참조 프롬프트를 6초로 제한합니다. - speech-core의 LiteRT 경로는 기본 음성을 포함합니다. 아랍어 품질에는 fp16 T3를 권장합니다.