유스케이스 · 콘텐츠 제작
30초 만에 음성 클로닝.
몇 시간이고 합성.
Apple Silicon에서의 제로샷 음성 클로닝. IndexTTS2는 감정, 템포, 일시정지 제어가 있는 네이티브 MLX 클로닝을 제공하고, CosyVoice 3는 전사 조건 다국어 클로닝을, Chatterbox Flash는 CoreML T3 + S3Gen 경로를 담당합니다. 파인튜닝 불필요, 글자당 과금 없음, 오디오는 기기 밖으로 나가지 않음.
무엇을 만들 수 있나요
음성 클로닝 다섯 가지 레시피.
각 레시피는 제품에 맞는 합성 엔진을 고릅니다. IndexTTS2는 스타일 제어가 있는 MLX 참조 클로닝, CosyVoice 3는 전사 조건 다국어 제로샷, Chatterbox Flash는 CoreML Flash T3, 오디오만 있을 때는 Qwen3-TTS ICL이며, 주변에 화자 임베딩과 디노이즈를 조합합니다.
오디오북 내레이션
저자나 원하는 음성을 한 번만 클로닝해 수 시간 일관된 내레이션을 렌더링.
더빙·로컬라이제이션
번역된 트랙 전체에서 발표자의 음성을 유지, 9개 언어.
캐릭터 음성
인라인 화자 태그로 장면당 2~4개의 커스텀 음성.
개인 음성 TTS
더 이상 자연스럽게 말할 수 없는 분들에게 익숙한 목소리를 되돌려 드립니다.
브랜드 보이스
제품 라인 전반에 일관된 단일 내레이터.
더 깊이 읽기
