화자 분리 벤치마크: pyannote, Sortformer, MOSS, Speech Cloud
5개 분리 시스템을 동일한 132개 녹음에 하나의 잣대로 채점했습니다. 8개 언어, 총 12.9시간. 각 시스템에는 오디오만 제공됩니다. 어떤 백엔드에도 화자 수를 알려주지 않습니다. 이 조건이 진짜 분리기와 정답을 쥔 클러스터링 스크립트를 가릅니다.
숫자 읽는 법
각 셀은 DER / 화자 수 일치율입니다. DER은 참조 화자 시간 가중이며 콜라는 0.25초, 일치율은 UEM 내 참조 화자 수와 정확히 일치한 파일의 비율입니다. DER은 낮을수록, 일치율은 높을수록 좋습니다. 실제 대화와 합성 레일은 증거 등급이 달라 서로 비교할 수 없습니다.
언어별 결과
실제 대화
방송, 전화, 회의 오디오. 96개 녹음, 12.63시간.
| 시스템 | 아랍어 | 독일어 | 영어 | 스페인어 | 중국어 |
|---|---|---|---|---|---|
| Speech Cloud API | 21.02% / 33.3% | 7.62% / 91.7% | 13.21% / 66.7% | 15.92% / 58.3% | 9.63% / 58.3% |
| Sortformer streaming | 22.32% / 33.3% | 8.38% / 83.3% | 13.81% / 66.7% | 16.33% / 58.3% | 9.95% / 58.3% |
| Sortformer offline | 17.92% / 33.3% | 8.13% / 83.3% | 14.34% / 66.7% | 16.43% / 58.3% | 10.52% / 41.7% |
| MOSS | 14.57% / 41.7% | 16.95% / 83.3% | 16.35% / 72.9% | 22.51% / 75.0% | 10.12% / 83.3% |
| pyannote Community-1 | 15.57% / 58.3% | 20.22% / 83.3% | 15.22% / 77.1% | 22.78% / 91.7% | 16.19% / 83.3% |
합성 레일
낭독 음성을 이어 붙이고 turn-taking은 CallHome 슬라이스에서 측정한 분포로 샘플링했습니다. 심각한 도메인 실패 탐지용일 뿐입니다. 위 표의 수치와 비교하지 마십시오.
| 시스템 | 아제르바이잔어 | 스위스 독일어 | 러시아어 |
|---|---|---|---|
| Speech Cloud API | 4.74% / 83.3% | 19.33% / 41.7% | 8.15% / 75.0% |
| Sortformer streaming | 5.25% / 75.0% | 21.59% / 58.3% | 5.35% / 91.7% |
| Sortformer offline | 5.16% / 75.0% | 28.03% / 50.0% | 8.20% / 100.0% |
| MOSS | 11.30% / 58.3% | 26.59% / 41.7% | 15.14% / 50.0% |
| pyannote Community-1 | 35.23% / 16.7% | 45.21% / 0.0% | 35.26% / 8.3% |
직접 실행하기
soniqo/speech-bench-data
(9c91223) · talkbank/callhome
(17c8a153, CC BY-NC-SA 4.0)