화자 분리 벤치마크: pyannote, Sortformer, MOSS, Speech Cloud
5개 분리 시스템을 동일한 132개 녹음에 하나의 잣대로 채점했습니다. 8개 언어, 총 12.9시간. 각 시스템에는 오디오만 제공됩니다. 어떤 백엔드에도 화자 수를 알려주지 않습니다. 이 조건이 진짜 분리기와 정답을 쥔 클러스터링 스크립트를 가릅니다.
숫자 읽는 법
각 셀은 DER(화자 분리 오류율)입니다. 참조 화자 시간 가중이며 콜라는 0.25초입니다. 낮을수록 좋습니다. 실제 대화와 합성 레일은 증거 등급이 달라 서로 비교할 수 없습니다.
언어별 결과
실제 대화
방송, 전화, 회의 오디오. 96개 녹음, 12.63시간.
| 시스템 | 아랍어 | 독일어 | 영어 | 스페인어 | 중국어 |
|---|---|---|---|---|---|
| DER은 낮을수록 좋음 | |||||
| Speech Cloud API | 21.02% | 7.62% | 13.21% | 15.92% | 9.63% |
| Sortformer streaming | 22.32% | 8.38% | 13.81% | 16.33% | 9.95% |
| Sortformer offline | 17.92% | 8.13% | 14.34% | 16.43% | 10.52% |
| MOSS | 14.57% | 16.95% | 16.35% | 22.51% | 10.12% |
| pyannote Community-1 | 15.57% | 20.22% | 15.22% | 22.78% | 16.19% |
합성 레일
낭독 음성을 이어 붙이고 turn-taking은 CallHome 슬라이스에서 측정한 분포로 샘플링했습니다. 심각한 도메인 실패 탐지용일 뿐입니다. 위 표의 수치와 비교하지 마십시오.
| 시스템 | 아제르바이잔어 | 스위스 독일어 | 러시아어 |
|---|---|---|---|
| DER은 낮을수록 좋음 | |||
| Speech Cloud API | 4.74% | 19.33% | 8.15% |
| Sortformer streaming | 5.25% | 21.59% | 5.35% |
| Sortformer offline | 5.16% | 28.03% | 8.20% |
| MOSS | 11.30% | 26.59% | 15.14% |
| pyannote Community-1 | 35.23% | 45.21% | 35.26% |
직접 실행하기
talkbank/callhome
(17c8a153, CC BY-NC-SA 4.0)