화자 분리 벤치마크: pyannote, Sortformer, MOSS, Speech Cloud

5개 분리 시스템을 동일한 132개 녹음에 하나의 잣대로 채점했습니다. 8개 언어, 총 12.9시간. 각 시스템에는 오디오만 제공됩니다. 어떤 백엔드에도 화자 수를 알려주지 않습니다. 이 조건이 진짜 분리기와 정답을 쥔 클러스터링 스크립트를 가릅니다.

숫자 읽는 법

각 셀은 DER(화자 분리 오류율)입니다. 참조 화자 시간 가중이며 콜라는 0.25초입니다. 낮을수록 좋습니다. 실제 대화와 합성 레일은 증거 등급이 달라 서로 비교할 수 없습니다.

언어별 결과

실제 대화

방송, 전화, 회의 오디오. 96개 녹음, 12.63시간.

시스템아랍어독일어영어스페인어중국어
DER은 낮을수록 좋음
Speech Cloud API21.02%7.62%13.21%15.92%9.63%
Sortformer streaming22.32%8.38%13.81%16.33%9.95%
Sortformer offline17.92%8.13%14.34%16.43%10.52%
MOSS14.57%16.95%16.35%22.51%10.12%
pyannote Community-115.57%20.22%15.22%22.78%16.19%

합성 레일

낭독 음성을 이어 붙이고 turn-taking은 CallHome 슬라이스에서 측정한 분포로 샘플링했습니다. 심각한 도메인 실패 탐지용일 뿐입니다. 위 표의 수치와 비교하지 마십시오.

시스템아제르바이잔어스위스 독일어러시아어
DER은 낮을수록 좋음
Speech Cloud API4.74%19.33%8.15%
Sortformer streaming5.25%21.59%5.35%
Sortformer offline5.16%28.03%8.20%
MOSS11.30%26.59%15.14%
pyannote Community-135.23%45.21%35.26%

직접 실행하기

방법과 한계 · 언어별 결과

talkbank/callhome (17c8a153, CC BY-NC-SA 4.0)