화자 분리 벤치마크: pyannote, Sortformer, MOSS, Speech Cloud

5개 분리 시스템을 동일한 132개 녹음에 하나의 잣대로 채점했습니다. 8개 언어, 총 12.9시간. 각 시스템에는 오디오만 제공됩니다. 어떤 백엔드에도 화자 수를 알려주지 않습니다. 이 조건이 진짜 분리기와 정답을 쥔 클러스터링 스크립트를 가릅니다.

숫자 읽는 법

각 셀은 DER / 화자 수 일치율입니다. DER은 참조 화자 시간 가중이며 콜라는 0.25초, 일치율은 UEM 내 참조 화자 수와 정확히 일치한 파일의 비율입니다. DER은 낮을수록, 일치율은 높을수록 좋습니다. 실제 대화와 합성 레일은 증거 등급이 달라 서로 비교할 수 없습니다.

언어별 결과

실제 대화

방송, 전화, 회의 오디오. 96개 녹음, 12.63시간.

시스템아랍어독일어영어스페인어중국어
Speech Cloud API21.02% / 33.3%7.62% / 91.7%13.21% / 66.7%15.92% / 58.3%9.63% / 58.3%
Sortformer streaming22.32% / 33.3%8.38% / 83.3%13.81% / 66.7%16.33% / 58.3%9.95% / 58.3%
Sortformer offline17.92% / 33.3%8.13% / 83.3%14.34% / 66.7%16.43% / 58.3%10.52% / 41.7%
MOSS14.57% / 41.7%16.95% / 83.3%16.35% / 72.9%22.51% / 75.0%10.12% / 83.3%
pyannote Community-115.57% / 58.3%20.22% / 83.3%15.22% / 77.1%22.78% / 91.7%16.19% / 83.3%

합성 레일

낭독 음성을 이어 붙이고 turn-taking은 CallHome 슬라이스에서 측정한 분포로 샘플링했습니다. 심각한 도메인 실패 탐지용일 뿐입니다. 위 표의 수치와 비교하지 마십시오.

시스템아제르바이잔어스위스 독일어러시아어
Speech Cloud API4.74% / 83.3%19.33% / 41.7%8.15% / 75.0%
Sortformer streaming5.25% / 75.0%21.59% / 58.3%5.35% / 91.7%
Sortformer offline5.16% / 75.0%28.03% / 50.0%8.20% / 100.0%
MOSS11.30% / 58.3%26.59% / 41.7%15.14% / 50.0%
pyannote Community-135.23% / 16.7%45.21% / 0.0%35.26% / 8.3%

직접 실행하기

방법과 한계 · 언어별 결과

soniqo/speech-bench-data (9c91223) · talkbank/callhome (17c8a153, CC BY-NC-SA 4.0)