Бенчмарки диаризации: pyannote, Sortformer, MOSS, Speech Cloud

Пять систем диаризации оценены одной меркой на одних и тех же 132 записях: восемь языков, 12,9 часа. Каждая система получает только аудио. Ни одному бэкенду не сообщается число говорящих — именно это условие отличает диаризатор от скрипта кластеризации, которому ответ известен заранее.

Как читать эти числа

В каждой ячейке — DER / совпадение числа говорящих. DER взвешен по эталонному времени речи с collar 0,25 с; совпадение — доля файлов, где выведенное число говорящих точно совпадает с эталоном внутри UEM. Меньший DER лучше, большее совпадение лучше. Реальный разговор и синтетические рельсы — разные уровни доказательности, сравнивать их между собой нельзя.

Результаты по языкам

Реальный разговор

Эфир, телефония и совещания. 96 записей, 12,63 часа.

СистемаАрабскийНемецкийАнглийскийИспанскийКитайский
Speech Cloud API21.02% / 33.3%7.62% / 91.7%13.21% / 66.7%15.92% / 58.3%9.63% / 58.3%
Sortformer streaming22.32% / 33.3%8.38% / 83.3%13.81% / 66.7%16.33% / 58.3%9.95% / 58.3%
Sortformer offline17.92% / 33.3%8.13% / 83.3%14.34% / 66.7%16.43% / 58.3%10.52% / 41.7%
MOSS14.57% / 41.7%16.95% / 83.3%16.35% / 72.9%22.51% / 75.0%10.12% / 83.3%
pyannote Community-115.57% / 58.3%20.22% / 83.3%15.22% / 77.1%22.78% / 91.7%16.19% / 83.3%

Синтетические рельсы

Склеенная читаемая речь, смена реплик взята из распределений, измеренных на срезах CallHome. Они выявляют только грубые доменные сбои. Не сравнивайте эти числа с таблицей выше.

СистемаАзербайджанскийШвейцарский немецкийРусский
Speech Cloud API4.74% / 83.3%19.33% / 41.7%8.15% / 75.0%
Sortformer streaming5.25% / 75.0%21.59% / 58.3%5.35% / 91.7%
Sortformer offline5.16% / 75.0%28.03% / 50.0%8.20% / 100.0%
MOSS11.30% / 58.3%26.59% / 41.7%15.14% / 50.0%
pyannote Community-135.23% / 16.7%45.21% / 0.0%35.26% / 8.3%

Запустить самостоятельно

Методика и ограничения · Результаты по языкам

soniqo/speech-bench-data (9c91223) · talkbank/callhome (17c8a153, CC BY-NC-SA 4.0)