Бенчмарки диаризации: pyannote, Sortformer, MOSS, Speech Cloud

Пять систем диаризации оценены одной меркой на одних и тех же 132 записях: восемь языков, 12,9 часа. Каждая система получает только аудио. Ни одному бэкенду не сообщается число говорящих — именно это условие отличает диаризатор от скрипта кластеризации, которому ответ известен заранее.

Как читать эти числа

В каждой ячейке — DER (доля ошибок диаризации), взвешенный по эталонному времени речи с collar 0,25 с. Чем ниже, тем лучше. Реальный разговор и синтетические рельсы — разные уровни доказательности, сравнивать их между собой нельзя.

Результаты по языкам

Реальный разговор

Эфир, телефония и совещания. 96 записей, 12,63 часа.

СистемаАрабскийНемецкийАнглийскийИспанскийКитайский
DER: чем ниже, тем лучше
Speech Cloud API21.02%7.62%13.21%15.92%9.63%
Sortformer streaming22.32%8.38%13.81%16.33%9.95%
Sortformer offline17.92%8.13%14.34%16.43%10.52%
MOSS14.57%16.95%16.35%22.51%10.12%
pyannote Community-115.57%20.22%15.22%22.78%16.19%

Синтетические рельсы

Склеенная читаемая речь, смена реплик взята из распределений, измеренных на срезах CallHome. Они выявляют только грубые доменные сбои. Не сравнивайте эти числа с таблицей выше.

СистемаАзербайджанскийШвейцарский немецкийРусский
DER: чем ниже, тем лучше
Speech Cloud API4.74%19.33%8.15%
Sortformer streaming5.25%21.59%5.35%
Sortformer offline5.16%28.03%8.20%
MOSS11.30%26.59%15.14%
pyannote Community-135.23%45.21%35.26%

Запустить самостоятельно

Методика и ограничения · Результаты по языкам

talkbank/callhome (17c8a153, CC BY-NC-SA 4.0)