Benchmarks de diarização: pyannote, Sortformer, MOSS, Speech Cloud

Cinco sistemas de diarização pontuados com a mesma régua nas mesmas 132 gravações: oito idiomas, 12,9 horas. Cada sistema recebe o áudio e mais nada. Nenhum backend é informado de quantos falantes esperar, que é a condição que separa um diarizador de um script de clustering com a resposta em mãos.

Como ler estes números

Cada célula é o DER (taxa de erro de diarização), ponderado pelo tempo de fala de referência com collar de 0,25 s. Menor é melhor. Conversa real e trilhos sintéticos são níveis de evidência distintos e não devem ser comparados entre si.

Resultados por idioma

Conversa real

Áudio de radiodifusão, telefonia e reuniões. 96 gravações, 12,63 horas.

SistemaÁrabeAlemãoInglêsEspanholMandarim
DER, menor é melhor
Speech Cloud API21.02%7.62%13.21%15.92%9.63%
Sortformer streaming22.32%8.38%13.81%16.33%9.95%
Sortformer offline17.92%8.13%14.34%16.43%10.52%
MOSS14.57%16.95%16.35%22.51%10.12%
pyannote Community-115.57%20.22%15.22%22.78%16.19%

Trilhos sintéticos

Fala lida concatenada, com turnos amostrados de distribuições medidas nas fatias do CallHome. Detectam apenas falhas graves de domínio. Não compare estes números com a tabela acima.

SistemaAzerbaijanoAlemão suíçoRusso
DER, menor é melhor
Speech Cloud API4.74%19.33%8.15%
Sortformer streaming5.25%21.59%5.35%
Sortformer offline5.16%28.03%8.20%
MOSS11.30%26.59%15.14%
pyannote Community-135.23%45.21%35.26%

Execute você mesmo

Metodologia e limites · Resultados por idioma

talkbank/callhome (17c8a153, CC BY-NC-SA 4.0)