Benchmarks de diarização: pyannote, Sortformer, MOSS, Speech Cloud
Cinco sistemas de diarização pontuados com a mesma régua nas mesmas 132 gravações: oito idiomas, 12,9 horas. Cada sistema recebe o áudio e mais nada. Nenhum backend é informado de quantos falantes esperar, que é a condição que separa um diarizador de um script de clustering com a resposta em mãos.
Cada célula é o DER (taxa de erro de diarização), ponderado pelo tempo de fala de referência com collar de 0,25 s. Menor é melhor. Conversa real e trilhos sintéticos são níveis de evidência distintos e não devem ser comparados entre si.
Resultados por idioma
Conversa real
Áudio de radiodifusão, telefonia e reuniões. 96 gravações, 12,63 horas.
| Sistema | Árabe | Alemão | Inglês | Espanhol | Mandarim |
|---|---|---|---|---|---|
| DER, menor é melhor | |||||
| Speech Cloud API | 21.02% | 7.62% | 13.21% | 15.92% | 9.63% |
| Sortformer streaming | 22.32% | 8.38% | 13.81% | 16.33% | 9.95% |
| Sortformer offline | 17.92% | 8.13% | 14.34% | 16.43% | 10.52% |
| MOSS | 14.57% | 16.95% | 16.35% | 22.51% | 10.12% |
| pyannote Community-1 | 15.57% | 20.22% | 15.22% | 22.78% | 16.19% |
Trilhos sintéticos
Fala lida concatenada, com turnos amostrados de distribuições medidas nas fatias do CallHome. Detectam apenas falhas graves de domínio. Não compare estes números com a tabela acima.
| Sistema | Azerbaijano | Alemão suíço | Russo |
|---|---|---|---|
| DER, menor é melhor | |||
| Speech Cloud API | 4.74% | 19.33% | 8.15% |
| Sortformer streaming | 5.25% | 21.59% | 5.35% |
| Sortformer offline | 5.16% | 28.03% | 8.20% |
| MOSS | 11.30% | 26.59% | 15.14% |
| pyannote Community-1 | 35.23% | 45.21% | 35.26% |
Execute você mesmo
Metodologia e limites · Resultados por idioma
talkbank/callhome
(17c8a153, CC BY-NC-SA 4.0)