Benchmarks de diarización: pyannote, Sortformer, MOSS, Speech Cloud
Cinco sistemas de diarización puntuados con la misma vara sobre las mismas 132 grabaciones: ocho idiomas, 12,9 horas. Cada sistema recibe el audio y nada más. A ningún backend se le dice cuántos hablantes esperar, que es la condición que separa un diarizador de un script de clustering con la respuesta en la mano.
Cada celda es el DER (tasa de error de diarización), ponderado por tiempo de hablante de referencia con un collar de 0,25 s. Menos es mejor. La conversación real y los raíles sintéticos son niveles de evidencia distintos y no deben compararse entre sí.
Resultados por idioma
Conversación real
Audio de radiodifusión, telefonía y reuniones. 96 grabaciones, 12,63 horas.
| Sistema | Árabe | Alemán | Inglés | Español | Mandarín |
|---|---|---|---|---|---|
| DER, menor es mejor | |||||
| Speech Cloud API | 21.02% | 7.62% | 13.21% | 15.92% | 9.63% |
| Sortformer streaming | 22.32% | 8.38% | 13.81% | 16.33% | 9.95% |
| Sortformer offline | 17.92% | 8.13% | 14.34% | 16.43% | 10.52% |
| MOSS | 14.57% | 16.95% | 16.35% | 22.51% | 10.12% |
| pyannote Community-1 | 15.57% | 20.22% | 15.22% | 22.78% | 16.19% |
Raíles sintéticos
Habla leída concatenada, con turnos muestreados de distribuciones medidas en las porciones de CallHome. Solo detectan fallos graves de dominio. No compare estos números con la tabla anterior.
| Sistema | Azerbaiyano | Alemán suizo | Ruso |
|---|---|---|---|
| DER, menor es mejor | |||
| Speech Cloud API | 4.74% | 19.33% | 8.15% |
| Sortformer streaming | 5.25% | 21.59% | 5.35% |
| Sortformer offline | 5.16% | 28.03% | 8.20% |
| MOSS | 11.30% | 26.59% | 15.14% |
| pyannote Community-1 | 35.23% | 45.21% | 35.26% |
Ejecútelo usted mismo
Metodología y límites · Resultados por idioma
talkbank/callhome
(17c8a153, CC BY-NC-SA 4.0)