Benchmarks de diarización: pyannote, Sortformer, MOSS, Speech Cloud
Cinco sistemas de diarización puntuados con la misma vara sobre las mismas 132 grabaciones: ocho idiomas, 12,9 horas. Cada sistema recibe el audio y nada más. A ningún backend se le dice cuántos hablantes esperar, que es la condición que separa un diarizador de un script de clustering con la respuesta en la mano.
Cada celda es DER / coincidencia de recuento de hablantes. El DER se pondera por tiempo de hablante de referencia con un collar de 0,25 s; la coincidencia es la proporción de archivos cuyo recuento inferido coincide exactamente con la referencia dentro del UEM. Menos DER es mejor, más coincidencia es mejor. La conversación real y los raíles sintéticos son niveles de evidencia distintos y no deben compararse entre sí.
Resultados por idioma
Conversación real
Audio de radiodifusión, telefonía y reuniones. 96 grabaciones, 12,63 horas.
| Sistema | Árabe | Alemán | Inglés | Español | Mandarín |
|---|---|---|---|---|---|
| Speech Cloud API | 21.02% / 33.3% | 7.62% / 91.7% | 13.21% / 66.7% | 15.92% / 58.3% | 9.63% / 58.3% |
| Sortformer streaming | 22.32% / 33.3% | 8.38% / 83.3% | 13.81% / 66.7% | 16.33% / 58.3% | 9.95% / 58.3% |
| Sortformer offline | 17.92% / 33.3% | 8.13% / 83.3% | 14.34% / 66.7% | 16.43% / 58.3% | 10.52% / 41.7% |
| MOSS | 14.57% / 41.7% | 16.95% / 83.3% | 16.35% / 72.9% | 22.51% / 75.0% | 10.12% / 83.3% |
| pyannote Community-1 | 15.57% / 58.3% | 20.22% / 83.3% | 15.22% / 77.1% | 22.78% / 91.7% | 16.19% / 83.3% |
Raíles sintéticos
Habla leída concatenada, con turnos muestreados de distribuciones medidas en las porciones de CallHome. Solo detectan fallos graves de dominio. No compare estos números con la tabla anterior.
| Sistema | Azerbaiyano | Alemán suizo | Ruso |
|---|---|---|---|
| Speech Cloud API | 4.74% / 83.3% | 19.33% / 41.7% | 8.15% / 75.0% |
| Sortformer streaming | 5.25% / 75.0% | 21.59% / 58.3% | 5.35% / 91.7% |
| Sortformer offline | 5.16% / 75.0% | 28.03% / 50.0% | 8.20% / 100.0% |
| MOSS | 11.30% / 58.3% | 26.59% / 41.7% | 15.14% / 50.0% |
| pyannote Community-1 | 35.23% / 16.7% | 45.21% / 0.0% | 35.26% / 8.3% |
Ejecútelo usted mismo
Metodología y límites · Resultados por idioma
soniqo/speech-bench-data
(9c91223) · talkbank/callhome
(17c8a153, CC BY-NC-SA 4.0)