Diarisierungs-Benchmarks: pyannote, Sortformer, MOSS, Speech Cloud
Fünf Diarisierungssysteme, mit demselben Maßstab auf denselben 132 Aufnahmen bewertet: acht Sprachen, 12,9 Stunden. Jedes System erhält nur das Audio. Keinem Backend wird gesagt, wie viele Sprecher zu erwarten sind - genau diese Bedingung trennt einen Diarisierer von einem Clustering-Skript, das die Antwort schon kennt.
Jede Zelle ist DER / Übereinstimmung der Sprecheranzahl. Der DER ist nach Referenz-Sprecherzeit gewichtet, mit 0,25 s Collar; die Übereinstimmung ist der Anteil der Dateien, deren ermittelte Sprecheranzahl innerhalb des UEM exakt der Referenz entspricht. Niedrigerer DER ist besser, höhere Übereinstimmung ist besser. Echte Konversation und synthetische Rails sind unterschiedliche Evidenzstufen und dürfen nicht gegeneinander gelesen werden.
Ergebnisse nach Sprache
Echte Konversation
Rundfunk-, Telefon- und Meeting-Audio. 96 Aufnahmen, 12,63 Stunden.
| System | Arabisch | Deutsch | Englisch | Spanisch | Mandarin |
|---|---|---|---|---|---|
| Speech Cloud API | 21.02% / 33.3% | 7.62% / 91.7% | 13.21% / 66.7% | 15.92% / 58.3% | 9.63% / 58.3% |
| Sortformer streaming | 22.32% / 33.3% | 8.38% / 83.3% | 13.81% / 66.7% | 16.33% / 58.3% | 9.95% / 58.3% |
| Sortformer offline | 17.92% / 33.3% | 8.13% / 83.3% | 14.34% / 66.7% | 16.43% / 58.3% | 10.52% / 41.7% |
| MOSS | 14.57% / 41.7% | 16.95% / 83.3% | 16.35% / 72.9% | 22.51% / 75.0% | 10.12% / 83.3% |
| pyannote Community-1 | 15.57% / 58.3% | 20.22% / 83.3% | 15.22% / 77.1% | 22.78% / 91.7% | 16.19% / 83.3% |
Synthetische Rails
Aneinandergereihte Lesesprache, deren Sprecherwechsel aus Verteilungen gezogen werden, die an den CallHome-Slices gemessen wurden. Sie erkennen grobe Domänenfehler und sonst nichts. Vergleichen Sie diese Zahlen nicht mit der Tabelle oben.
| System | Aserbaidschanisch | Schweizerdeutsch | Russisch |
|---|---|---|---|
| Speech Cloud API | 4.74% / 83.3% | 19.33% / 41.7% | 8.15% / 75.0% |
| Sortformer streaming | 5.25% / 75.0% | 21.59% / 58.3% | 5.35% / 91.7% |
| Sortformer offline | 5.16% / 75.0% | 28.03% / 50.0% | 8.20% / 100.0% |
| MOSS | 11.30% / 58.3% | 26.59% / 41.7% | 15.14% / 50.0% |
| pyannote Community-1 | 35.23% / 16.7% | 45.21% / 0.0% | 35.26% / 8.3% |
Selbst ausführen
Methodik und Grenzen · Ergebnisse nach Sprache
soniqo/speech-bench-data
(9c91223) · talkbank/callhome
(17c8a153, CC BY-NC-SA 4.0)