Diarisierungs-Benchmarks: pyannote, Sortformer, MOSS, Speech Cloud
Fünf Diarisierungssysteme, mit demselben Maßstab auf denselben 132 Aufnahmen bewertet: acht Sprachen, 12,9 Stunden. Jedes System erhält nur das Audio. Keinem Backend wird gesagt, wie viele Sprecher zu erwarten sind - genau diese Bedingung trennt einen Diarisierer von einem Clustering-Skript, das die Antwort schon kennt.
Jede Zelle ist der DER (Diarization Error Rate), gewichtet nach Referenz-Sprecherzeit mit 0,25 s Collar. Niedriger ist besser. Echte Konversation und synthetische Rails sind unterschiedliche Evidenzstufen und dürfen nicht gegeneinander gelesen werden.
Ergebnisse nach Sprache
Echte Konversation
Rundfunk-, Telefon- und Meeting-Audio. 96 Aufnahmen, 12,63 Stunden.
| System | Arabisch | Deutsch | Englisch | Spanisch | Mandarin |
|---|---|---|---|---|---|
| DER, niedriger ist besser | |||||
| Speech Cloud API | 21.02% | 7.62% | 13.21% | 15.92% | 9.63% |
| Sortformer streaming | 22.32% | 8.38% | 13.81% | 16.33% | 9.95% |
| Sortformer offline | 17.92% | 8.13% | 14.34% | 16.43% | 10.52% |
| MOSS | 14.57% | 16.95% | 16.35% | 22.51% | 10.12% |
| pyannote Community-1 | 15.57% | 20.22% | 15.22% | 22.78% | 16.19% |
Synthetische Rails
Aneinandergereihte Lesesprache, deren Sprecherwechsel aus Verteilungen gezogen werden, die an den CallHome-Slices gemessen wurden. Sie erkennen grobe Domänenfehler und sonst nichts. Vergleichen Sie diese Zahlen nicht mit der Tabelle oben.
| System | Aserbaidschanisch | Schweizerdeutsch | Russisch |
|---|---|---|---|
| DER, niedriger ist besser | |||
| Speech Cloud API | 4.74% | 19.33% | 8.15% |
| Sortformer streaming | 5.25% | 21.59% | 5.35% |
| Sortformer offline | 5.16% | 28.03% | 8.20% |
| MOSS | 11.30% | 26.59% | 15.14% |
| pyannote Community-1 | 35.23% | 45.21% | 35.26% |
Selbst ausführen
Methodik und Grenzen · Ergebnisse nach Sprache
talkbank/callhome
(17c8a153, CC BY-NC-SA 4.0)