Diarisierungs-Benchmarks: pyannote, Sortformer, MOSS, Speech Cloud

Fünf Diarisierungssysteme, mit demselben Maßstab auf denselben 132 Aufnahmen bewertet: acht Sprachen, 12,9 Stunden. Jedes System erhält nur das Audio. Keinem Backend wird gesagt, wie viele Sprecher zu erwarten sind - genau diese Bedingung trennt einen Diarisierer von einem Clustering-Skript, das die Antwort schon kennt.

Wie diese Zahlen zu lesen sind

Jede Zelle ist der DER (Diarization Error Rate), gewichtet nach Referenz-Sprecherzeit mit 0,25 s Collar. Niedriger ist besser. Echte Konversation und synthetische Rails sind unterschiedliche Evidenzstufen und dürfen nicht gegeneinander gelesen werden.

Ergebnisse nach Sprache

Echte Konversation

Rundfunk-, Telefon- und Meeting-Audio. 96 Aufnahmen, 12,63 Stunden.

SystemArabischDeutschEnglischSpanischMandarin
DER, niedriger ist besser
Speech Cloud API21.02%7.62%13.21%15.92%9.63%
Sortformer streaming22.32%8.38%13.81%16.33%9.95%
Sortformer offline17.92%8.13%14.34%16.43%10.52%
MOSS14.57%16.95%16.35%22.51%10.12%
pyannote Community-115.57%20.22%15.22%22.78%16.19%

Synthetische Rails

Aneinandergereihte Lesesprache, deren Sprecherwechsel aus Verteilungen gezogen werden, die an den CallHome-Slices gemessen wurden. Sie erkennen grobe Domänenfehler und sonst nichts. Vergleichen Sie diese Zahlen nicht mit der Tabelle oben.

SystemAserbaidschanischSchweizerdeutschRussisch
DER, niedriger ist besser
Speech Cloud API4.74%19.33%8.15%
Sortformer streaming5.25%21.59%5.35%
Sortformer offline5.16%28.03%8.20%
MOSS11.30%26.59%15.14%
pyannote Community-135.23%45.21%35.26%

Selbst ausführen

Methodik und Grenzen · Ergebnisse nach Sprache

talkbank/callhome (17c8a153, CC BY-NC-SA 4.0)