Diarisierungs-Benchmarks: pyannote, Sortformer, MOSS, Speech Cloud

Fünf Diarisierungssysteme, mit demselben Maßstab auf denselben 132 Aufnahmen bewertet: acht Sprachen, 12,9 Stunden. Jedes System erhält nur das Audio. Keinem Backend wird gesagt, wie viele Sprecher zu erwarten sind - genau diese Bedingung trennt einen Diarisierer von einem Clustering-Skript, das die Antwort schon kennt.

Wie diese Zahlen zu lesen sind

Jede Zelle ist DER / Übereinstimmung der Sprecheranzahl. Der DER ist nach Referenz-Sprecherzeit gewichtet, mit 0,25 s Collar; die Übereinstimmung ist der Anteil der Dateien, deren ermittelte Sprecheranzahl innerhalb des UEM exakt der Referenz entspricht. Niedrigerer DER ist besser, höhere Übereinstimmung ist besser. Echte Konversation und synthetische Rails sind unterschiedliche Evidenzstufen und dürfen nicht gegeneinander gelesen werden.

Ergebnisse nach Sprache

Echte Konversation

Rundfunk-, Telefon- und Meeting-Audio. 96 Aufnahmen, 12,63 Stunden.

SystemArabischDeutschEnglischSpanischMandarin
Speech Cloud API21.02% / 33.3%7.62% / 91.7%13.21% / 66.7%15.92% / 58.3%9.63% / 58.3%
Sortformer streaming22.32% / 33.3%8.38% / 83.3%13.81% / 66.7%16.33% / 58.3%9.95% / 58.3%
Sortformer offline17.92% / 33.3%8.13% / 83.3%14.34% / 66.7%16.43% / 58.3%10.52% / 41.7%
MOSS14.57% / 41.7%16.95% / 83.3%16.35% / 72.9%22.51% / 75.0%10.12% / 83.3%
pyannote Community-115.57% / 58.3%20.22% / 83.3%15.22% / 77.1%22.78% / 91.7%16.19% / 83.3%

Synthetische Rails

Aneinandergereihte Lesesprache, deren Sprecherwechsel aus Verteilungen gezogen werden, die an den CallHome-Slices gemessen wurden. Sie erkennen grobe Domänenfehler und sonst nichts. Vergleichen Sie diese Zahlen nicht mit der Tabelle oben.

SystemAserbaidschanischSchweizerdeutschRussisch
Speech Cloud API4.74% / 83.3%19.33% / 41.7%8.15% / 75.0%
Sortformer streaming5.25% / 75.0%21.59% / 58.3%5.35% / 91.7%
Sortformer offline5.16% / 75.0%28.03% / 50.0%8.20% / 100.0%
MOSS11.30% / 58.3%26.59% / 41.7%15.14% / 50.0%
pyannote Community-135.23% / 16.7%45.21% / 0.0%35.26% / 8.3%

Selbst ausführen

Methodik und Grenzen · Ergebnisse nach Sprache

soniqo/speech-bench-data (9c91223) · talkbank/callhome (17c8a153, CC BY-NC-SA 4.0)