Benchmarks de diarisation : pyannote, Sortformer, MOSS, Speech Cloud

Cinq systèmes de diarisation notés avec la même règle sur les mêmes 132 enregistrements : huit langues, 12,9 heures. Chaque système reçoit l'audio et rien d'autre. Aucun backend ne sait combien de locuteurs attendre, condition qui distingue un diariseur d'un script de clustering disposant déjà de la réponse.

Comment lire ces chiffres

Chaque cellule indique le DER (taux d'erreur de diarisation), pondéré par le temps de parole de référence avec un collar de 0,25 s. Plus bas est meilleur. Conversation réelle et rails synthétiques relèvent de niveaux de preuve différents et ne doivent pas être comparés.

Résultats par langue

Conversation réelle

Audio de radiodiffusion, de téléphonie et de réunion. 96 enregistrements, 12,63 heures.

SystèmeArabeAllemandAnglaisEspagnolMandarin
DER, plus bas est meilleur
Speech Cloud API21.02%7.62%13.21%15.92%9.63%
Sortformer streaming22.32%8.38%13.81%16.33%9.95%
Sortformer offline17.92%8.13%14.34%16.43%10.52%
MOSS14.57%16.95%16.35%22.51%10.12%
pyannote Community-115.57%20.22%15.22%22.78%16.19%

Rails synthétiques

Parole lue concaténée, dont les tours sont échantillonnés à partir de distributions mesurées sur les tranches CallHome. Ils ne détectent que des échecs de domaine grossiers. Ne comparez pas ces chiffres au tableau ci-dessus.

SystèmeAzerbaïdjanaisSuisse allemandRusse
DER, plus bas est meilleur
Speech Cloud API4.74%19.33%8.15%
Sortformer streaming5.25%21.59%5.35%
Sortformer offline5.16%28.03%8.20%
MOSS11.30%26.59%15.14%
pyannote Community-135.23%45.21%35.26%

Exécutez-le vous-même

Méthodologie et limites · Résultats par langue

talkbank/callhome (17c8a153, CC BY-NC-SA 4.0)