Benchmarks de diarisation : pyannote, Sortformer, MOSS, Speech Cloud

Cinq systèmes de diarisation notés avec la même règle sur les mêmes 132 enregistrements : huit langues, 12,9 heures. Chaque système reçoit l'audio et rien d'autre. Aucun backend ne sait combien de locuteurs attendre, condition qui distingue un diariseur d'un script de clustering disposant déjà de la réponse.

Comment lire ces chiffres

Chaque cellule indique DER / concordance du nombre de locuteurs. Le DER est pondéré par le temps de parole de référence avec un collar de 0,25 s ; la concordance est la part de fichiers dont le nombre de locuteurs inféré correspond exactement à la référence dans l'UEM. Un DER plus bas est meilleur, une concordance plus élevée est meilleure. Conversation réelle et rails synthétiques relèvent de niveaux de preuve différents et ne doivent pas être comparés.

Résultats par langue

Conversation réelle

Audio de radiodiffusion, de téléphonie et de réunion. 96 enregistrements, 12,63 heures.

SystèmeArabeAllemandAnglaisEspagnolMandarin
Speech Cloud API21.02% / 33.3%7.62% / 91.7%13.21% / 66.7%15.92% / 58.3%9.63% / 58.3%
Sortformer streaming22.32% / 33.3%8.38% / 83.3%13.81% / 66.7%16.33% / 58.3%9.95% / 58.3%
Sortformer offline17.92% / 33.3%8.13% / 83.3%14.34% / 66.7%16.43% / 58.3%10.52% / 41.7%
MOSS14.57% / 41.7%16.95% / 83.3%16.35% / 72.9%22.51% / 75.0%10.12% / 83.3%
pyannote Community-115.57% / 58.3%20.22% / 83.3%15.22% / 77.1%22.78% / 91.7%16.19% / 83.3%

Rails synthétiques

Parole lue concaténée, dont les tours sont échantillonnés à partir de distributions mesurées sur les tranches CallHome. Ils ne détectent que des échecs de domaine grossiers. Ne comparez pas ces chiffres au tableau ci-dessus.

SystèmeAzerbaïdjanaisSuisse allemandRusse
Speech Cloud API4.74% / 83.3%19.33% / 41.7%8.15% / 75.0%
Sortformer streaming5.25% / 75.0%21.59% / 58.3%5.35% / 91.7%
Sortformer offline5.16% / 75.0%28.03% / 50.0%8.20% / 100.0%
MOSS11.30% / 58.3%26.59% / 41.7%15.14% / 50.0%
pyannote Community-135.23% / 16.7%45.21% / 0.0%35.26% / 8.3%

Exécutez-le vous-même

Méthodologie et limites · Résultats par langue

soniqo/speech-bench-data (9c91223) · talkbank/callhome (17c8a153, CC BY-NC-SA 4.0)