Benchmarks de diarisation : pyannote, Sortformer, MOSS, Speech Cloud
Cinq systèmes de diarisation notés avec la même règle sur les mêmes 132 enregistrements : huit langues, 12,9 heures. Chaque système reçoit l'audio et rien d'autre. Aucun backend ne sait combien de locuteurs attendre, condition qui distingue un diariseur d'un script de clustering disposant déjà de la réponse.
Chaque cellule indique DER / concordance du nombre de locuteurs. Le DER est pondéré par le temps de parole de référence avec un collar de 0,25 s ; la concordance est la part de fichiers dont le nombre de locuteurs inféré correspond exactement à la référence dans l'UEM. Un DER plus bas est meilleur, une concordance plus élevée est meilleure. Conversation réelle et rails synthétiques relèvent de niveaux de preuve différents et ne doivent pas être comparés.
Résultats par langue
Conversation réelle
Audio de radiodiffusion, de téléphonie et de réunion. 96 enregistrements, 12,63 heures.
| Système | Arabe | Allemand | Anglais | Espagnol | Mandarin |
|---|---|---|---|---|---|
| Speech Cloud API | 21.02% / 33.3% | 7.62% / 91.7% | 13.21% / 66.7% | 15.92% / 58.3% | 9.63% / 58.3% |
| Sortformer streaming | 22.32% / 33.3% | 8.38% / 83.3% | 13.81% / 66.7% | 16.33% / 58.3% | 9.95% / 58.3% |
| Sortformer offline | 17.92% / 33.3% | 8.13% / 83.3% | 14.34% / 66.7% | 16.43% / 58.3% | 10.52% / 41.7% |
| MOSS | 14.57% / 41.7% | 16.95% / 83.3% | 16.35% / 72.9% | 22.51% / 75.0% | 10.12% / 83.3% |
| pyannote Community-1 | 15.57% / 58.3% | 20.22% / 83.3% | 15.22% / 77.1% | 22.78% / 91.7% | 16.19% / 83.3% |
Rails synthétiques
Parole lue concaténée, dont les tours sont échantillonnés à partir de distributions mesurées sur les tranches CallHome. Ils ne détectent que des échecs de domaine grossiers. Ne comparez pas ces chiffres au tableau ci-dessus.
| Système | Azerbaïdjanais | Suisse allemand | Russe |
|---|---|---|---|
| Speech Cloud API | 4.74% / 83.3% | 19.33% / 41.7% | 8.15% / 75.0% |
| Sortformer streaming | 5.25% / 75.0% | 21.59% / 58.3% | 5.35% / 91.7% |
| Sortformer offline | 5.16% / 75.0% | 28.03% / 50.0% | 8.20% / 100.0% |
| MOSS | 11.30% / 58.3% | 26.59% / 41.7% | 15.14% / 50.0% |
| pyannote Community-1 | 35.23% / 16.7% | 45.21% / 0.0% | 35.26% / 8.3% |
Exécutez-le vous-même
Méthodologie et limites · Résultats par langue
soniqo/speech-bench-data
(9c91223) · talkbank/callhome
(17c8a153, CC BY-NC-SA 4.0)