Konuşmacı ayrıştırma kıyaslamaları: pyannote, Sortformer, MOSS, Speech Cloud
Beş ayrıştırma sistemi, aynı 132 kayıt üzerinde tek bir cetvelle puanlandı: sekiz dil, 12,9 saat. Her sisteme yalnızca ses verilir. Hiçbir arka uca kaç konuşmacı bekleneceği söylenmez; gerçek bir ayrıştırıcıyı, cevabı elinde tutan bir kümeleme betiğinden ayıran koşul budur.
Her hücre DER (diyarizasyon hata oranı) değeridir; referans konuşmacı süresine göre ağırlıklandırılır ve collar 0,25 sn'dir. Düşük olan iyidir. Gerçek konuşma ile sentetik raylar farklı kanıt düzeyleridir ve birbirleriyle karşılaştırılmamalıdır.
Dile göre sonuçlar
Gerçek konuşma
Yayın, telefon ve toplantı sesi. 96 kayıt, 12,63 saat.
| Sistem | Arapça | Almanca | İngilizce | İspanyolca | Mandarin |
|---|---|---|---|---|---|
| DER, düşük olan iyidir | |||||
| Speech Cloud API | 21.02% | 7.62% | 13.21% | 15.92% | 9.63% |
| Sortformer streaming | 22.32% | 8.38% | 13.81% | 16.33% | 9.95% |
| Sortformer offline | 17.92% | 8.13% | 14.34% | 16.43% | 10.52% |
| MOSS | 14.57% | 16.95% | 16.35% | 22.51% | 10.12% |
| pyannote Community-1 | 15.57% | 20.22% | 15.22% | 22.78% | 16.19% |
Sentetik raylar
Birleştirilmiş okuma konuşması; sıra alma, CallHome dilimlerinde ölçülen dağılımlardan örneklendi. Yalnızca ciddi alan hatalarını yakalar. Bu sayıları yukarıdaki tabloyla karşılaştırmayın.
| Sistem | Azerice | İsviçre Almancası | Rusça |
|---|---|---|---|
| DER, düşük olan iyidir | |||
| Speech Cloud API | 4.74% | 19.33% | 8.15% |
| Sortformer streaming | 5.25% | 21.59% | 5.35% |
| Sortformer offline | 5.16% | 28.03% | 8.20% |
| MOSS | 11.30% | 26.59% | 15.14% |
| pyannote Community-1 | 35.23% | 45.21% | 35.26% |
Kendiniz çalıştırın
Yöntem ve sınırlar · Dile göre sonuçlar
talkbank/callhome
(17c8a153, CC BY-NC-SA 4.0)