स्पीकर डायराइज़ेशन बेंचमार्क: pyannote, Sortformer, MOSS, Speech Cloud
पाँच डायराइज़ेशन सिस्टम, उन्हीं 132 रिकॉर्डिंग पर एक ही पैमाने से आँके गए: आठ भाषाएँ, 12.9 घंटे। हर सिस्टम को केवल ऑडियो मिलता है। किसी भी बैकएंड को स्पीकर की संख्या नहीं बताई जाती — यही शर्त एक असली डायराइज़र को उस क्लस्टरिंग स्क्रिप्ट से अलग करती है जिसके पास पहले से उत्तर है।
हर सेल DER (डायराइज़ेशन त्रुटि दर) है, संदर्भ स्पीकर-समय से भारित, कॉलर 0.25 सेकंड। कम बेहतर है। वास्तविक बातचीत और सिंथेटिक रेल अलग प्रमाण-स्तर हैं और इनकी आपस में तुलना नहीं करनी चाहिए।
भाषा के अनुसार परिणाम
वास्तविक बातचीत
प्रसारण, टेलीफ़ोन और मीटिंग ऑडियो। 96 रिकॉर्डिंग, 12.63 घंटे।
| सिस्टम | अरबी | जर्मन | अंग्रेज़ी | स्पेनिश | मंदारिन |
|---|---|---|---|---|---|
| DER, कम बेहतर | |||||
| Speech Cloud API | 21.02% | 7.62% | 13.21% | 15.92% | 9.63% |
| Sortformer streaming | 22.32% | 8.38% | 13.81% | 16.33% | 9.95% |
| Sortformer offline | 17.92% | 8.13% | 14.34% | 16.43% | 10.52% |
| MOSS | 14.57% | 16.95% | 16.35% | 22.51% | 10.12% |
| pyannote Community-1 | 15.57% | 20.22% | 15.22% | 22.78% | 16.19% |
सिंथेटिक रेल
जोड़ी गई पठित वाणी, जिसमें टर्न-टेकिंग CallHome स्लाइस पर मापे गए वितरण से लिया गया है। ये केवल बड़ी डोमेन विफलताएँ पकड़ते हैं। इनकी तुलना ऊपर की तालिका से न करें।
| सिस्टम | अज़रबैजानी | स्विस जर्मन | रूसी |
|---|---|---|---|
| DER, कम बेहतर | |||
| Speech Cloud API | 4.74% | 19.33% | 8.15% |
| Sortformer streaming | 5.25% | 21.59% | 5.35% |
| Sortformer offline | 5.16% | 28.03% | 8.20% |
| MOSS | 11.30% | 26.59% | 15.14% |
| pyannote Community-1 | 35.23% | 45.21% | 35.26% |
स्वयं चलाएँ
पद्धति और सीमाएँ · भाषा के अनुसार परिणाम
talkbank/callhome
(17c8a153, CC BY-NC-SA 4.0)