स्पीकर डायराइज़ेशन बेंचमार्क: pyannote, Sortformer, MOSS, Speech Cloud

पाँच डायराइज़ेशन सिस्टम, उन्हीं 132 रिकॉर्डिंग पर एक ही पैमाने से आँके गए: आठ भाषाएँ, 12.9 घंटे। हर सिस्टम को केवल ऑडियो मिलता है। किसी भी बैकएंड को स्पीकर की संख्या नहीं बताई जाती — यही शर्त एक असली डायराइज़र को उस क्लस्टरिंग स्क्रिप्ट से अलग करती है जिसके पास पहले से उत्तर है।

इन आँकड़ों को कैसे पढ़ें

हर सेल DER (डायराइज़ेशन त्रुटि दर) है, संदर्भ स्पीकर-समय से भारित, कॉलर 0.25 सेकंड। कम बेहतर है। वास्तविक बातचीत और सिंथेटिक रेल अलग प्रमाण-स्तर हैं और इनकी आपस में तुलना नहीं करनी चाहिए।

भाषा के अनुसार परिणाम

वास्तविक बातचीत

प्रसारण, टेलीफ़ोन और मीटिंग ऑडियो। 96 रिकॉर्डिंग, 12.63 घंटे।

सिस्टमअरबीजर्मनअंग्रेज़ीस्पेनिशमंदारिन
DER, कम बेहतर
Speech Cloud API21.02%7.62%13.21%15.92%9.63%
Sortformer streaming22.32%8.38%13.81%16.33%9.95%
Sortformer offline17.92%8.13%14.34%16.43%10.52%
MOSS14.57%16.95%16.35%22.51%10.12%
pyannote Community-115.57%20.22%15.22%22.78%16.19%

सिंथेटिक रेल

जोड़ी गई पठित वाणी, जिसमें टर्न-टेकिंग CallHome स्लाइस पर मापे गए वितरण से लिया गया है। ये केवल बड़ी डोमेन विफलताएँ पकड़ते हैं। इनकी तुलना ऊपर की तालिका से न करें।

सिस्टमअज़रबैजानीस्विस जर्मनरूसी
DER, कम बेहतर
Speech Cloud API4.74%19.33%8.15%
Sortformer streaming5.25%21.59%5.35%
Sortformer offline5.16%28.03%8.20%
MOSS11.30%26.59%15.14%
pyannote Community-135.23%45.21%35.26%

स्वयं चलाएँ

पद्धति और सीमाएँ · भाषा के अनुसार परिणाम

talkbank/callhome (17c8a153, CC BY-NC-SA 4.0)