स्पीकर डायराइज़ेशन बेंचमार्क: pyannote, Sortformer, MOSS, Speech Cloud

पाँच डायराइज़ेशन सिस्टम, उन्हीं 132 रिकॉर्डिंग पर एक ही पैमाने से आँके गए: आठ भाषाएँ, 12.9 घंटे। हर सिस्टम को केवल ऑडियो मिलता है। किसी भी बैकएंड को स्पीकर की संख्या नहीं बताई जाती — यही शर्त एक असली डायराइज़र को उस क्लस्टरिंग स्क्रिप्ट से अलग करती है जिसके पास पहले से उत्तर है।

इन आँकड़ों को कैसे पढ़ें

हर सेल DER / स्पीकर-संख्या मिलान है। DER संदर्भ स्पीकर-समय से भारित है, कॉलर 0.25 सेकंड; मिलान उन फ़ाइलों का अनुपात है जिनकी अनुमानित स्पीकर संख्या UEM के भीतर संदर्भ से बिल्कुल मेल खाती है। कम DER बेहतर, अधिक मिलान बेहतर। वास्तविक बातचीत और सिंथेटिक रेल अलग प्रमाण-स्तर हैं और इनकी आपस में तुलना नहीं करनी चाहिए।

भाषा के अनुसार परिणाम

वास्तविक बातचीत

प्रसारण, टेलीफ़ोन और मीटिंग ऑडियो। 96 रिकॉर्डिंग, 12.63 घंटे।

सिस्टमअरबीजर्मनअंग्रेज़ीस्पेनिशमंदारिन
Speech Cloud API21.02% / 33.3%7.62% / 91.7%13.21% / 66.7%15.92% / 58.3%9.63% / 58.3%
Sortformer streaming22.32% / 33.3%8.38% / 83.3%13.81% / 66.7%16.33% / 58.3%9.95% / 58.3%
Sortformer offline17.92% / 33.3%8.13% / 83.3%14.34% / 66.7%16.43% / 58.3%10.52% / 41.7%
MOSS14.57% / 41.7%16.95% / 83.3%16.35% / 72.9%22.51% / 75.0%10.12% / 83.3%
pyannote Community-115.57% / 58.3%20.22% / 83.3%15.22% / 77.1%22.78% / 91.7%16.19% / 83.3%

सिंथेटिक रेल

जोड़ी गई पठित वाणी, जिसमें टर्न-टेकिंग CallHome स्लाइस पर मापे गए वितरण से लिया गया है। ये केवल बड़ी डोमेन विफलताएँ पकड़ते हैं। इनकी तुलना ऊपर की तालिका से न करें।

सिस्टमअज़रबैजानीस्विस जर्मनरूसी
Speech Cloud API4.74% / 83.3%19.33% / 41.7%8.15% / 75.0%
Sortformer streaming5.25% / 75.0%21.59% / 58.3%5.35% / 91.7%
Sortformer offline5.16% / 75.0%28.03% / 50.0%8.20% / 100.0%
MOSS11.30% / 58.3%26.59% / 41.7%15.14% / 50.0%
pyannote Community-135.23% / 16.7%45.21% / 0.0%35.26% / 8.3%

स्वयं चलाएँ

पद्धति और सीमाएँ · भाषा के अनुसार परिणाम

soniqo/speech-bench-data (9c91223) · talkbank/callhome (17c8a153, CC BY-NC-SA 4.0)