اختبارات فصل المتحدثين: pyannote وSortformer وMOSS وSpeech Cloud
خمسة أنظمة لفصل المتحدثين قُيِّمت بالمسطرة نفسها على التسجيلات الـ132 نفسها: ثماني لغات، 12.9 ساعة. يتلقى كل نظام الصوت فقط. لا يُخبَر أي نظام بعدد المتحدثين المتوقع، وهو الشرط الذي يفصل أداة فصل حقيقية عن سكربت تجميع يعرف الإجابة مسبقًا.
كيف تقرأ هذه الأرقام
كل خلية هي DER (معدل خطأ التقسيم)، مُرجَّح بزمن المتحدث المرجعي بهامش 0.25 ثانية. كلما انخفض كان أفضل. المحادثة الحقيقية والمسارات التركيبية مستويان مختلفان من الأدلة ولا يصح مقارنتهما ببعض.
النتائج حسب اللغة
محادثة حقيقية
صوت بث وهاتف واجتماعات. 96 تسجيلًا، 12.63 ساعة.
| النظام | العربية | الألمانية | الإنجليزية | الإسبانية | الصينية |
|---|---|---|---|---|---|
| DER: الأقل أفضل | |||||
| Speech Cloud API | 21.02% | 7.62% | 13.21% | 15.92% | 9.63% |
| Sortformer streaming | 22.32% | 8.38% | 13.81% | 16.33% | 9.95% |
| Sortformer offline | 17.92% | 8.13% | 14.34% | 16.43% | 10.52% |
| MOSS | 14.57% | 16.95% | 16.35% | 22.51% | 10.12% |
| pyannote Community-1 | 15.57% | 20.22% | 15.22% | 22.78% | 16.19% |
مسارات تركيبية
كلام مقروء مُجمَّع، وأُخذت تبادلات الأدوار من توزيعات مقيسة على شرائح CallHome. تكشف الأعطال الجسيمة في المجال فقط. لا تقارن هذه الأرقام بالجدول أعلاه.
| النظام | الأذربيجانية | الألمانية السويسرية | الروسية |
|---|---|---|---|
| DER: الأقل أفضل | |||
| Speech Cloud API | 4.74% | 19.33% | 8.15% |
| Sortformer streaming | 5.25% | 21.59% | 5.35% |
| Sortformer offline | 5.16% | 28.03% | 8.20% |
| MOSS | 11.30% | 26.59% | 15.14% |
| pyannote Community-1 | 35.23% | 45.21% | 35.26% |
شغّلها بنفسك
المنهجية والحدود · النتائج حسب اللغة
talkbank/callhome
(17c8a153, CC BY-NC-SA 4.0)