اختبارات فصل المتحدثين: pyannote وSortformer وMOSS وSpeech Cloud
خمسة أنظمة لفصل المتحدثين قُيِّمت بالمسطرة نفسها على التسجيلات الـ132 نفسها: ثماني لغات، 12.9 ساعة. يتلقى كل نظام الصوت فقط. لا يُخبَر أي نظام بعدد المتحدثين المتوقع، وهو الشرط الذي يفصل أداة فصل حقيقية عن سكربت تجميع يعرف الإجابة مسبقًا.
كل خلية هي DER / تطابق عدد المتحدثين. يُرجَّح DER بزمن المتحدث المرجعي بهامش 0.25 ثانية؛ والتطابق هو نسبة الملفات التي يطابق فيها العدد المستنتج المرجع تمامًا داخل UEM. كلما انخفض DER كان أفضل، وكلما ارتفع التطابق كان أفضل. المحادثة الحقيقية والمسارات التركيبية مستويان مختلفان من الأدلة ولا يصح مقارنتهما ببعض.
النتائج حسب اللغة
محادثة حقيقية
صوت بث وهاتف واجتماعات. 96 تسجيلًا، 12.63 ساعة.
| النظام | العربية | الألمانية | الإنجليزية | الإسبانية | الصينية |
|---|---|---|---|---|---|
| Speech Cloud API | 21.02% / 33.3% | 7.62% / 91.7% | 13.21% / 66.7% | 15.92% / 58.3% | 9.63% / 58.3% |
| Sortformer streaming | 22.32% / 33.3% | 8.38% / 83.3% | 13.81% / 66.7% | 16.33% / 58.3% | 9.95% / 58.3% |
| Sortformer offline | 17.92% / 33.3% | 8.13% / 83.3% | 14.34% / 66.7% | 16.43% / 58.3% | 10.52% / 41.7% |
| MOSS | 14.57% / 41.7% | 16.95% / 83.3% | 16.35% / 72.9% | 22.51% / 75.0% | 10.12% / 83.3% |
| pyannote Community-1 | 15.57% / 58.3% | 20.22% / 83.3% | 15.22% / 77.1% | 22.78% / 91.7% | 16.19% / 83.3% |
مسارات تركيبية
كلام مقروء مُجمَّع، وأُخذت تبادلات الأدوار من توزيعات مقيسة على شرائح CallHome. تكشف الأعطال الجسيمة في المجال فقط. لا تقارن هذه الأرقام بالجدول أعلاه.
| النظام | الأذربيجانية | الألمانية السويسرية | الروسية |
|---|---|---|---|
| Speech Cloud API | 4.74% / 83.3% | 19.33% / 41.7% | 8.15% / 75.0% |
| Sortformer streaming | 5.25% / 75.0% | 21.59% / 58.3% | 5.35% / 91.7% |
| Sortformer offline | 5.16% / 75.0% | 28.03% / 50.0% | 8.20% / 100.0% |
| MOSS | 11.30% / 58.3% | 26.59% / 41.7% | 15.14% / 50.0% |
| pyannote Community-1 | 35.23% / 16.7% | 45.21% / 0.0% | 35.26% / 8.3% |
شغّلها بنفسك
المنهجية والحدود · النتائج حسب اللغة
soniqo/speech-bench-data
(9c91223) · talkbank/callhome
(17c8a153, CC BY-NC-SA 4.0)