اختبارات فصل المتحدثين: pyannote وSortformer وMOSS وSpeech Cloud

خمسة أنظمة لفصل المتحدثين قُيِّمت بالمسطرة نفسها على التسجيلات الـ132 نفسها: ثماني لغات، 12.9 ساعة. يتلقى كل نظام الصوت فقط. لا يُخبَر أي نظام بعدد المتحدثين المتوقع، وهو الشرط الذي يفصل أداة فصل حقيقية عن سكربت تجميع يعرف الإجابة مسبقًا.

كيف تقرأ هذه الأرقام

كل خلية هي DER / تطابق عدد المتحدثين. يُرجَّح DER بزمن المتحدث المرجعي بهامش 0.25 ثانية؛ والتطابق هو نسبة الملفات التي يطابق فيها العدد المستنتج المرجع تمامًا داخل UEM. كلما انخفض DER كان أفضل، وكلما ارتفع التطابق كان أفضل. المحادثة الحقيقية والمسارات التركيبية مستويان مختلفان من الأدلة ولا يصح مقارنتهما ببعض.

النتائج حسب اللغة

محادثة حقيقية

صوت بث وهاتف واجتماعات. 96 تسجيلًا، 12.63 ساعة.

النظامالعربيةالألمانيةالإنجليزيةالإسبانيةالصينية
Speech Cloud API21.02% / 33.3%7.62% / 91.7%13.21% / 66.7%15.92% / 58.3%9.63% / 58.3%
Sortformer streaming22.32% / 33.3%8.38% / 83.3%13.81% / 66.7%16.33% / 58.3%9.95% / 58.3%
Sortformer offline17.92% / 33.3%8.13% / 83.3%14.34% / 66.7%16.43% / 58.3%10.52% / 41.7%
MOSS14.57% / 41.7%16.95% / 83.3%16.35% / 72.9%22.51% / 75.0%10.12% / 83.3%
pyannote Community-115.57% / 58.3%20.22% / 83.3%15.22% / 77.1%22.78% / 91.7%16.19% / 83.3%

مسارات تركيبية

كلام مقروء مُجمَّع، وأُخذت تبادلات الأدوار من توزيعات مقيسة على شرائح CallHome. تكشف الأعطال الجسيمة في المجال فقط. لا تقارن هذه الأرقام بالجدول أعلاه.

النظامالأذربيجانيةالألمانية السويسريةالروسية
Speech Cloud API4.74% / 83.3%19.33% / 41.7%8.15% / 75.0%
Sortformer streaming5.25% / 75.0%21.59% / 58.3%5.35% / 91.7%
Sortformer offline5.16% / 75.0%28.03% / 50.0%8.20% / 100.0%
MOSS11.30% / 58.3%26.59% / 41.7%15.14% / 50.0%
pyannote Community-135.23% / 16.7%45.21% / 0.0%35.26% / 8.3%

شغّلها بنفسك

المنهجية والحدود · النتائج حسب اللغة

soniqo/speech-bench-data (9c91223) · talkbank/callhome (17c8a153, CC BY-NC-SA 4.0)