เกณฑ์วัดการแยกผู้พูด: pyannote, Sortformer, MOSS, Speech Cloud

ห้าระบบแยกผู้พูดถูกให้คะแนนด้วยไม้บรรทัดเดียวกันบนไฟล์บันทึกชุดเดียวกัน 132 ไฟล์: แปดภาษา รวม 12.9 ชั่วโมง แต่ละระบบได้รับเพียงเสียงเท่านั้น ไม่มีระบบใดได้รับแจ้งจำนวนผู้พูด ซึ่งเป็นเงื่อนไขที่แยกตัวแยกผู้พูดจริงออกจากสคริปต์จัดกลุ่มที่รู้คำตอบอยู่แล้ว

วิธีอ่านตัวเลขเหล่านี้

แต่ละช่องคือ DER / ความตรงของจำนวนผู้พูด โดย DER ถ่วงน้ำหนักด้วยเวลาพูดอ้างอิงและใช้ collar 0.25 วินาที ส่วนความตรงคือสัดส่วนไฟล์ที่จำนวนผู้พูดที่อนุมานได้ตรงกับค่าอ้างอิงพอดีภายใน UEM ค่า DER ยิ่งต่ำยิ่งดี ความตรงยิ่งสูงยิ่งดี บทสนทนาจริงและรางสังเคราะห์เป็นหลักฐานคนละระดับ ห้ามนำมาเทียบกัน

ผลลัพธ์แยกตามภาษา

บทสนทนาจริง

เสียงจากการออกอากาศ โทรศัพท์ และการประชุม 96 ไฟล์ 12.63 ชั่วโมง

ระบบอาหรับเยอรมันอังกฤษสเปนจีนกลาง
Speech Cloud API21.02% / 33.3%7.62% / 91.7%13.21% / 66.7%15.92% / 58.3%9.63% / 58.3%
Sortformer streaming22.32% / 33.3%8.38% / 83.3%13.81% / 66.7%16.33% / 58.3%9.95% / 58.3%
Sortformer offline17.92% / 33.3%8.13% / 83.3%14.34% / 66.7%16.43% / 58.3%10.52% / 41.7%
MOSS14.57% / 41.7%16.95% / 83.3%16.35% / 72.9%22.51% / 75.0%10.12% / 83.3%
pyannote Community-115.57% / 58.3%20.22% / 83.3%15.22% / 77.1%22.78% / 91.7%16.19% / 83.3%

รางสังเคราะห์

เสียงอ่านที่นำมาต่อกัน โดยการผลัดกันพูดสุ่มจากการแจกแจงที่วัดบนชุด CallHome ใช้ตรวจจับความล้มเหลวร้ายแรงของโดเมนเท่านั้น อย่านำตัวเลขเหล่านี้ไปเทียบกับตารางด้านบน

ระบบอาเซอร์ไบจานเยอรมันสวิสรัสเซีย
Speech Cloud API4.74% / 83.3%19.33% / 41.7%8.15% / 75.0%
Sortformer streaming5.25% / 75.0%21.59% / 58.3%5.35% / 91.7%
Sortformer offline5.16% / 75.0%28.03% / 50.0%8.20% / 100.0%
MOSS11.30% / 58.3%26.59% / 41.7%15.14% / 50.0%
pyannote Community-135.23% / 16.7%45.21% / 0.0%35.26% / 8.3%

ลองรันเอง

ระเบียบวิธีและข้อจำกัด · ผลลัพธ์แยกตามภาษา

soniqo/speech-bench-data (9c91223) · talkbank/callhome (17c8a153, CC BY-NC-SA 4.0)