เกณฑ์วัดการแยกผู้พูด: pyannote, Sortformer, MOSS, Speech Cloud

ห้าระบบแยกผู้พูดถูกให้คะแนนด้วยไม้บรรทัดเดียวกันบนไฟล์บันทึกชุดเดียวกัน 132 ไฟล์: แปดภาษา รวม 12.9 ชั่วโมง แต่ละระบบได้รับเพียงเสียงเท่านั้น ไม่มีระบบใดได้รับแจ้งจำนวนผู้พูด ซึ่งเป็นเงื่อนไขที่แยกตัวแยกผู้พูดจริงออกจากสคริปต์จัดกลุ่มที่รู้คำตอบอยู่แล้ว

วิธีอ่านตัวเลขเหล่านี้

แต่ละช่องคือ DER (อัตราความผิดพลาดของการแบ่งผู้พูด) ถ่วงน้ำหนักด้วยเวลาพูดอ้างอิงและใช้ collar 0.25 วินาที ค่ายิ่งต่ำยิ่งดี บทสนทนาจริงและรางสังเคราะห์เป็นหลักฐานคนละระดับ ห้ามนำมาเทียบกัน

ผลลัพธ์แยกตามภาษา

บทสนทนาจริง

เสียงจากการออกอากาศ โทรศัพท์ และการประชุม 96 ไฟล์ 12.63 ชั่วโมง

ระบบอาหรับเยอรมันอังกฤษสเปนจีนกลาง
DER ยิ่งต่ำยิ่งดี
Speech Cloud API21.02%7.62%13.21%15.92%9.63%
Sortformer streaming22.32%8.38%13.81%16.33%9.95%
Sortformer offline17.92%8.13%14.34%16.43%10.52%
MOSS14.57%16.95%16.35%22.51%10.12%
pyannote Community-115.57%20.22%15.22%22.78%16.19%

รางสังเคราะห์

เสียงอ่านที่นำมาต่อกัน โดยการผลัดกันพูดสุ่มจากการแจกแจงที่วัดบนชุด CallHome ใช้ตรวจจับความล้มเหลวร้ายแรงของโดเมนเท่านั้น อย่านำตัวเลขเหล่านี้ไปเทียบกับตารางด้านบน

ระบบอาเซอร์ไบจานเยอรมันสวิสรัสเซีย
DER ยิ่งต่ำยิ่งดี
Speech Cloud API4.74%19.33%8.15%
Sortformer streaming5.25%21.59%5.35%
Sortformer offline5.16%28.03%8.20%
MOSS11.30%26.59%15.14%
pyannote Community-135.23%45.21%35.26%

ลองรันเอง

ระเบียบวิธีและข้อจำกัด · ผลลัพธ์แยกตามภาษา

talkbank/callhome (17c8a153, CC BY-NC-SA 4.0)