เกณฑ์วัดการแยกผู้พูด: pyannote, Sortformer, MOSS, Speech Cloud
ห้าระบบแยกผู้พูดถูกให้คะแนนด้วยไม้บรรทัดเดียวกันบนไฟล์บันทึกชุดเดียวกัน 132 ไฟล์: แปดภาษา รวม 12.9 ชั่วโมง แต่ละระบบได้รับเพียงเสียงเท่านั้น ไม่มีระบบใดได้รับแจ้งจำนวนผู้พูด ซึ่งเป็นเงื่อนไขที่แยกตัวแยกผู้พูดจริงออกจากสคริปต์จัดกลุ่มที่รู้คำตอบอยู่แล้ว
แต่ละช่องคือ DER (อัตราความผิดพลาดของการแบ่งผู้พูด) ถ่วงน้ำหนักด้วยเวลาพูดอ้างอิงและใช้ collar 0.25 วินาที ค่ายิ่งต่ำยิ่งดี บทสนทนาจริงและรางสังเคราะห์เป็นหลักฐานคนละระดับ ห้ามนำมาเทียบกัน
ผลลัพธ์แยกตามภาษา
บทสนทนาจริง
เสียงจากการออกอากาศ โทรศัพท์ และการประชุม 96 ไฟล์ 12.63 ชั่วโมง
| ระบบ | อาหรับ | เยอรมัน | อังกฤษ | สเปน | จีนกลาง |
|---|---|---|---|---|---|
| DER ยิ่งต่ำยิ่งดี | |||||
| Speech Cloud API | 21.02% | 7.62% | 13.21% | 15.92% | 9.63% |
| Sortformer streaming | 22.32% | 8.38% | 13.81% | 16.33% | 9.95% |
| Sortformer offline | 17.92% | 8.13% | 14.34% | 16.43% | 10.52% |
| MOSS | 14.57% | 16.95% | 16.35% | 22.51% | 10.12% |
| pyannote Community-1 | 15.57% | 20.22% | 15.22% | 22.78% | 16.19% |
รางสังเคราะห์
เสียงอ่านที่นำมาต่อกัน โดยการผลัดกันพูดสุ่มจากการแจกแจงที่วัดบนชุด CallHome ใช้ตรวจจับความล้มเหลวร้ายแรงของโดเมนเท่านั้น อย่านำตัวเลขเหล่านี้ไปเทียบกับตารางด้านบน
| ระบบ | อาเซอร์ไบจาน | เยอรมันสวิส | รัสเซีย |
|---|---|---|---|
| DER ยิ่งต่ำยิ่งดี | |||
| Speech Cloud API | 4.74% | 19.33% | 8.15% |
| Sortformer streaming | 5.25% | 21.59% | 5.35% |
| Sortformer offline | 5.16% | 28.03% | 8.20% |
| MOSS | 11.30% | 26.59% | 15.14% |
| pyannote Community-1 | 35.23% | 45.21% | 35.26% |
ลองรันเอง
ระเบียบวิธีและข้อจำกัด · ผลลัพธ์แยกตามภาษา
talkbank/callhome
(17c8a153, CC BY-NC-SA 4.0)