เกณฑ์วัดการแยกผู้พูด: pyannote, Sortformer, MOSS, Speech Cloud
ห้าระบบแยกผู้พูดถูกให้คะแนนด้วยไม้บรรทัดเดียวกันบนไฟล์บันทึกชุดเดียวกัน 132 ไฟล์: แปดภาษา รวม 12.9 ชั่วโมง แต่ละระบบได้รับเพียงเสียงเท่านั้น ไม่มีระบบใดได้รับแจ้งจำนวนผู้พูด ซึ่งเป็นเงื่อนไขที่แยกตัวแยกผู้พูดจริงออกจากสคริปต์จัดกลุ่มที่รู้คำตอบอยู่แล้ว
แต่ละช่องคือ DER / ความตรงของจำนวนผู้พูด โดย DER ถ่วงน้ำหนักด้วยเวลาพูดอ้างอิงและใช้ collar 0.25 วินาที ส่วนความตรงคือสัดส่วนไฟล์ที่จำนวนผู้พูดที่อนุมานได้ตรงกับค่าอ้างอิงพอดีภายใน UEM ค่า DER ยิ่งต่ำยิ่งดี ความตรงยิ่งสูงยิ่งดี บทสนทนาจริงและรางสังเคราะห์เป็นหลักฐานคนละระดับ ห้ามนำมาเทียบกัน
ผลลัพธ์แยกตามภาษา
บทสนทนาจริง
เสียงจากการออกอากาศ โทรศัพท์ และการประชุม 96 ไฟล์ 12.63 ชั่วโมง
| ระบบ | อาหรับ | เยอรมัน | อังกฤษ | สเปน | จีนกลาง |
|---|---|---|---|---|---|
| Speech Cloud API | 21.02% / 33.3% | 7.62% / 91.7% | 13.21% / 66.7% | 15.92% / 58.3% | 9.63% / 58.3% |
| Sortformer streaming | 22.32% / 33.3% | 8.38% / 83.3% | 13.81% / 66.7% | 16.33% / 58.3% | 9.95% / 58.3% |
| Sortformer offline | 17.92% / 33.3% | 8.13% / 83.3% | 14.34% / 66.7% | 16.43% / 58.3% | 10.52% / 41.7% |
| MOSS | 14.57% / 41.7% | 16.95% / 83.3% | 16.35% / 72.9% | 22.51% / 75.0% | 10.12% / 83.3% |
| pyannote Community-1 | 15.57% / 58.3% | 20.22% / 83.3% | 15.22% / 77.1% | 22.78% / 91.7% | 16.19% / 83.3% |
รางสังเคราะห์
เสียงอ่านที่นำมาต่อกัน โดยการผลัดกันพูดสุ่มจากการแจกแจงที่วัดบนชุด CallHome ใช้ตรวจจับความล้มเหลวร้ายแรงของโดเมนเท่านั้น อย่านำตัวเลขเหล่านี้ไปเทียบกับตารางด้านบน
| ระบบ | อาเซอร์ไบจาน | เยอรมันสวิส | รัสเซีย |
|---|---|---|---|
| Speech Cloud API | 4.74% / 83.3% | 19.33% / 41.7% | 8.15% / 75.0% |
| Sortformer streaming | 5.25% / 75.0% | 21.59% / 58.3% | 5.35% / 91.7% |
| Sortformer offline | 5.16% / 75.0% | 28.03% / 50.0% | 8.20% / 100.0% |
| MOSS | 11.30% / 58.3% | 26.59% / 41.7% | 15.14% / 50.0% |
| pyannote Community-1 | 35.23% / 16.7% | 45.21% / 0.0% | 35.26% / 8.3% |
ลองรันเอง
ระเบียบวิธีและข้อจำกัด · ผลลัพธ์แยกตามภาษา
soniqo/speech-bench-data
(9c91223) · talkbank/callhome
(17c8a153, CC BY-NC-SA 4.0)