Đánh giá phân tách người nói: pyannote, Sortformer, MOSS, Speech Cloud
Năm hệ phân tách người nói được chấm bằng cùng một thước trên cùng 132 bản ghi: tám ngôn ngữ, 12,9 giờ. Mỗi hệ chỉ nhận âm thanh. Không hệ nào được cho biết có bao nhiêu người nói, và đó chính là điều kiện phân biệt một bộ phân tách thật với một script phân cụm đã biết đáp án.
Mỗi ô là DER / mức khớp số người nói. DER được trọng số theo thời lượng người nói tham chiếu với collar 0,25 s; mức khớp là tỷ lệ tệp có số người nói suy ra trùng khớp chính xác với tham chiếu bên trong UEM. DER càng thấp càng tốt, mức khớp càng cao càng tốt. Hội thoại thực và đường ray tổng hợp là hai cấp bằng chứng khác nhau, không được so sánh chéo.
Kết quả theo ngôn ngữ
Hội thoại thực
Âm thanh phát thanh, điện thoại và cuộc họp. 96 bản ghi, 12,63 giờ.
| Hệ thống | Tiếng Ả Rập | Tiếng Đức | Tiếng Anh | Tiếng Tây Ban Nha | Tiếng Trung |
|---|---|---|---|---|---|
| Speech Cloud API | 21.02% / 33.3% | 7.62% / 91.7% | 13.21% / 66.7% | 15.92% / 58.3% | 9.63% / 58.3% |
| Sortformer streaming | 22.32% / 33.3% | 8.38% / 83.3% | 13.81% / 66.7% | 16.33% / 58.3% | 9.95% / 58.3% |
| Sortformer offline | 17.92% / 33.3% | 8.13% / 83.3% | 14.34% / 66.7% | 16.43% / 58.3% | 10.52% / 41.7% |
| MOSS | 14.57% / 41.7% | 16.95% / 83.3% | 16.35% / 72.9% | 22.51% / 75.0% | 10.12% / 83.3% |
| pyannote Community-1 | 15.57% / 58.3% | 20.22% / 83.3% | 15.22% / 77.1% | 22.78% / 91.7% | 16.19% / 83.3% |
Đường ray tổng hợp
Giọng đọc được nối lại, với lượt nói lấy mẫu từ phân phối đo trên các lát CallHome. Chúng chỉ phát hiện lỗi miền nghiêm trọng. Đừng so sánh các số này với bảng ở trên.
| Hệ thống | Tiếng Azerbaijan | Tiếng Đức Thụy Sĩ | Tiếng Nga |
|---|---|---|---|
| Speech Cloud API | 4.74% / 83.3% | 19.33% / 41.7% | 8.15% / 75.0% |
| Sortformer streaming | 5.25% / 75.0% | 21.59% / 58.3% | 5.35% / 91.7% |
| Sortformer offline | 5.16% / 75.0% | 28.03% / 50.0% | 8.20% / 100.0% |
| MOSS | 11.30% / 58.3% | 26.59% / 41.7% | 15.14% / 50.0% |
| pyannote Community-1 | 35.23% / 16.7% | 45.21% / 0.0% | 35.26% / 8.3% |
Tự chạy thử
Phương pháp và giới hạn · Kết quả theo ngôn ngữ
soniqo/speech-bench-data
(9c91223) · talkbank/callhome
(17c8a153, CC BY-NC-SA 4.0)