Đánh giá phân tách người nói: pyannote, Sortformer, MOSS, Speech Cloud

Năm hệ phân tách người nói được chấm bằng cùng một thước trên cùng 132 bản ghi: tám ngôn ngữ, 12,9 giờ. Mỗi hệ chỉ nhận âm thanh. Không hệ nào được cho biết có bao nhiêu người nói, và đó chính là điều kiện phân biệt một bộ phân tách thật với một script phân cụm đã biết đáp án.

Cách đọc các con số này

Mỗi ô là DER / mức khớp số người nói. DER được trọng số theo thời lượng người nói tham chiếu với collar 0,25 s; mức khớp là tỷ lệ tệp có số người nói suy ra trùng khớp chính xác với tham chiếu bên trong UEM. DER càng thấp càng tốt, mức khớp càng cao càng tốt. Hội thoại thực và đường ray tổng hợp là hai cấp bằng chứng khác nhau, không được so sánh chéo.

Kết quả theo ngôn ngữ

Hội thoại thực

Âm thanh phát thanh, điện thoại và cuộc họp. 96 bản ghi, 12,63 giờ.

Hệ thốngTiếng Ả RậpTiếng ĐứcTiếng AnhTiếng Tây Ban NhaTiếng Trung
Speech Cloud API21.02% / 33.3%7.62% / 91.7%13.21% / 66.7%15.92% / 58.3%9.63% / 58.3%
Sortformer streaming22.32% / 33.3%8.38% / 83.3%13.81% / 66.7%16.33% / 58.3%9.95% / 58.3%
Sortformer offline17.92% / 33.3%8.13% / 83.3%14.34% / 66.7%16.43% / 58.3%10.52% / 41.7%
MOSS14.57% / 41.7%16.95% / 83.3%16.35% / 72.9%22.51% / 75.0%10.12% / 83.3%
pyannote Community-115.57% / 58.3%20.22% / 83.3%15.22% / 77.1%22.78% / 91.7%16.19% / 83.3%

Đường ray tổng hợp

Giọng đọc được nối lại, với lượt nói lấy mẫu từ phân phối đo trên các lát CallHome. Chúng chỉ phát hiện lỗi miền nghiêm trọng. Đừng so sánh các số này với bảng ở trên.

Hệ thốngTiếng AzerbaijanTiếng Đức Thụy SĩTiếng Nga
Speech Cloud API4.74% / 83.3%19.33% / 41.7%8.15% / 75.0%
Sortformer streaming5.25% / 75.0%21.59% / 58.3%5.35% / 91.7%
Sortformer offline5.16% / 75.0%28.03% / 50.0%8.20% / 100.0%
MOSS11.30% / 58.3%26.59% / 41.7%15.14% / 50.0%
pyannote Community-135.23% / 16.7%45.21% / 0.0%35.26% / 8.3%

Tự chạy thử

Phương pháp và giới hạn · Kết quả theo ngôn ngữ

soniqo/speech-bench-data (9c91223) · talkbank/callhome (17c8a153, CC BY-NC-SA 4.0)