说话人分离基准测试:pyannote、Sortformer、MOSS、Speech Cloud
五套分离系统在同一批 132 段录音上用同一把尺子评分:八种语言,共 12.9 小时。每套系统只拿到音频。不向任何后端提供说话人数量,这一条件才能区分真正的分离系统与已知答案的聚类脚本。
如何阅读这些数字
每个单元格为 DER / 说话人数量一致率。DER 以参考说话人时长加权,容差 0.25 秒;一致率指推断说话人数与 UEM 内参考值完全相符的文件占比。DER 越低越好,一致率越高越好。真实对话与合成轨道属于不同证据层级,不可横向比较。
按语言的结果
真实对话
广播、电话与会议音频。96 段录音,12.63 小时。
| 系统 | 阿拉伯语 | 德语 | 英语 | 西班牙语 | 中文 |
|---|---|---|---|---|---|
| Speech Cloud API | 21.02% / 33.3% | 7.62% / 91.7% | 13.21% / 66.7% | 15.92% / 58.3% | 9.63% / 58.3% |
| Sortformer streaming | 22.32% / 33.3% | 8.38% / 83.3% | 13.81% / 66.7% | 16.33% / 58.3% | 9.95% / 58.3% |
| Sortformer offline | 17.92% / 33.3% | 8.13% / 83.3% | 14.34% / 66.7% | 16.43% / 58.3% | 10.52% / 41.7% |
| MOSS | 14.57% / 41.7% | 16.95% / 83.3% | 16.35% / 72.9% | 22.51% / 75.0% | 10.12% / 83.3% |
| pyannote Community-1 | 15.57% / 58.3% | 20.22% / 83.3% | 15.22% / 77.1% | 22.78% / 91.7% | 16.19% / 83.3% |
合成轨道
拼接的朗读语音,轮次分布取自 CallHome 切片的实测值。它们只能发现严重的领域失效。请勿与上表数字比较。
| 系统 | 阿塞拜疆语 | 瑞士德语 | 俄语 |
|---|---|---|---|
| Speech Cloud API | 4.74% / 83.3% | 19.33% / 41.7% | 8.15% / 75.0% |
| Sortformer streaming | 5.25% / 75.0% | 21.59% / 58.3% | 5.35% / 91.7% |
| Sortformer offline | 5.16% / 75.0% | 28.03% / 50.0% | 8.20% / 100.0% |
| MOSS | 11.30% / 58.3% | 26.59% / 41.7% | 15.14% / 50.0% |
| pyannote Community-1 | 35.23% / 16.7% | 45.21% / 0.0% | 35.26% / 8.3% |
自行运行
soniqo/speech-bench-data
(9c91223) · talkbank/callhome
(17c8a153, CC BY-NC-SA 4.0)