说话人分离基准测试:pyannote、Sortformer、MOSS、Speech Cloud
五套分离系统在同一批 132 段录音上用同一把尺子评分:八种语言,共 12.9 小时。每套系统只拿到音频。不向任何后端提供说话人数量,这一条件才能区分真正的分离系统与已知答案的聚类脚本。
如何阅读这些数字
每个单元格为 DER(说话人分离错误率),以参考说话人时长加权,容差 0.25 秒。越低越好。真实对话与合成轨道属于不同证据层级,不可横向比较。
按语言的结果
真实对话
广播、电话与会议音频。96 段录音,12.63 小时。
| 系统 | 阿拉伯语 | 德语 | 英语 | 西班牙语 | 中文 |
|---|---|---|---|---|---|
| DER,越低越好 | |||||
| Speech Cloud API | 21.02% | 7.62% | 13.21% | 15.92% | 9.63% |
| Sortformer streaming | 22.32% | 8.38% | 13.81% | 16.33% | 9.95% |
| Sortformer offline | 17.92% | 8.13% | 14.34% | 16.43% | 10.52% |
| MOSS | 14.57% | 16.95% | 16.35% | 22.51% | 10.12% |
| pyannote Community-1 | 15.57% | 20.22% | 15.22% | 22.78% | 16.19% |
合成轨道
拼接的朗读语音,轮次分布取自 CallHome 切片的实测值。它们只能发现严重的领域失效。请勿与上表数字比较。
| 系统 | 阿塞拜疆语 | 瑞士德语 | 俄语 |
|---|---|---|---|
| DER,越低越好 | |||
| Speech Cloud API | 4.74% | 19.33% | 8.15% |
| Sortformer streaming | 5.25% | 21.59% | 5.35% |
| Sortformer offline | 5.16% | 28.03% | 8.20% |
| MOSS | 11.30% | 26.59% | 15.14% |
| pyannote Community-1 | 35.23% | 45.21% | 35.26% |
自行运行
talkbank/callhome
(17c8a153, CC BY-NC-SA 4.0)