说话人分离基准测试:pyannote、Sortformer、MOSS、Speech Cloud

五套分离系统在同一批 132 段录音上用同一把尺子评分:八种语言,共 12.9 小时。每套系统只拿到音频。不向任何后端提供说话人数量,这一条件才能区分真正的分离系统与已知答案的聚类脚本。

如何阅读这些数字

每个单元格为 DER(说话人分离错误率),以参考说话人时长加权,容差 0.25 秒。越低越好。真实对话与合成轨道属于不同证据层级,不可横向比较。

按语言的结果

真实对话

广播、电话与会议音频。96 段录音,12.63 小时。

系统阿拉伯语德语英语西班牙语中文
DER,越低越好
Speech Cloud API21.02%7.62%13.21%15.92%9.63%
Sortformer streaming22.32%8.38%13.81%16.33%9.95%
Sortformer offline17.92%8.13%14.34%16.43%10.52%
MOSS14.57%16.95%16.35%22.51%10.12%
pyannote Community-115.57%20.22%15.22%22.78%16.19%

合成轨道

拼接的朗读语音,轮次分布取自 CallHome 切片的实测值。它们只能发现严重的领域失效。请勿与上表数字比较。

系统阿塞拜疆语瑞士德语俄语
DER,越低越好
Speech Cloud API4.74%19.33%8.15%
Sortformer streaming5.25%21.59%5.35%
Sortformer offline5.16%28.03%8.20%
MOSS11.30%26.59%15.14%
pyannote Community-135.23%45.21%35.26%

自行运行

方法与局限 · 按语言的结果

talkbank/callhome (17c8a153, CC BY-NC-SA 4.0)