说话人分离基准测试:pyannote、Sortformer、MOSS、Speech Cloud

五套分离系统在同一批 132 段录音上用同一把尺子评分:八种语言,共 12.9 小时。每套系统只拿到音频。不向任何后端提供说话人数量,这一条件才能区分真正的分离系统与已知答案的聚类脚本。

如何阅读这些数字

每个单元格为 DER / 说话人数量一致率。DER 以参考说话人时长加权,容差 0.25 秒;一致率指推断说话人数与 UEM 内参考值完全相符的文件占比。DER 越低越好,一致率越高越好。真实对话与合成轨道属于不同证据层级,不可横向比较。

按语言的结果

真实对话

广播、电话与会议音频。96 段录音,12.63 小时。

系统阿拉伯语德语英语西班牙语中文
Speech Cloud API21.02% / 33.3%7.62% / 91.7%13.21% / 66.7%15.92% / 58.3%9.63% / 58.3%
Sortformer streaming22.32% / 33.3%8.38% / 83.3%13.81% / 66.7%16.33% / 58.3%9.95% / 58.3%
Sortformer offline17.92% / 33.3%8.13% / 83.3%14.34% / 66.7%16.43% / 58.3%10.52% / 41.7%
MOSS14.57% / 41.7%16.95% / 83.3%16.35% / 72.9%22.51% / 75.0%10.12% / 83.3%
pyannote Community-115.57% / 58.3%20.22% / 83.3%15.22% / 77.1%22.78% / 91.7%16.19% / 83.3%

合成轨道

拼接的朗读语音,轮次分布取自 CallHome 切片的实测值。它们只能发现严重的领域失效。请勿与上表数字比较。

系统阿塞拜疆语瑞士德语俄语
Speech Cloud API4.74% / 83.3%19.33% / 41.7%8.15% / 75.0%
Sortformer streaming5.25% / 75.0%21.59% / 58.3%5.35% / 91.7%
Sortformer offline5.16% / 75.0%28.03% / 50.0%8.20% / 100.0%
MOSS11.30% / 58.3%26.59% / 41.7%15.14% / 50.0%
pyannote Community-135.23% / 16.7%45.21% / 0.0%35.26% / 8.3%

自行运行

方法与局限 · 按语言的结果

soniqo/speech-bench-data (9c91223) · talkbank/callhome (17c8a153, CC BY-NC-SA 4.0)