話者ダイアライゼーション ベンチマーク:pyannote、Sortformer、MOSS、Speech Cloud

5 つのダイアライゼーションを同じ 132 件の録音、同じ物差しで採点しました。8 言語、計 12.9 時間。各システムに与えるのは音声のみです。話者数はどのバックエンドにも伝えません。この条件こそが、真のダイアライザと答えを知っているクラスタリングを分けます。

数値の読み方

各セルは DER(話者分離誤り率)です。参照話者時間で重み付けし、コラーは 0.25 秒。低いほど良好です。実会話と合成レールは証拠の階層が異なり、横断比較はできません。

言語別の結果

実会話

放送・電話・会議音声。96 件、12.63 時間。

システムアラビア語ドイツ語英語スペイン語中国語
DER は低いほど良い
Speech Cloud API21.02%7.62%13.21%15.92%9.63%
Sortformer streaming22.32%8.38%13.81%16.33%9.95%
Sortformer offline17.92%8.13%14.34%16.43%10.52%
MOSS14.57%16.95%16.35%22.51%10.12%
pyannote Community-115.57%20.22%15.22%22.78%16.19%

合成レール

朗読音声を連結し、ターンテイキングは CallHome スライスで実測した分布からサンプリングしています。重大なドメイン失敗の検出のみに使えます。上表の数値とは比較しないでください。

システムアゼルバイジャン語スイスドイツ語ロシア語
DER は低いほど良い
Speech Cloud API4.74%19.33%8.15%
Sortformer streaming5.25%21.59%5.35%
Sortformer offline5.16%28.03%8.20%
MOSS11.30%26.59%15.14%
pyannote Community-135.23%45.21%35.26%

自分で実行する

方法と限界 · 言語別の結果

talkbank/callhome (17c8a153, CC BY-NC-SA 4.0)