話者ダイアライゼーション ベンチマーク:pyannote、Sortformer、MOSS、Speech Cloud

5 つのダイアライゼーションを同じ 132 件の録音、同じ物差しで採点しました。8 言語、計 12.9 時間。各システムに与えるのは音声のみです。話者数はどのバックエンドにも伝えません。この条件こそが、真のダイアライザと答えを知っているクラスタリングを分けます。

数値の読み方

各セルは DER / 話者数一致率 です。DER は参照話者時間で重み付けし、コラーは 0.25 秒。一致率は UEM 内の参照話者数と完全に一致したファイルの割合です。DER は低いほど、一致率は高いほど良好。実会話と合成レールは証拠の階層が異なり、横断比較はできません。

言語別の結果

実会話

放送・電話・会議音声。96 件、12.63 時間。

システムアラビア語ドイツ語英語スペイン語中国語
Speech Cloud API21.02% / 33.3%7.62% / 91.7%13.21% / 66.7%15.92% / 58.3%9.63% / 58.3%
Sortformer streaming22.32% / 33.3%8.38% / 83.3%13.81% / 66.7%16.33% / 58.3%9.95% / 58.3%
Sortformer offline17.92% / 33.3%8.13% / 83.3%14.34% / 66.7%16.43% / 58.3%10.52% / 41.7%
MOSS14.57% / 41.7%16.95% / 83.3%16.35% / 72.9%22.51% / 75.0%10.12% / 83.3%
pyannote Community-115.57% / 58.3%20.22% / 83.3%15.22% / 77.1%22.78% / 91.7%16.19% / 83.3%

合成レール

朗読音声を連結し、ターンテイキングは CallHome スライスで実測した分布からサンプリングしています。重大なドメイン失敗の検出のみに使えます。上表の数値とは比較しないでください。

システムアゼルバイジャン語スイスドイツ語ロシア語
Speech Cloud API4.74% / 83.3%19.33% / 41.7%8.15% / 75.0%
Sortformer streaming5.25% / 75.0%21.59% / 58.3%5.35% / 91.7%
Sortformer offline5.16% / 75.0%28.03% / 50.0%8.20% / 100.0%
MOSS11.30% / 58.3%26.59% / 41.7%15.14% / 50.0%
pyannote Community-135.23% / 16.7%45.21% / 0.0%35.26% / 8.3%

自分で実行する

方法と限界 · 言語別の結果

soniqo/speech-bench-data (9c91223) · talkbank/callhome (17c8a153, CC BY-NC-SA 4.0)