話者ダイアライゼーション ベンチマーク:pyannote、Sortformer、MOSS、Speech Cloud
5 つのダイアライゼーションを同じ 132 件の録音、同じ物差しで採点しました。8 言語、計 12.9 時間。各システムに与えるのは音声のみです。話者数はどのバックエンドにも伝えません。この条件こそが、真のダイアライザと答えを知っているクラスタリングを分けます。
数値の読み方
各セルは DER / 話者数一致率 です。DER は参照話者時間で重み付けし、コラーは 0.25 秒。一致率は UEM 内の参照話者数と完全に一致したファイルの割合です。DER は低いほど、一致率は高いほど良好。実会話と合成レールは証拠の階層が異なり、横断比較はできません。
言語別の結果
実会話
放送・電話・会議音声。96 件、12.63 時間。
| システム | アラビア語 | ドイツ語 | 英語 | スペイン語 | 中国語 |
|---|---|---|---|---|---|
| Speech Cloud API | 21.02% / 33.3% | 7.62% / 91.7% | 13.21% / 66.7% | 15.92% / 58.3% | 9.63% / 58.3% |
| Sortformer streaming | 22.32% / 33.3% | 8.38% / 83.3% | 13.81% / 66.7% | 16.33% / 58.3% | 9.95% / 58.3% |
| Sortformer offline | 17.92% / 33.3% | 8.13% / 83.3% | 14.34% / 66.7% | 16.43% / 58.3% | 10.52% / 41.7% |
| MOSS | 14.57% / 41.7% | 16.95% / 83.3% | 16.35% / 72.9% | 22.51% / 75.0% | 10.12% / 83.3% |
| pyannote Community-1 | 15.57% / 58.3% | 20.22% / 83.3% | 15.22% / 77.1% | 22.78% / 91.7% | 16.19% / 83.3% |
合成レール
朗読音声を連結し、ターンテイキングは CallHome スライスで実測した分布からサンプリングしています。重大なドメイン失敗の検出のみに使えます。上表の数値とは比較しないでください。
| システム | アゼルバイジャン語 | スイスドイツ語 | ロシア語 |
|---|---|---|---|
| Speech Cloud API | 4.74% / 83.3% | 19.33% / 41.7% | 8.15% / 75.0% |
| Sortformer streaming | 5.25% / 75.0% | 21.59% / 58.3% | 5.35% / 91.7% |
| Sortformer offline | 5.16% / 75.0% | 28.03% / 50.0% | 8.20% / 100.0% |
| MOSS | 11.30% / 58.3% | 26.59% / 41.7% | 15.14% / 50.0% |
| pyannote Community-1 | 35.23% / 16.7% | 45.21% / 0.0% | 35.26% / 8.3% |
自分で実行する
soniqo/speech-bench-data
(9c91223) · talkbank/callhome
(17c8a153, CC BY-NC-SA 4.0)