arXiv論文メモ
新着一覧
cs.SD · 査読状況未確認

音声匿名化後の聞き取りやすさを音素単位で測る

ASR ensembling for phoneme intelligibility evaluation of speech anonymizers

Victor Ménestrel, Sebastian Möller, Slim Ouni, Dorothea Kolossa

この論文をやさしく読む

ひとことで言うと

匿名化した音声がどの程度聞き取れるかを、複数の音声認識モデルの多数決で測った。

何に役立つ?

音声匿名化の安全性だけでなく、発話内容の聞き取りやすさを評価する際の指標になる。

この研究の面白いところ

複数ASRの単純な多数決で人間の評価との相関が集計単位では0.9を超え、複雑な確信度指標は役立たなかった。

どこまで分かった?

高い相関は特徴・試験種類・条件ごとの集計での値であり、個々の音声刺激すべてで同じ値とは述べていない。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

音声を匿名化した後の音素単位の聞き取りやすさを、初めて評価する。複数の自動音声認識(ASR)モデルを組み合わせた指標の性能を、クラウドソーシングによる聴取試験で測定した聞き取りやすさと比較した。複数のASRモデルを組み合わせれば、単純な多数決型のASR指標でも、音声の特徴、試験の種類、条件ごとに集計した場合、人間の評価との相関が0.9を超えた。対象音声に前後の文脈となる文を付ける場合と付けない場合の両方で評価すると、個々の音声刺激の水準でも相関がさらに改善した。一方、事後確率に基づく確信度の指標を加えても改善はなく、使用した最新の公開ASRモデルの確信度が十分に校正されていないことが原因と考えられた。すべてのデータ、コード、評価道具はオープンソースとして公開されている。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-23(UTC)
最新改訂
2026-09-23 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

We present the first phoneme-level intelligibility evaluation of speech anonymizers, assessing the performance of ASR-ensemble-based metrics against measured intelligibility from a crowdsourced listening test. Our results show that simple hard-voting ASR metric reaches correlations above 0.9 with human ratings when aggregated by feature, test-type, or condition, provided that multiple ASR models are combined; evaluating stimuli with and without a carrier sentence further improves the correlation at the stimulus level. However, posterior-probability-based confidence metrics bring no gain, which can be traced back to the insufficient calibration of the state-of-the-art open ASR models that were utilized here. All data, code, and evaluation tools are released as open source.

arXiv ID: 2609.28577 / 要約の誤りについて