arXiv論文メモ
新着一覧
cs.CL · 査読状況未確認

音声認識の品質評価は単語誤り率より文字誤り率が適切か

Rethinking Human-Aligned Evaluation: An Analysis of Semantic Metrics Beyond WER

Hritika Sharma, Thibault Bañeras-Roux, Alessandra Pinto, Petr Motlicek, Hyunggu Jung, Esaú Villatoro-Tello, Somang Nam

この論文をやさしく読む

ひとことで言うと

音声の書き起こしを評価するとき、単語が何個違うかより、文字の誤りや意味の近さの方が人の判断に合うかを調べています。

何に役立つ?

ASRモデルを比較する際の評価指標選びに役立ちます。安価なCERを基本にし、意味を扱うSemDistを補うという使い分けを著者は提案しています。

この研究の面白いところ

複雑な意味指標の最良構成に、単純な文字誤り率がかなり近づいた点が特徴です。一方、SemDistも使うモデルや層によって変わり、万能な構成はありません。

どこまで分かった?

導入したデータセットは英語です。形態音節文字体系へのCER利用も支持すると述べていますが、この要旨にはそれらの言語の新たな実験結果は記載されていません。指標の具体的な一致度も示されていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

自動音声認識(ASR)で最も広く使われる指標である単語誤り率(WER)は、意味が変わるかどうかに関係なく、参照文からの語彙上のずれをすべて等しい費用として扱う。そこで、WERは人間がASR書き起こしの品質を判断する方法を本当に捉えているのか、という問いが生じる。本研究では、人間中心のASR評価用の英語データセットHATS-enを導入する。このデータセットを用い、語彙に基づく指標を、言語モデル、層、プーリング戦略を変えたBERTScoreとSemDistの複数の構成と比較評価する。 検証したすべての指標のうち、WERが人間の判断との一致度で最も低く、最良のSemDist構成がCERとBERTScoreを上回って総合的に最も高い一致度を達成すること、そして、すべての設定で最良となる単一のモデルはないことが分かった。CERは単純で低費用であるにもかかわらず、これらの最良構成に非常に近い性能を保つ。従来の提言と整合的に、本研究の結果は、英語と形態音節文字体系の両方において、ASR評価をCERへ移すことを支持する。CERは評価が実際に捉えるべきものに対して、より解釈しやすく低費用の指標だからである。また、SemDistを補完的な評価として使うことも支持する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-18(UTC)
最新改訂
2026-09-18 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Word Error Rate (WER), the most commonly used metric for Automatic Speech Recognition (ASR), treats every lexical deviation from the reference as equally costly, regardless of whether it changes meaning. This raises the question: does WER actually track how humans judge ASR transcript quality? We introduce HATS-en, an English dataset for human-centered ASR evaluation. Using this dataset, we benchmark lexical metrics against several configurations of BERTScore and SemDist, varying the language model, layer, and pooling strategy. We find that WER agrees least with human judgment among all metrics tested, that the best-performing SemDist configurations achieve the highest overall agreement, ahead of CER and BERTScore, and that no single model is best across settings. CER, despite its simplicity and low cost, remains remarkably close to these best configurations. In line with prior recommendations, our results support shifting ASR evaluation toward CER both for English and for morphosyllabic writing systems as it is a more interpretable and low-cost metric for what evaluation should actually capture, and using SemDist as a complementary evaluation.

arXiv ID: 2609.21663 / 要約の誤りについて