arXiv論文メモ
新着一覧
eess.AS / cs.CL · 査読状況未確認

数字の表記ゆれが音声認識の評価を変える

The Hidden Cost of Digits: Number Normalization and WER in ASR Systems

Stanisław Kacprzak, Mieszko Fraś

この論文をやさしく読む

ひとことで言うと

同じ数を数字で書くか単語で書くかによって、音声認識の採点結果が大きく変わり得ることを調べた研究です。

何に役立つ?

音声認識モデルを比較する際に、表記方法の違いを認識能力の差と取り違えないための評価設計に役立ちます。

この研究の面白いところ

正規化の有無だけでWERが2パーセントポイント以上変わり、モデル同士の性能差より大きくなる場合があると報告しています。相対的な2%改善という意味ではありません。

どこまで分かった?

具体的な実験はポーランド語の二つのデータセットによるものです。すべての言語や認識システムで同じ大きさの差が生じると確認したわけではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

非常に大規模なデータセットで学習した現代の自動音声認識(ASR)システムは、数をアラビア数字で表記した文字起こしを生成できる。このため、発話どおりの文字列を出力するモデルとの公平な比較と、参照用文字起こしの適切な処理が必要になる。広く使われる手法では、テキストの正規化を小文字化と句読点の除去にとどめ、英語以外の言語には追加の正規化を行わないことが多い。 本研究では、語形変化の多い言語の例としてポーランド語を用い、さまざまな言語のASRシステム評価における数値表現の正規化の影響を分析する。VoxPopuliとポーランド議会音声データセットで実験し、異なるテキスト正規化手法による単語誤り率(WER)の差を見積もる。数値の正規化を行わないことに起因するWERの差は、2パーセントポイントを超えるほど大きくなり得ること、そして一般的な多言語ベンチマークでのシステム間の差を上回る場合も多いことを示す。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-17(UTC)
最新改訂
2026-09-17 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Modern automatic speech recognition (ASR) systems trained on extremely large datasets can produce transcripts with numbers written in Arabic numerals. This creates a need for fair comparison with models that output verbatim texts and proper processing of reference transcripts. Popular approaches often reduce text normalization to lowercase and remove punctuation, with no additional normalization applied to languages other than English. In this work, we analyze the impact of normalization of numerical expressions in the evaluation of ASR systems in various languages, using Polish as an example of a highly inflective language. We perform experiments on VoxPopuli and The Polish Parliamentary speech datasets and estimate word error rate (WER) differences for different text normalization approaches. We show that the difference due to the lack of number normalization in WER may be substantial - more than 2 percentage points, and often higher than the differences between systems in popular multilingual benchmarks.

著者のコメント

Submitted to ICASSP 2027

arXiv ID: 2609.21084 / 要約の誤りについて