arXiv論文メモ
新着一覧
cs.CL · 査読状況未確認

インド22言語の音声認識を実環境と表記揺れ込みで評価する

Vimarsha: Faithful ASR Evaluation for Indian Languages with Demographic Diversity, In-the-Wild Audio and Spelling Variations

Kaushal Santosh Bhogale, Srija Anand, Sadakopa Ramakrishnan Thothathiri, Tahir Javed, Sshubam Verma, Mitesh M. Khapra

この論文をやさしく読む

ひとことで言うと

現場の聞き取りにくい音声を含めつつ、正当な表記の違いは誤りにしないように設計した、インド22言語の音声認識評価データです。

何に役立つ?

実運用に近い音声認識モデルの比較や、地域・話者属性による性能差の点検に役立ちます。録音がきれいすぎる問題と、正解表記が一つしかない問題を同時に扱います。

この研究の面白いところ

難しい音を増やすだけでなく、一つの発話に複数の正しい書き起こしを認めるラティスを採用します。評価が過大にも過小にもなりうる点に対応しています。

どこまで分かった?

100時間、22言語、10モデルの評価です。要旨には言語ごとの時間配分、具体的な誤り率、各集団の差の大きさは示されていません。順位の変動を報告しており、一つのモデルが全条件で最良という結論ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

インドの言語を対象とする自動音声認識(ASR)の評価ベンチマークには、二つの系統的な偏りがある。清潔で管理された音響条件による楽観的なスコアと、妥当な言語的変異まで誤りとして扱う硬直的すぎる書き起こし基準による悲観的なスコアである。この両方の歪みに対処するため、インドの憲法第8附則に列挙された22言語すべてを網羅する100時間のベンチマークVimarshaを導入する。 Vimarshaは、人口統計的に多様な人々の現地録音と、音響的な難しさを基準に慎重に抽出した実環境の音声を組み合わせる。さらに、一つの発話に対する複数の妥当な書き起こしを符号化する、表記変異のラティスの枠組みを備える。最先端のASRモデル10種を評価したところ、現実的な条件の下でモデル順位が大きく変わること、地理的・人口統計的な性能格差、発話速度や音響環境にまたがる系統的な失敗パターンが明らかになった。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-21(UTC)
最新改訂
2026-09-21 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Evaluation benchmarks for Indian language automatic speech recognition (ASR) suffer from two systematic biases: optimistic scores from clean, controlled audio conditions, and pessimistic scores from overly rigid transcription standards that penalize valid linguistic variations. We introduce Vimarsha, a 100-hour benchmark spanning all 22 scheduled Indian languages, designed to address both distortions. Vimarsha combines demographically diverse on-field recordings with carefully mined in-the-wild audio selected for acoustic difficulty, alongside a lattice of variations framework that encodes multiple valid transcriptions per utterance. Evaluations of 10 state-of-the-art ASR models reveal substantial shifts in model rankings under realistic conditions, geographic and demographic performance disparities, and systematic failure modes across speaking rates and acoustic environments.

著者のコメント

Accepted in Interspeech 2026

arXiv ID: 2609.24199 / 要約の誤りについて