arXiv論文メモ
新着一覧
cs.CL / eess.AS · 査読状況未確認

音声認識と翻訳を共同の報酬で改善する

Transcribe, Translate, and Optimize: Joint Reward Learning for Speech Translation

Yanghe Dong, Wanting Huang, Weiran Wang

この論文をやさしく読む

ひとことで言うと

音声をまず文字にしてから翻訳するモデルを、自分で作った文字起こしを使って訓練する研究です。認識と翻訳の両方に報酬を与え、実際の利用時に近い条件で改善します。

何に役立つ?

文字起こしの誤りが翻訳に伝わる問題への対処に役立ちます。評価した4言語と2データセットでは、文字起こしの誤り率と翻訳のBLEUの両方が改善しました。

この研究の面白いところ

正しい文字起こしだけを与える学習から、モデル自身の認識結果を条件に翻訳を学ぶ方式へ変えています。中間段階の認識と最終段階の翻訳を一緒に評価する点が特徴です。

どこまで分かった?

報告対象はQwen2.5-Omni-3Bを用いた4言語の評価です。BLEUの改善はポイント差、WERの改善は相対的な減少率であり、同じ種類の数値ではありません。他のモデルや言語での効果は要旨では示されていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

大規模言語モデル(LLM)に基づく音声翻訳では、文字起こしを用いる思考連鎖(CoT)に、教師あり微調整(SFT)で使う正解の文字起こしと、推論時にモデルが生成する文字起こしとの不一致という問題がある。これに対処するため、グループ相対方策最適化(GRPO)によって音声認識と翻訳を共同で微調整する手法を提案する。文字起こしと翻訳の両方を採点し、翻訳はモデル自身が生成した文字起こしを条件として行う。また、トークンのアドバンテージを設定する3種類の戦略を比較する。 Qwen2.5-Omni-3Bを4言語で用い、CoVoST 2で学習し、CoVoST 2とFLEURSで評価する。SFTとGRPOのそれぞれについて、CoTと直接音声翻訳(Direct ST)を比較する。CoT GRPOはDirect ST GRPOに対し、平均BLEUでCoVoST 2では1.77ポイント、FLEURSでは0.83ポイント上回る。CoT SFTと比較すると、GRPOはBLEUをそれぞれ0.82ポイント、0.67ポイント改善し、単語誤り率(WER)を相対値で8.8%、7.2%減らす。これらの結果は、強化学習による微調整が学習時と推論時の不一致を緩和し、音声認識と翻訳を同時に改善する有効な方法であることを示す。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-22(UTC)
最新改訂
2026-09-22 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

In LLM-based speech translation, transcription-based chain-of-thought (CoT) suffers from a mismatch between reference transcripts used in supervised fine-tuning (SFT) and model-generated transcripts at inference. To address this, we propose joint recognition and translation fine-tuning via group relative policy optimization (GRPO). We score both transcripts and translations, with translation conditioned on model-generated transcripts, and compare three token advantage strategies. Using Qwen2.5-Omni-3B across four languages, we evaluate CoT against direct speech translation (Direct ST) under SFT and GRPO, training on CoVoST 2 and testing on CoVoST 2 and FLEURS. CoT GRPO outperforms Direct ST GRPO by 1.77 and 0.83 average BLEU points on CoVoST 2 and FLEURS. Compared to CoT SFT, GRPO boosts BLEU by 0.82 and 0.67 points and reduces word error rate (WER) by 8.8% and 7.2% relatively. These results highlight reinforcement fine-tuning as an effective method to mitigate the training-inference mismatch, jointly improving recognition and translation.

著者のコメント

5 pages

arXiv ID: 2609.26536 / 要約の誤りについて