検索拡張生成の引用は回答に使った資料を示しているか
Attributable Post-Rationalization in RAG Citations: A Controlled Reproduction and an RLVR Comparison
この論文をやさしく読む
ひとことで言うと
AIの回答に付いた引用が、実際に回答の根拠として使われた資料かを調べた研究です。
何に役立つ?
RAGの評価で、答えの正確さと引用の忠実性を別々に確認する必要性を示します。考えられる用途は、検索エージェントの学習目標や評価指標の設計です。
この研究の面白いところ
正答に報酬を与える強化学習を行っても、引用の事後付けは減りませんでした。4データセットと対照条件を使ってこの点を比較しています。
どこまで分かった?
要旨で示された割合は、評価したデータセットとモデル群に基づきます。引用の忠実性を改善する具体的な学習方法の効果は、ここでは報告されていません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
検索拡張生成(RAG)のシステムは正しい答えを返しながら、実際には使っていない資料を引用することがある。モデルは、先に回答を書き、後から近そうな文章に引用を付ける事後的な合理化によって、このような忠実でない引用を出力する。検索エージェントは現在、回答の正しさに報酬を与える、検証可能な報酬に基づく強化学習(RLVR)で学習されている。この学習によって引用も正直になるかを調べた。著者らは既存の方法に必要な対照条件を加えて改良し、指示に従うよう調整したモデルと、そこから学習した3種類のRLVRエージェントを、4種類の質問応答データセットで比較した。使用した計算資源はKaggleの無料枠GPUだけである。事後的な合理化は広く見られ、Wikipediaに基づく質問では、およそ7件に1件の引用が忠実でなかった。RLVRでもこの問題は解決せず、エージェントの事後的な合理化の割合は基礎モデルと同程度で、1種類はわずかに悪化した。正答に報酬を与えるだけでは引用の忠実性は改善しないため、忠実性は独立に学習し、測定する必要がある。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-19(UTC)
- 最新改訂
- 2026-09-19 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-19 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
A RAG system can hand you the right answer and cite a source it did not actually use. Models output these unfaithful citations via post-rationalization: they write the answer first and then attach a citation to whatever passage looks close enough. Search agents are now trained with reinforcement learning from verifiable rewards (RLVR), which pays them for getting the answer right. We asked whether that training also teaches them to cite honestly. Improving an existing methodology with a required control, we compared an instruction-tuned model against three RLVR agents trained from it, on four question-answering datasets, using only free-tier Kaggle GPUs. Post-rationalization is everywhere: on Wikipedia-based questions roughly one citation in seven is unfaithful. RLVR does not fix it. The agents post-rationalize at their base model's rate, and one lands slightly worse. Rewarding correct answers buys nothing in citation faithfulness, so faithfulness has to be trained and measured on its own terms.
著者のコメント
11 pages, 1 figure, code available at: https://github.com/mehedikhan72/RAG-Post-Rationalization-RLVR-Comparison
arXiv ID: 2609.23053 / 要約の誤りについて