マルチモーダル言語モデルの幻覚を抑える二段階の方策最適化
DEEPO: Dual-Entropy Enhanced Policy Optimization for Hallucination in MLLMs
この論文をやさしく読む
ひとことで言うと
複数の候補がそろって間違う難問と、モデルが強く確信する誤答の両方を修正する学習方法を提案した。
何に役立つ?
マルチモーダルモデルの幻覚対策で、誤答から学習信号が消える場面を分析し、学習方法を設計する参考になる。評価では幻覚低減と正解率維持を報告している。
この研究の面白いところ
誤答が一致して比較信号が消える問題と、高確信の誤答ほど勾配が弱くなる問題を別々に扱い、二つの仕組みを組み合わせた。
どこまで分かった?
数値を伴う相互作用の有意性はVideoMMMUで報告され、他の課題では加算的な効果だった。評価対象外のモデルや課題への一般化は要旨からは判断できない。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
強化学習はマルチモーダル大規模言語モデルの推論能力を高めるために広く使われるが、幻覚に対する効果は一様ではない。本研究は、報酬からパラメータ更新へ至る修正の連鎖に、二つの弱点があると分析する。応答を生成する段階では、意味的エントロピーが高い難問に対して標本群が全員誤答することが多く、幻覚の危険が最も高いところで群内の相対的な優位度がゼロになる。最適化の段階では、誤っているのに確信度が高いトークンに勾配が届きにくい。カテゴリカルな方策の期待スコア勾配のノルムは分布が鋭くなるほどゼロに近づき、修正が最も必要な予測ほど更新が弱くなるためである。 提案手法DEEPOは、信号の分散の調整と勾配の事前条件付けを組み合わせた二段階の改良である。意味的エントロピーを引き金として、不確実性の高い質問には専門家による応答の書き出しを加え、根拠に基づく続きを示して直接的な教師信号と優位度の分散を回復する。一方、優位度の符号を考慮したレニー型の事前条件付けにより、ロジットの飽和を抑え、実際の信頼度の範囲で確信を持った誤りにも修正を届ける。二つの仕組みは個別にもGRPOより改善した。両者の相互作用は、評価対象で最も複雑な長期的課題であるVideoMMMUで統計的に有意であり、改善幅は4.0、95%信頼区間は1.1~6.9だった。他の課題では効果は加算的だった。DEEPOは正解率と学習の安定性を保ちながら幻覚を減らした。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-23(UTC)
- 最新改訂
- 2026-09-23 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-23 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Reinforcement learning (RL) is widely used to sharpen reasoning in multimodal large language models (MLLMs), yet its effect on hallucination is uneven. We trace this to two weak points in the \emph{correction chain} from reward to parameter update. At the rollout level, hard queries---those with high semantic entropy---frequently produce unanimously wrong sample groups, collapsing the group-relative advantage to zero exactly where hallucination risk is highest. At the optimization level, confident-but-wrong tokens are gradient-invisible: a categorical policy's expected score-gradient norm vanishes as its distribution sharpens, so the predictions that most need correction receive the weakest updates. We propose Dual-Entropy Enhanced Policy Optimization (DEEPO), a dual-stage enhancement combining signal variance regularization with gradient preconditioning: semantic-entropy-triggered expert prefixes inject grounded continuations on high-uncertainty queries, providing direct supervision and restoring advantage variance, while advantage-sign-aware Renyi preconditioning counteracts logit-level saturation so correction reaches confident errors in the operational confidence regime. Both branches improve over GRPO individually; their interaction is statistically significant on VideoMMMU---the most complex long-horizon task in our evaluation suite (+4.0$, 95\% CI [1.1, 6.9])---and additive elsewhere. DEEPO reduces hallucination while preserving accuracy and training stability.
arXiv ID: 2609.28570 / 要約の誤りについて