arXiv論文メモ
新着一覧
cs.LG · 査読状況未確認

内発的報酬が情報のある探索につながる条件

When Do Intrinsic Rewards Lead to Exploration?

Scott W. Viteri (Stanford University), Laura Gomezjurado Gonzalez (Stanford University), Clark Barrett (Stanford University)

この論文をやさしく読む

ひとことで言うと

好奇心のような内部報酬を増やすことが、本当に後から役立つ情報を集めることになるかを数学的に問い直す研究です。

何に役立つ?

探索用の報酬を選ぶとき、報酬値の大きさだけで良い探索と判断しないための基準になります。別の行動方針にも使える経験を得たかに着目します。

この研究の面白いところ

異なる4種類の目的関数が不十分になる例を、共通の単純な環境で示します。失敗例だけでなく、うまくいく条件と改善を反映する目的関数も与えます。

どこまで分かった?

反例は要旨で指定された各目的関数と提案基準についてのものです。すべての内発的報酬が無効という結論ではありません。実用ベンチマークでの性能や新目的関数の計算コストは記載されていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

内発的報酬は、予測誤差や学習の進展などによってエージェントの経験に価値を与え、強化学習の探索を導くよう設計される。しかし、これらの報酬を最大化しても、入手可能な中で最も情報のある経験が得られるとは限らない。私たちは、方策が得る反実仮想的な情報、すなわち、その履歴が別の方策のもとで得る経験をどれほど代替できるかによって方策を比較する、探索の形式的な基準を提案する。 指定したカウントベース、予測誤差、エンパワーメント、情報利得の各目的関数について、それを最大化する方策が、反実仮想的な情報の獲得ではパレート最適でない例となる、単一の単純な環境を構成する。これらの失敗を説明し、既存の内発的報酬が最適な探索を適切に促す条件を確立する。また、私たちの基準で探索が厳密に改善するたびに、必ずより高い値を与える目的関数も構成する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-10-01(UTC)
最新改訂
2026-10-01 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Intrinsic rewards are designed to guide exploration in reinforcement learning by assigning value to an agent's experience, for example through prediction error or learning progress. However, maximizing these rewards need not produce the most informative experience available. We propose a formal criterion for exploration that compares policies by the counterfactual information they acquire: how well their histories can substitute for experience under alternative policies. We construct a single, simple environment in which specified count-based, prediction-error, empowerment, and information-gain objectives have maximizing policies that are Pareto-suboptimal at acquiring counterfactual information. We explain these failures and establish conditions under which existing intrinsic rewards successfully encourage optimal exploration. We also construct an objective that assigns a higher value whenever exploration strictly improves under our criterion.

著者のコメント

45 pages, 4 figures; includes mathematical appendices. Code, data, and Lean proof sources: https://github.com/scottviteri/what-is-exploration

arXiv ID: 2610.02159 / 要約の誤りについて