arXiv論文メモ
新着一覧
stat.ML / cs.LG · 査読状況未確認

モデルから軌道を再生成して方策評価の不確かさを測る

Model-based Bootstrap for Offline Policy Evaluation in Tabular Reinforcement Learning

Weiwei Wang, Yuqiang Li, Xianyi Wu and Bingyi Jing

この論文をやさしく読む

ひとことで言うと

保存済みデータだけで新しい行動方策を評価する際、推定の不確かさをモデルからの再生成で測ります。

何に役立つ?

導入前の方策比較で、点推定だけでなく信頼区間や分散も得るための方法です。途中で切れた軌跡や遷移単位の記録にも対応します。

この研究の面白いところ

記録されたエピソードを丸ごと再抽出する代わりに、推定した環境モデルから新しい軌跡を作ります。使えるデータ形式を広げる点が特徴です。

どこまで分かった?

有限期間で時刻依存の表形式MDPが対象です。信頼区間の保証は漸近的で、有限データの数値実験では多くの設定で改善していますが、全設定での優位を主張していません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

オフライン方策評価(OPE)は、導入前に新しい方策を信頼できる形で評価しなければならない、重大な影響を伴う強化学習の応用で重要である。このような場面では点推定だけでは不十分であり、安全でリスクを考慮した意思決定には、信頼区間や分散推定など、原理に基づく不確かさの定量化が不可欠となる。これらを包括的に統一する方法は、評価誤差の標本分布を推定することである。しかし既存の方法には、頑健性、拡張性、有限標本での妥当性のいずれかに制約があることが多い。 有限時間ホライズンで時間非一様なマルコフ決定過程(MDP)におけるOPEの不確かさを定量化するため、モデルに基づくブートストラップの枠組みを提案する。完全なエピソードの再標本化に依存する従来のブートストラップと異なり、推定したMDPから軌道を再生成する。このため、完全な軌道、遷移単位の観測、軌道の断片など、はるかに幅広い形式のオフラインデータに対応できる。この柔軟性は、有限標本での統計的効率も改善する。 ブートストラップ分布の一致性、漸近的に妥当な信頼区間、対象方策の価値に対する一致性のある分散推定を確立する。広範なシミュレーションでは、提案法がOPE推定量の標本分布を正確に捉え、ほとんどの設定で、より狭い信頼区間と、より正確な分散推定を与えることを示す。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-17(UTC)
最新改訂
2026-09-17 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Offline policy evaluation (OPE) is crucial in high-stakes reinforcement learning applications, where new policies must be assessed reliably before deployment. In such settings, point estimates alone are insufficient; principled uncertainty quantification, such as confidence intervals and variance estimates, is essential for safe and risk-aware decision-making. A comprehensive way to unify these tasks is to estimate the sampling distribution of the evaluation error. Existing approaches, however, often suffer from limited robustness, scalability, or finite-sample validity. In this paper, we propose a model-based bootstrap framework for uncertainty quantification of OPE in finite-horizon, time-inhomogeneous Markov decision processes (MDPs). Unlike classical bootstrap methods that rely on resampling complete episodes, the proposed method regenerates trajectories from an estimated MDP and can therefore accommodate a much broader range of offline data formats, including complete trajectories, transition-level observations, and trajectory fragments. This flexibility further improves finite-sample statistical efficiency. We establish bootstrap distributional consistency, asymptotically valid confidence intervals, and consistent variance estimation for the target policy value. Extensive simulations show that the proposed method accurately captures the sampling distribution of the OPE estimator, yielding tighter confidence intervals and more accurate variance estimates in most settings.

arXiv ID: 2609.20389 / 要約の誤りについて