arXiv論文メモ
新着一覧
cs.LG · 査読状況未確認

状態を十分観測しても方策評価が指数的に難しくなる例

Exponential Hardness of Off-Policy Evaluation under History-Dependent Logging

Pranaya Jajoo

この論文をやさしく読む

ひとことで言うと

過去の行動記録から別の行動方針の成績を推定するとき、各状態を十分に訪れていても、必要なデータが時間の長さに対して指数的に増える例です。

何に役立つ?

オフポリシー評価で、状態や行動がよく観測されているという条件だけでは十分でないことを確認する理論的な反例になります。

この研究の面白いところ

状態や行動の数が少なく、候補モデルまで分かっていても難しさが残ります。履歴に依存する記録方策とリセットが、価値を決める情報を隠す構造になっています。

どこまで分かった?

構成したPOMDPに対する標本数の下界と一致する推定法を示す結果です。あらゆる履歴依存の記録データが同じ難しさを持つという意味ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

記録データがすべての隠れた状態を頻繁に訪れていても、評価対象の方策の価値について、指数関数的に情報が乏しいことはあるだろうか。本研究では、記録用の行動選択が履歴に依存する場合に、それが起こることを示す。任意のホライズンH≥3について、各段階で潜在状態が高々2つ、行動が3つ、そして3つの記憶状態を持つ共通の記録方策を備える、2つの部分観測マルコフ決定過程(POMDP)を構成する。行動カバレッジ、信念カバレッジ、行動方策の周辺分布に基づいて結果を識別可能にする2つの条件は、すべてHに依存しない定数を持つ。 それにもかかわらず、既知の決定論的な対象方策を誤差1/8で評価するには、0<δ≤1/4に対して信頼度1−δを得るために、Θ((3/2)ᴴ log(1/δ))本の記録エピソードが必要となる。これは、候補となる2つのモデルがともに既知であっても成立する。仕組みは単純であり、リセットが、対象方策の価値を決める未知の遷移の情報を消してしまう。 結果として得られる統計的実験を厳密に特徴づけ、対応する最適な推定量を得る。有向の2車線グリッドワールドでこの構成を実現し、軌跡のシミュレーションが有限標本での予測と一致することを示す。この結果は、ZhangとJiang(2025年、arXiv:2503.01134)が提示した、履歴依存の記録方策を用いるモデルベースの場合について、彼らの行動周辺分布に基づく識別可能性の定義の下で、扱いにくさを確立する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-16(UTC)
最新改訂
2026-09-16 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Can a logged dataset visit every hidden state frequently and still be exponentially uninformative about a target policy's value? We show that it can when the logger depends on history. For every horizon $H \ge 3$, we construct two POMDPs with at most two latent states per stage, three actions, and a common logger with three memory states. Action coverage, belief coverage, and two behavior-marginal outcome-revealing conditions all have constants independent of $H$. Nevertheless, evaluating a known deterministic target policy to accuracy $1/8$ requires $\Theta((3/2)^H \log(1/\delta))$ logged episodes at confidence $1-\delta$, for $0 < \delta \le 1/4$, even when both candidate models are known. The mechanism is simple: a reset erases the unknown transition that determines the target value. We characterize the resulting statistical experiment exactly and obtain a matching optimal estimator. A directed two-lane gridworld realizes the construction, and trajectory simulations agree with its finite-sample prediction. The result establishes intractability for the history-dependent-logging, model-based case posed by Zhang and Jiang (2025, arXiv:2503.01134), under their behavior-marginal definition of revealing.

arXiv ID: 2609.19135 / 要約の誤りについて