arXiv論文メモ
新着一覧
cs.GT / cs.CR · 査読状況未確認

観測を乱される意思決定で履歴依存の均衡を求める

Epsilon-Nash Equilibria in History-Dependent SA-MDPs

Brandon Gary Kaplowitz, Dominik Bohnet Zurcher, Akash Agrawal, Tala Jafari, Christian Schroeder de Witt, and Paul W. Goldberg

この論文をやさしく読む

ひとことで言うと

相手が見せる観測を改変できる状況で、過去の履歴も使って行動する双方の戦略の均衡を計算する。

何に役立つ?

観測の摂動に対する意思決定の頑健性を、単発の攻撃だけでなく履歴を含めたゲームとして評価する基礎になる。

この研究の面白いところ

初期分布を問わず通用する均衡方策がないと示したうえで、初期条件に応じた近似均衡を別形式のゲームへの変換で求める。

どこまで分かった?

計算するのは初期状態に依存するε近似であり、普遍的な厳密均衡ではない。大きい評価例として示されるAtariの予測区間は12期先までである。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

状態敵対的マルコフ決定過程(SA-MDP)を、観測空間への攻撃のゲームとして調べる。各ステップで、エージェントは受け取った観測に基づいて行動を選ぶ一方、エージェントの真の状態を知る敵対者は、その状態に依存する近傍集合の中から摂動を加えた観測を選ぶ。既存研究がマルコフ的方策に注目しているのに対し、本研究は履歴依存の場合の解概念と計算手法を構築する。動機となるのは、履歴依存性が均衡の結果を大きく変え、エージェントと敵対者の双方に戦略の適応を強いる場合があるという知見である。 まず、初期状態分布に依存しない普遍的な履歴依存均衡方策が存在しないことを証明する。この結果を受け、主結果として、初期状態に依存する均衡のε近似を計算する初のアルゴリズム的な道筋を提示する。具体的には、SA-MDPを、戦略的に同値な、制約付きゼロ和・片側部分観測確率ゲームへ帰着する。最後に、解析的に検証できる小規模なゲームでアルゴリズムを試し、12期先までの予測区間を持つAtari Freewayのロールアウトを含む、より大きく現実的なベンチマークにも拡張できることを示す。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-16(UTC)
最新改訂
2026-09-16 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

We study state-adversarial Markov decision processes (SA-MDP) as a game of observation-space attacks: at each step, an agent selects an action from a received observation while an adversary$\unicode{x2014}$who knows the true state the agent is in$\unicode{x2014}$chooses a perturbed observation within a state-dependent proximity set. While existing work focuses on Markovian policies, we develop a solution concept and computational approach for SA-MDPs under history dependence. This is motivated by results showing that history dependence can materially change equilibrium outcomes and can force both the agent and the adversary to adapt their strategies. First, we prove the non-existence of universal (agnostic of the initial state distribution) history-dependent equilibrium policies. In response to this finding, our main result presents the first algorithmic route to computing $\epsilon$-approximations of initial-state dependent equilibria. We do so by reducing SA-MDPs to a strategically equivalent constrained zero-sum one-sided partially observable stochastic game. We conclude by testing our algorithm on small analytically verifiable games and showing it scales to larger, more realistic benchmarks, including Atari Freeway rollouts with a 12-period ahead horizon.

arXiv ID: 2609.18829 / 要約の誤りについて