arXiv論文メモ
新着一覧
cs.LG / cs.DS / math.OC · 査読状況未確認

不確実性を持つ意思決定問題を線形計画で解く

Linear Programming Representations and Strongly Polynomial Algorithms for Robust Markov Decision Processes

Han Zhong, Yinyu Ye

この論文をやさしく読む

ひとことで言うと

報酬や状態遷移が正確に分からない意思決定問題を、線形計画として表し、解くための計算量を保証する研究です。

何に役立つ?

不確かなモデルでも良い方策を求めるロバスト最適化で、扱える不確実性の形と計算の難しさを整理する基礎になります。

この研究の面白いところ

方策反復の一連の操作を単一の線形計画に組み込み、最適価値だけでなくすべての最適な定常ランダム化方策を復元できると示します。

どこまで分かった?

多項式性の主要な保証は割引率を固定した条件です。不確実性は指定された有理多面体の矩形構造などに限られ、任意の依存関係を持つ不確実性一般への保証ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

報酬と遷移に、有理多面体で表される状態・行動ごとに独立な矩形型の不確実性があるロバストMarkov決定過程(RMDP)について、線形計画(LP)による表現と強多項式時間アルゴリズムを研究する。有限回のロバスト方策反復の手順を符号化することにより、その最適解からロバスト最適価値とすべての最適な定常ランダム化方策を復元できる、単一のLPを構成する。割引率を固定した場合、このLPの次元と符号化長は多項式であり、強多項式時間で構成できる。 さらに、不確実性集合上での最小化の費用と、方策評価に必要な反復回数を組み合わせた、ロバスト方策反復の一般的な計算量解析を展開する。割引率が固定されている場合、この解析を用いてℓ₁およびℓ∞ RMDPの既知の計算量上界を改善し、一般の区間型、重み付きℓ₁、Wasserstein RMDPと、これらの不確実性集合を持つ手番制確率ゲームについて、新たな強多項式時間の上界を確立する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-10-01(UTC)
最新改訂
2026-10-01 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

We study linear programming (LP) representations and strongly polynomial algorithms for robust Markov decision processes (RMDPs) with rational polyhedral state-action rectangular uncertainty in rewards and transitions. By encoding a finite sequence of robust policy-iteration steps, we construct a single LP whose optimal solutions recover the robust optimal value and all optimal stationary randomized policies. At fixed discount, the LP has polynomial dimension and encoding length and can be constructed in strongly polynomial time. We also develop a general complexity analysis of robust policy iteration that combines the cost of minimizing over uncertainty sets with the number of iterations needed to evaluate a policy. For a fixed discount factor, we use this analysis to improve the known complexity bounds for $\ell_1$ and $\ell_\infty$ RMDPs and establish new strongly polynomial bounds for general interval, weighted $\ell_1$, and Wasserstein RMDPs, as well as turn-based stochastic games with these uncertainty sets.

arXiv ID: 2610.02131 / 要約の誤りについて