arXiv論文メモ
新着一覧
math.OC / math.PR · 査読状況未確認

格子上で報酬を最大化するパーコレーション意思決定過程

Percolation Markov Decision Processes

Melissa González García, Guillaume Vigeral (CES)

この論文をやさしく読む

ひとことで言うと

格子の辺にあらかじめランダムな報酬が割り当てられた環境で、長く移動するときの最適な平均報酬と戦略を調べる理論研究です。

何に役立つ?

ランダムな環境での長期的意思決定を解析する基礎になります。低次元の問題による近似を、浸透理論の臨界確率の近似に使う可能性も挙げています。

この研究の面白いところ

報酬は意思決定前にすべて分かり、移動自体は決定的という設定です。長時間極限の一様値と0最適戦略の存在を示し、一次元でも最適戦略が複雑になり得る例を提示しています。

どこまで分かった?

ベルヌーイ報酬では一様値の連続性を示しています。臨界確率の近似は利用可能性として述べられており、要旨に具体的な計算精度の実証はありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

パーコレーション・マルコフ決定過程(PMDP)を研究する。この過程では、意思決定者がd次元整数格子上で駒を繰り返し移動させる。遷移は決定論的で、辺にはランダムな報酬が割り当てられる。報酬は意思決定過程の開始前に明らかになり、意思決定者は所定の期間にわたる平均累積報酬の最大化を目指す。 期間を無限大にしたときの一様値と、0最適戦略の存在を示す。ベルヌーイ報酬という特別な場合には、一様値の連続性に関する結果を示す。また、最適戦略が非常に複雑になり得ることを示す1次元の例をいくつか提示する。さらに、低次元のPMDPによってPMDPを近似できる次元持ち上げの性質を導入する。この性質は、パーコレーション理論における臨界確率の閾値の近似にも利用できる可能性がある。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-17(UTC)
最新改訂
2026-09-17 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

We study Percolation Markov Decision Processes (PMDPs), in which the decision maker repeatedly moves a token through the d-dimensional integer lattice with deterministic transitions and random payoffs assigned to the edges. Payoffs are revealed before the beginning of the decision process and the decision maker aims to maximize the average accumulated payoff over a fixed horizon. We establish the existence of the uniform value (as the horizon tends to infinity) and 0-optimal strategies. In the particular case of Bernoulli payoffs, we establish continuity results for the uniform value. We also present several one-dimensional examples to illustrate that optimal strategies may be very complex. Then, we introduce a dimensional lifting property that allows PMDPs to be approximated by PMDPs of lower dimension and could be used to approximate critical probability thresholds in percolation theory.

arXiv ID: 2609.19905 / 要約の誤りについて