arXiv論文メモ
新着一覧
cs.GT / cs.LG / math.OC · 査読状況未確認

ゲームで時間に依存しない後悔の上界を得る学習則

Multiplicative Optimism for Constant Regret in Games

Ashkan Soleymani and Georgios Piliouras

この論文をやさしく読む

ひとことで言うと

複数のプレイヤーが学びながら対戦するとき、後から最良の固定行動と比べた損失を抑える学習方法です。

何に役立つ?

ゲームで全員が同じ種類の学習則を使う場合と、相手側の効用が敵対的な場合を分けて、学習の保証を理解する助けになります。

この研究の面白いところ

完全情報の自己対戦では、時間範囲に依存しない後悔の上界を、一段先の予測だけで得るとしています。敵対的条件にも別の保証を残しています。

どこまで分かった?

定数的な後悔の主張は同時・完全情報の自己対戦という条件付きです。敵対的な場合にはTに依存する上界となります。要旨ではnとdの定義を明記していないため、翻訳でも記号を保持しています。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

有限一般和ゲームに対する、他のプレイヤーの利得構造を必要としない学習則Multiplicatively Optimistic Regret Matching(MORM)を導入する。同時に行動する完全情報の自己対戦では、一段先の楽観的予測だけを用いて、各プレイヤーがあらゆる時間範囲にわたり一様にO(√n log d)の外部後悔を達成する。解析は、ポテンシャルに基づく後悔マッチングの議論と、乗法的安定性、および戦略の変化に対するHellinger距離による制御を組み合わせる。さらに、学習率の保護機構によって、敵対的に与えられる効用に対してもO(√(T log d))の後悔を保証する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-18(UTC)
最新改訂
2026-09-18 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

We introduce Multiplicatively Optimistic Regret Matching (MORM), an uncoupled learning rule for finite general-sum games. Under simultaneous full-information self-play, every player achieves external regret $O(\sqrt n\log d)$ uniformly over all horizons, using only one-step optimism. The analysis combines a potential-based regret-matching argument with multiplicative stability and Hellinger control of strategy movement. A learning-rate safeguard additionally gives $O(\sqrt{T\log d})$ regret in the face of adversarial utilities.

arXiv ID: 2609.21976 / 要約の誤りについて