arXiv論文メモ
新着一覧
cs.GT · 査読状況未確認

優先順位付きマッチング学習のリグレットと探索の外部効果

Exact Regret Frontiers and Externality Scheduling in Centralized Serial-Dictatorship Bandits

Lishang Xu, Guodong Ma, Pengcheng Weng, Zixuan Xia

この論文をやさしく読む

ひとことで言うと

優先順位に沿って割り当てる学習問題で、一人の探索が他の人に与える損失を正確に分析しています。

何に役立つ?

全員を同時に割り当てる必要がある仕組みで、探索を誰にどの時点で負担させるかを理解する理論的な基盤になります。

この研究の面白いところ

同じ探索量でも、組み合わせる順番で各人の後悔が変わることを示します。実際に到達できる対数的後悔係数の集合と、通常の上方閉包の領域を区別しています。

どこまで分かった?

共通の既知の優先順位、単位分散のGaussian報酬などの設定です。厳密な集合や多項式サイズの定式化にはtop-choice-separatedという条件もあり、一般の全割当市場の結果ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

集中型の逐次独裁方式によるマッチング・バンディットでは、探索に完全マッチングを使う必要がある。そのため、一つのプレイヤーとアームの組について学習することが、他のプレイヤーにリグレットを負わせる可能性がある。本研究は、共通の優先順位が既知で、報酬が分散1のガウス分布に従う場合に、この外部効果を調べる。 マッチング単位のGraves–Lai制約が有限個のペアごとの探索割当量へ還元され、最上位選択が分離した問題例では、多項式規模の周辺線形計画が得られることを示す。これらの問題例において、期待リグレットの対数係数が厳密に達成可能な集合はG(θ)X(θ)である。ここでXは実行可能なマッチング配分の集合、Gは配分を各プレイヤーのリグレットへ写す写像である。通常の上方閉なGraves–Lai領域は、パレート最小境界が同じでも、この集合より真に大きい場合がある。さらに、同一の探索割当量であっても、その実施順序によって大きく異なるリグレットが生じ得ることを示す。 最後に、各行の選好が厳密なクラス全体で一様に良好に機能する、推定・求解・追跡型の方策を構成する。この方策は、最適解の一意性を仮定せずに、固定された正の重みによるあらゆる最適値を達成する。すべてのパレート最小点は、必要に応じて問題例に合わせて調整した目標を用いることで、各問題例ごとに達成可能である。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-17(UTC)
最新改訂
2026-09-17 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Exploration in centralized serial-dictatorship matching bandits must use complete matchings, so learning one player--arm pair can impose regret on others. We study this externality under a known common priority order and Gaussian rewards with unit variance. We show that the matching-level Graves--Lai constraints reduce to finitely many pairwise exploration quotas and, at top-choice-separated instances, yield a polynomial-size marginal linear program. At these instances, the exact attainable set of expected logarithmic regret coefficients is $G(\theta)\Xset(\theta)$, where $\Xset$ is the feasible matching-allocation set and $G$ maps allocations to player regret. The usual upper-closed Graves--Lai region can be strictly larger despite having the same Pareto-minimal boundary. We further show that identical exploration quotas can induce very different regret through their scheduling. Finally, we construct estimate--solve--track policies, uniformly good on the full row-strict class, that attain every fixed positively weighted optimum without assuming optimizer uniqueness. Every Pareto-minimal point is pointwise attainable, possibly through an instance-calibrated target.

arXiv ID: 2609.19963 / 要約の誤りについて