強化学習で線形計画法の更新と再始動を調整する
Reinforcement Learning to Accelerate Primal-Dual Hybrid Gradient for Linear Programming
この論文をやさしく読む
ひとことで言うと
線形計画を解く計算の進め方と再始動のタイミングを、強化学習でまとめて調整する方法です。
何に役立つ?
同じ種類の大規模な最適化問題を繰り返し解く場合に、反復回数や計算時間を減らす手段になります。
この研究の面白いところ
小さな問題で学んだ調整方策を、同じ問題群のはるかに大きい問題へそのまま使っています。連続パラメータと再始動という離散操作を一緒に学びます。
どこまで分かった?
汎化の結果は群ごとに学習した方策を同じ群の問題へ適用したものです。最大16倍はアルゴリズムの実行時間の比較であり、方策学習を含む総費用の改善率は要旨にはありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
主双対ハイブリッド勾配法(PDHG)は、GPUで処理しやすい行列・ベクトル積と射影を使って大規模な線形計画問題(LP)を解く。しかし実際の性能は、アルゴリズムのパラメータ、加速、再始動を協調させられるかに左右される。本研究ではGALLOPを提案する。ソルバーを通じた微分を行わず、連続値のアルゴリズムパラメータと離散的な再始動判断を強化学習で同時に学ぶ。一般化した加速PDHG更新は、主変数と双対変数の独立した外挿、履歴補正、再始動時のアンカー設定を、それぞれ独立に調整可能な係数で組み合わせる。 制御群ごとに尤度比を別々にクリップし、再始動遷移では非作動の加速制御を除外するグループ別の近接方策最適化目的を用いて、問題の次元に依存しないフィードバック方策を学習する。6種類のLP群と公開された物品配置ベンチマークでGALLOPを評価した。6群の主要評価設定では、MPAXと比べ反復回数を1.9〜5.6分の1に減らし、アルゴリズムの実時間で最大16.0倍の高速化を達成した。群ごとに1つの方策を学習すると、最大の学習例より3〜400倍大きい同じ群のLPへ、再学習なしに汎化する。これには変数数1,024万の輸送LPも含まれる。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-10-01(UTC)
- 最新改訂
- 2026-10-01 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-10-01 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Primal-dual hybrid gradient (PDHG) methods solve large-scale linear programs (LPs) using GPU-friendly matrix-vector products and projections, but their practical performance depends on coordinating algorithm parameters, acceleration, and restarts. We introduce GALLOP, which uses reinforcement learning to jointly learn continuous algorithm parameters and discrete restart decisions without differentiating through the solver. Its generalized accelerated PDHG update combines separate primal and dual extrapolation, history corrections, and restart anchoring with independently adjustable coefficients. We train a dimension-agnostic feedback policy using a groupwise proximal policy optimization objective that clips likelihood ratios separately for different control groups and excludes inactive acceleration controls on restart transitions. We evaluate GALLOP on six LP families and a public item-placement benchmark. On the main evaluation settings across the six families, GALLOP reduces iteration counts by factors of $1.9$-$5.6$ and achieves up to a $16.0\times$ speedup in algorithm wall-clock time over MPAX. With one policy trained per family, the learned policies generalize without retraining to within-family LPs $3\times$-$400\times$ larger than the largest training instances, including Transport LPs with $10.24$ million variables.
著者のコメント
35 pages, 4 figures
arXiv ID: 2610.01546 / 要約の誤りについて