配送経路探索の学習で問題の難しさを逐次更新
DCL-GPGLS: Dynamic Curriculum Learning for Genetic Programming Guided Local Search in Large-Scale Vehicle Routing
この論文をやさしく読む
ひとことで言うと
配送ルート探索のプログラムを進化させる際、問題のサイズだけで難しさを決めず、現在の解け具合を見ながら練習問題を選び直します。
何に役立つ?
すべての問題で毎回評価できない状況で、限られた評価回数をどの学習問題に使うかを改善する手法です。
この研究の面白いところ
学習の進み具合に合わせて難易度の見積もり自体を変え、同じ問題ばかり選ばない補正も入れています。
どこまで分かった?
固定された一つの学習・テスト分割での結果です。36問題で平均コストが最小でも、それらすべてで有意差が出たわけではなく、評価回数を揃えた静的手法との有意差は6問題、残り59問題ではありませんでした。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
遺伝的プログラミング誘導局所探索(GPGLS)は、遺伝的プログラミングによって効用関数を進化させ、大規模車両経路問題(LSVRP)の誘導局所探索に用いる。すべての世代で、すべての GP 個体をすべての学習問題で評価するのは高価なため、GPGLS は通常、小さな問題バッチで学習する。既存のカリキュラム型 GPGLS は、主として問題サイズによってバッチの順序を決める。Adaptive Curriculum Learning GPGLS(ACL-GPGLS)は、固定されたカリキュラム段階を移るタイミングを適応させて学習効率を改善するが、問題の難易度順は事前に定められたままである。 本研究では、現在の集団の解の質から各学習問題の難易度を推定し、進化の途中でその推定を更新する DCL-GPGLS を提案する。各世代には、予定された難易度に近いバッチを与え、同じ問題の繰り返し選択を抑える補正を加える。CVRPLIB X 集合の固定された学習・テスト分割による実験では、6つの学習方策の中で、DCL-GPGLS が観測上最良の平均順位と平均テストコストを達成した。未知の65テスト問題のうち36件で最小の平均コストを得た。評価器の総呼び出し回数を揃えた、フィードバックから作った静的カリキュラムと比較すると、6問題で有意に優れ、残る59問題では有意差がなかった。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-21(UTC)
- 最新改訂
- 2026-09-21 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-21 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Genetic Programming Guided Local Search (GPGLS) uses genetic programming to evolve utility functions for guided local search in large-scale vehicle routing problems (LSVRPs). Evaluating every GP individual on every training instance at every generation is expensive, so GPGLS is usually trained on small instance batches. Existing curriculum-based GPGLS orders these batches mainly by instance size. Adaptive Curriculum Learning GPGLS (ACL-GPGLS) improves training efficiency by adapting when the search moves between fixed curriculum stages, but the instance difficulty order remains predefined. We propose DCL-GPGLS, which estimates the difficulty of each training instance from the current population's solution quality and updates the estimates during evolution. Each generation then receives a batch near a scheduled difficulty level, with a correction that limits repeated selection of the same instances. Experiments on a fixed training-test split of the CVRPLIB X set show that DCL-GPGLS achieves the best observed average rank and mean test cost among six training policies. It obtains the lowest mean cost on 36 of 65 unseen test instances and is significantly better than the static feedback-derived curriculum, matched in total evaluator calls, on 6 instances, with no significant difference on the remaining 59.
著者のコメント
14 pages, 3 figures
arXiv ID: 2609.24105 / 要約の誤りについて