arXiv論文メモ
新着一覧
cs.RO / cs.SY / eess.SY · 査読状況未確認

走行の成功に役立つ情報を優先して学ぶ予測制御

Task-Oriented Active Learning of Residual Dynamics for Model Predictive Path Integral Control

Nobuaki Aoki, Hojin Lee, Stefan Sosnowski, and Sandra Hirche

この論文をやさしく読む

ひとことで言うと

ロボットが走りながら学ぶときに、単に未知の場所ではなく、その先で目的地へ到達するのに役立つ情報を選ぶ方法です。

何に役立つ?

考えられる用途は、地形によって運動が変わる環境でのオンライン予測制御です。オフロード走行のシミュレーションで目標到達率の改善が示されています。

この研究の面白いところ

今得る観測が同じ予測軌道の後半にどれだけ役立つかを評価します。既存のMPPIの軌道群を使うため、仮想観測ごとに制御を解き直す必要がありません。

どこまで分かった?

結果は未使用地図でのシミュレーションに基づきます。20 Hzという実装性能はRTX 2080 Ti上の値であり、実車や別の計算機で同じ性能が得られたという記載はありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

オンラインの残差学習は予測制御におけるモデルのずれを減らせるが、受動的なデータ収集では、課題の後半で重要になる状態を十分に網羅できないことがある。課題を考慮しない能動学習は、不確かさの大きい領域や情報量の多い領域を狙うが、そこで得た情報が必ずしも課題の性能を改善するとは限らない。 本論文では、オンラインのガウス過程(GP)残差学習を伴うモデル予測経路積分制御(MPPI)のために、能動学習の基準であるTask-Oriented Information Acquisition(ToIA)を導入する。サンプリングした各制御系列について、ToIAは、予測軌道の初期で得られる観測が同じ軌道の後半の状態における予測の不確かさをどれほど減らすかを推定し、その減少量を当該軌道の課題への関連度で重みづけする。このスコアは既存のMPPI予測軌道のバッチ上で評価され、将来の観測のサンプリングや、仮想的な事後分布の更新に基づく制御の再最適化は必要としない。 不均質な地形を持つ評価用の未使用地図上で行ったオフロード走行シミュレーションでは、ToIAは受動的なGP学習に比べて目標到達成功率を19.3および27.4パーセントポイント改善し、オンライン学習の間隔が短い場合と長い場合の両方で、課題を考慮しない能動学習の比較手法を上回った。要素を除去する比較実験は、モデル更新がまばらな場合に、課題との関連性が特に重要になることを示している。実装はNVIDIA RTX 2080 Ti上で20 Hzのオンライン制御に対応する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-16(UTC)
最新改訂
2026-09-16 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Online residual learning can reduce model mismatch in predictive control, but passive data collection may fail to adequately cover states that become important later in the task. Task-agnostic active learning targets uncertain or informative regions, but information acquired in such regions does not necessarily improve task performance. This paper introduces Task-Oriented Information Acquisition (ToIA), an active-learning criterion for model predictive path integral control (MPPI) with online Gaussian process (GP) residual learning. For each sampled control sequence, ToIA estimates how much an observation obtained early in the rollout would reduce predictive uncertainty at later states on the same rollout, and weights this reduction by the rollout's relevance to the task. The score is evaluated over the existing MPPI rollout batch without sampling future observations or re-optimizing control under hypothetical posterior updates. In simulated off-road navigation across held-out maps with heterogeneous terrain, ToIA improved the goal-reaching success rate over passive GP learning by 19.3 and 27.4 percentage points and outperformed task-agnostic active-learning baselines across dense and sparse online-learning intervals. An ablation study indicates that task relevance is particularly important under sparse model updates. The implementation supports online control at 20 Hz on an NVIDIA RTX 2080 Ti.

arXiv ID: 2609.19378 / 要約の誤りについて