arXiv論文メモ
新着一覧
cs.RO / cs.AI · 査読状況未確認

大規模ロボット行動モデルの追加学習ではガウス事前分布で十分

The Gaussian Is Enough: Flow-Matching Priors Do Not Help When Fine-Tuning Large Behavior Models

Chen Xu, Rishi Shah, Hadas Kress-Gazit, Haruki Nishimura, Masha Itkina

この論文をやさしく読む

ひとことで言うと

事前学習済みの大型ロボット行動モデルを追加学習するとき、複雑な事前分布が標準ガウス分布を上回るか調べた。

何に役立つ?

ロボット行動モデルの追加学習で、事前分布の改良とエンコーダの訓練のどちらに力をかけるか判断する材料になる。

この研究の面白いところ

10万回超のシミュレーションと1250回の実機試行でも、目標に近い非ガウス分布は追加学習後の性能をほぼ改善しなかった。

どこまで分かった?

追加学習データが極端に少ない場合は例外の可能性を残している。評価は要旨に記された三モデルと課題群である。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

近年のロボットの模倣学習では、事前分布から採った標本を変換して行動を生成する、拡散モデルやフローマッチングモデルに基づく生成的な方策が増えている。重要な疑問は事前分布の選択が性能に影響するかである。ゼロから学習するときは、標準ガウス分布を目標により近い非ガウス分布へ置き換えると性能が大きく向上すると示されている。そこで LBM 1.0、π0.5、GR00T N1.5 のような事前学習済み大規模行動モデル LBM の追加学習にも効果が移るかを調べる。より大きな効果も予想され得るが、追加学習データが極端に少ない場合を除き、そうではなかった。二つのシミュレーション基盤で三つのモデルと40以上の課題にわたる10万回超の実行、および両手での操作五課題に対する実機1250回の実行では、目標に近いと確認できる非ガウス事前分布であっても、標準ガウス事前分布と比べて追加学習後の性能は統計的に区別できないか、より悪かった。診断的な解析によると、事前分布が異なっても追加学習した模倣方策の行動予測は似たものへ収束する一方、追加学習後のエンコーダの埋め込みは事前学習時のものからも相互からも大きく離れる。学習率を変える実験でも、追加学習の性能を支配するのはエンコーダの訓練であり、事前分布の選択の影響を大きく上回ると確認した。最後に、学習した事前分布が追加学習でなお重要になる条件と理由を調べる今後の研究方向を示す。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-22(UTC)
最新改訂
2026-09-22 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Modern robot imitation learning increasingly relies on generative policies based on diffusion or flow-matching models, which generate actions by transforming samples from a prior distribution. A key question is whether the choice of prior matters. Replacing the standard Gaussian with a closer-to-target, non-Gaussian prior has been shown to substantially improve performance when training from scratch. A natural next step is to ask whether these gains transfer to fine-tuning pretrained Large Behavior Models (LBMs) such as LBM 1.0, $\pi_{0.5}$, and GR00T~N1.5, where one might expect even larger gains. Surprisingly, we find that this is not the case, except possibly at very low fine-tuning data fractions. Across over 100K simulation rollouts spanning all three aforementioned LBMs on 40+ tasks in two simulation platforms, and 1250 hardware rollouts on five bimanual manipulation tasks, non-Gaussian priors that are demonstrably closer to the target yield statistically indistinguishable or worse fine-tuning performance than a standard Gaussian prior. Diagnostic analyses suggest why: fine-tuned imitation learning policies converge to similar action predictions across priors, despite their fine-tuned encoder embeddings diverging substantially from the pretrained embeddings and each other. A learning-rate ablation further confirms that encoder training is the dominant factor in fine-tuning performance, substantially outweighing the effect of prior choice. We conclude with concrete directions for future research on when and why learned priors might still matter in fine-tuning. Project page: https://cxu-tri.github.io/non_gaussian_FT/

arXiv ID: 2609.27070 / 要約の誤りについて