arXiv論文メモ
新着一覧
cs.RO · 査読状況未確認

動作の基準を固定してロボットの継続学習を安定化

FAN: Foresight Action Normalization for Continual Adaptation of Vision-Language-Action Models

Yijun Hong, Jiarun Zhu, Xiaoquan Sun, Le Xu, Qijun He, Xin Jin, Mingqi Yuan, Wenjun Zeng, Jiayu Chen

この論文をやさしく読む

ひとことで言うと

ロボットが新しい作業を覚えるたびに動作数値の基準が変わると、以前の技能も崩れます。この研究は最初に基準を決め、その後は固定する方法を調べています。

何に役立つ?

考えられる用途は、片腕・両腕ロボットに順番に新しい作業を学ばせる際の制御表現の設計です。四つの実環境タスク系列で比較されています。

この研究の面白いところ

学習データを再利用する方法だけでなく、行動をどの座標基準で表すかに注目します。事前の小さな較正集合から一度だけ基準を決める簡潔な手法です。

どこまで分かった?

最高性能という結果は評価した四系列の範囲です。要旨には具体的な改善率や無期限の運用試験はなく、あらゆる将来タスクで性能を保つ保証とは区別が必要です。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

大規模な非公開データセットで事前学習した視覚・言語・行動(VLA)モデルは、多様なロボット操作課題で顕著な成功を収めている。しかし、実環境への長期展開には、既に学んだ能力を維持しながら新たな技能を継続的に獲得する必要がある。経験再生や強化学習による微調整などを使う先駆的な研究がVLAの継続適応を検討してきた一方で、方策が物理的な行動を認識し実行する基礎の座標系を定める、行動の正規化という基本的機構は見落とされてきた。 この不足を埋めるため、片腕操作と両腕操作を含む四つの実環境タスク系列で、五つの正規化戦略を体系的に評価する。解析から、既存の手順はタスク間の座標系のずれ、動作範囲の不足、あるいは学習時と試験時の座標系の不一致によって深刻な失敗を引き起こすことが分かった。これらの知見に基づき、一貫性、網羅性、因果性という三つの中核設計原則(3C)を定式化し、先を見据えた行動正規化FANを導入する。FANは、継続学習に先立って、小規模でタスク非依存の較正集合から正規化統計量を一度だけ推定し、適応の全期間を通じて固定する。評価したすべての系列でFANは最高性能を達成し、一貫した頑健性を示す。これにより、効果的な生涯VLA適応を実現するための安定した行動表現の構築に、有益な指針を提供する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-18(UTC)
最新改訂
2026-09-18 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Vision-Language-Action (VLA) models pre-trained on large-scale, closed datasets have demonstrated remarkable success across diverse robotic manipulation tasks. However, their long-term real-world deployment necessitates continuously acquiring new skills while retaining previously learned capabilities. While pioneering works have explored continual VLA adaptation using techniques such as experience replay and reinforcement fine-tuning, they overlook a foundational mechanism: action normalization, which determines the underlying coordinate system in which policies perceive and execute physical actions. To bridge this gap, we systematically evaluate five normalization strategies across four real-world task streams covering single-arm and bimanual manipulation. Our analysis reveals that existing protocols induce severe failure modes due to inter-task coordinate drift, limited motion coverage, or train-test coordinate mismatches. Motivated by these insights, we formulate three core design principles: consistency, coverage, and causality (3C), and introduce foresight action normalization (FAN). FAN estimates normalization statistics once from a small, task-independent calibration set prior to continual learning and freezes them throughout adaptation. Across all evaluated streams, FAN achieves the highest performance and demonstrates consistent robustness, providing insightful guidance for building stable action representations in achieving effective lifelong VLA adaptation.

著者のコメント

9 pages, 6 figures

arXiv ID: 2609.21358 / 要約の誤りについて