入力ノイズを調整してロボットの生成動作を制約へ導く
Safe Real-Time Policy Steering via Noise-Space Trajectory Optimization for One-Step Generative Policies
この論文をやさしく読む
ひとことで言うと
AIが出した動きを後から直接直すのではなく、動きを生成する入口のノイズを選び直して、衝突回避などの条件を満たす行動を探します。
何に役立つ?
考えられる用途は、学習済みのロボット方策を、運用時に追加された姿勢や障害物の条件へ合わせることです。元の方策が生み出す行動の範囲を利用して探索します。
この研究の面白いところ
行動そのものではなく入力ノイズを最適化し、入力分布から外れすぎないための正則化も入れています。反復生成を何度も通る勾配誘導とは異なる場所で調整する構成です。
どこまで分かった?
結果は挙げられたタスク群と方策での比較です。要旨には成功率、制約違反率、実行時間の具体値がなく、すべての制約を常に満たす形式的保証があるとは述べていません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
生成型ロボット方策は多様な複数の行動様式を表現できるが、事前学習した方策を、衝突回避や姿勢維持など運用時の制約へ適応させることは依然として難しい。既存の推論時の誘導法は通常、反復的な拡散過程やフロー過程を通じて勾配による誘導を行うため、リアルタイム制御では計算コストが高くなり得る。 本研究では、1ステップ生成方策の推論時の誘導を、方策の入力ノイズ空間での軌道最適化として定式化するINSPOを提案する。生成された状態軌道の制約を評価しながら入力ノイズを最適化することで、INSPOは生成行動を直接変更せずに、方策が生み出す行動空間を探索する。最適化には、解が方策の入力分布と整合したままであることを促す正則化項を含め、集団に基づく粒子最適化を用いてオンラインで解く。 Push-T、缶の把持・配置、LIBERO-Spatialにわたり、状態ベースと画像ベースのタスク専用方策、および汎用的な視覚・言語・行動方策でINSPOを評価する。INSPOは、N個のサンプルから最良を選ぶ方法や行動の射影に比べて、タスク成功と制約充足を改善する。また、勾配で誘導する生成法と比べても良好な結果を、より短い実行時間で得る。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-18(UTC)
- 最新改訂
- 2026-09-18 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-18 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Generative robot policies can represent diverse, multimodal behaviors, but adapting pretrained policies to deployment-time constraints such as collision avoidance and orientation maintenance remains challenging. Existing inference-time steering methods typically apply gradient guidance through iterative diffusion or flow processes, which can be computationally expensive for real-time control. We propose INSPO, which formulates inference-time steering of one-step generative policies as trajectory optimization in the policy's input noise space. By optimizing the input noise while evaluating constraints on the induced state trajectory, INSPO searches the policy-induced behavior space without directly modifying generated actions. The optimization includes a regularization term that encourages solutions to remain consistent with the policy's input distribution and is solved online using population-based particle optimization. We evaluate INSPO on state- and image-based task-specific policies and generalist vision-language-action policies across Push-T, Can pick-and-place, and LIBERO-Spatial. INSPO improves task success and constraint satisfaction over best-of-N sampling and action projection, while comparing favorably with gradient-guided generation at lower runtime.
arXiv ID: 2609.21220 / 要約の誤りについて