arXiv論文メモ
新着一覧
cs.RO · 査読状況未確認

動作生成の最後の一段でロボットを周囲の変化に追従させる

Catch Me If You Can: Real-Time Feedback Denoising for Responsive VLAs

Yiheng Ji, Xingru Zhou, Luis Sentis, Mingyo Seo

この論文をやさしく読む

ひとことで言うと

ロボットがまとめて決めた動作を実行する直前に、最新のカメラ画像を使って小さく修正する仕組みです。重い計画計算を毎回やり直さず、動く対象への反応を速めます。

何に役立つ?

考えられる用途は、物体や接触状態が途中で変わる操作作業です。低頻度の大きな計画と高頻度の修正を分ける設計として参考になります。

この研究の面白いところ

拡散モデルの最後のノイズ除去段階を、行動を修正する接点として使います。静的課題の性能を保ちながら、動的課題の成功率を大きく改善したと報告しています。

どこまで分かった?

85.0%は動的シミュレーション、73%は実ロボットでの平均成功率です。この二つを混同できず、要旨にはすべての対象や変化速度に対する保証や具体的なフィードバック周波数は記載されていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

視覚・言語・行動(VLA)モデルは、事前学習した視覚言語モデルの意味知識と表現力のある動作生成方策を組み合わせ、ロボット操作で高い汎化能力を示してきた。拡散型の動作生成器は、時間的に一貫した動作のまとまりをモデル化するのに特に有効だが、そのまとまりは通常、推論後に開ループで実行される。このため、実行中に物体が動く、接触状態が変わる、場面が変化するといった状況への応答性が限られる。 本研究は、低頻度の拡散計画と高頻度の視覚フィードバックを組み合わせる、二つの時間尺度を持つ構造VLA-Feedbackを提案する。実行前に動作のまとまりのノイズ除去をすべて終える代わりに、最後のノイズ除去段階を軽量なフィードバックの接点として残し、各動作を実行する直前の最新観測で修正できるようにする。この設計は、拡散計画器の表現力を保ちながら、視覚言語拡散モデル全体を再実行せずにリアルタイムの動作修正を可能にする。 VLA-Feedbackは、静的なLIBEROタスクでGR00Tと同等の成績を保ちつつ、動的シミュレーションタスクの平均成功率を27.5%から85.0%へ改善した。実ロボットのタスクでも平均成功率を51%から73%へ改善した。追加資料はプロジェクトページhttps://vla-feedback.github.ioで参照できる。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-17(UTC)
最新改訂
2026-09-17 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Vision-Language-Action (VLA) models have shown strong generalization in robotic manipulation by combining semantic knowledge from pretrained vision-language models with expressive action-generation policies. Diffusion-based action generators are particularly effective for modeling temporally coherent action chunks, but these chunks are typically executed open-loop after inference. This limits responsiveness when objects move, contacts change, or the scene evolves during execution. We propose VLA-Feedback, a two-timescale architecture that combines low-frequency diffusion planning with high-frequency visual feedback. Rather than fully denoising an action chunk before execution, VLA-Feedback retains its final denoising step as a lightweight feedback interface, allowing each action to be corrected using the latest observation before it is executed. This design preserves the expressiveness of the diffusion planner while enabling real-time action correction without rerunning the full vision-language diffusion model. VLA-Feedback matched GR00T on static LIBERO tasks while improving average success on dynamic simulation tasks from 27.5% to 85.0%. On real-robot tasks, it improved average success from 51% to 73%. Additional materials can be found on our project page: https://vla-feedback.github.io.

著者のコメント

10th Conference on Robot Learning (CoRL 2026), Austin TX, USA

arXiv ID: 2609.21022 / 要約の誤りについて