arXiv論文メモ
新着一覧
cs.RO · 査読状況未確認

作業履歴を使ってロボットの現在の段階を見分ける

TaskAnchor: Grounding Task State in Reactive VLAs for Long-Horizon Manipulation

Hengyan Liu, Wenlve Zhou, Bo Yue, Yongyi Su, Ruixiang Wang, Zhanqi Zhang, Dekun Lu, Wei Gao, Xiaofen Xing, Kui Jia

この論文をやさしく読む

ひとことで言うと

同じように見える場面でも、「ここまでに何をしたか」を使って、ロボットが次にする作業を区別する方法です。

何に役立つ?

途中の進み具合を覚えておく必要がある長い操作手順への適用が考えられます。既存VLAの行動生成部を変更せずに履歴情報を加えます。

この研究の面白いところ

過去の映像を使うだけでなく、作業の意味的な進行段階を1つの数値として学習し、視覚と言語の両方の入力へ反映します。

どこまで分かった?

約4.9〜5.5倍はRMBenchの特定ベースラインに対する相対値で、絶対成功率は要旨にありません。2.08ミリ秒はπ_{0.5}の行動チャンク当たりの追加遅延で、全処理時間ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

反応型の視覚・言語・行動(VLA)モデルは、見た目が似た観測でも、作業の段階やそれまでの相互作用履歴によって必要な行動が異なる場合、長い手順からなる物体操作を苦手とする。この曖昧さをタスク状態のエイリアシングと呼び、事前学習済みVLAを実行履歴に結び付ける軽量アダプターTaskAnchorを導入する。 TaskAnchorは、履歴に条件付けた視覚情報の改善と、到達点を教師信号とするタスク状態座標を組み合わせる。この座標は、実行の意味的な段階を表すスカラーである。これらの信号を、それぞれ既存の視覚インターフェースと言語インターフェースを通じて注入し、明示的なプランナーを導入せず、行動生成の仕組みも変更しない。RMBenchでは、TaskAnchorは公表済みのπ_{0.5}およびX-VLAのベースラインに対して約4.9〜5.5倍の平均成功率を達成し、RoboMemArenaと実機ロボットでも一貫した改善を得た。π_{0.5}における追加の遅延は、行動チャンク当たりわずか2.08ミリ秒である。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-20(UTC)
最新改訂
2026-09-20 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Reactive vision--language--action (VLA) models struggle with long-horizon manipulation when visually similar observations can correspond to different actions depending on the task stage or interaction history. We refer to this ambiguity as task-state aliasing and introduce TaskAnchor, a lightweight adapter that grounds pretrained VLAs in execution history. TaskAnchor combines history-conditioned visual refinement with a milestone-supervised task-state coordinate, a scalar representing the semantic stage of execution. These signals are injected through the native visual and language interfaces, respectively, without introducing an explicit planner or modifying the action-generation mechanism. On RMBench, TaskAnchor achieves approximately 4.9--5.5$\times$ the average success rates of the published $\pi_{0.5}$ and X-VLA baselines, with consistent gains on RoboMemArena and real robots. The added latency is only 2.08\,ms per action chunk for $\pi_{0.5}$.

arXiv ID: 2609.23580 / 要約の誤りについて