arXiv論文メモ
新着一覧
cs.RO / cs.AI · 査読状況未確認

反復作業の記憶を使ってロボットの推論を速める

rMuscle: Robotic Muscle Memory for Efficient Vision-Language-Action Model Inference

Kaijun Zhou, Zhiyang Li, Le Chen, Jinyu Gu

この論文をやさしく読む

ひとことで言うと

繰り返す作業で似てくる画像処理の結果やモデル内部の活性を再利用し、ロボットの判断を速くする仕組みです。

何に役立つ?

反復的な物体操作でVLAの推論遅延を減らす用途です。ベンチマークだけでなく実ロボットでも、元の成功率を維持したと報告しています。

この研究の面白いところ

視覚段階では計算量、行動段階では重みの読み込みを減らすという、異なるボトルネックに別のキャッシュを当てています。

どこまで分かった?

要旨が示す速度向上は列挙された課題と機器での1.29〜1.42倍です。反復性の低い作業や未知の状況での効果の範囲は、要旨からは分かりません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

工場作業は、身体を持つAIの有望な初期用途である。反復的な手作業をロボットに任せる経済的な利点は明確であり、構造化された作業場所なら現在の方策でも扱いやすい。視覚・言語・行動(VLA)モデルは、こうしたロボットの方策の主要な形態となっている。VLAモデルの推論遅延は、ロボットの応答性と動きの滑らかさに直接影響する。しかし既存の推論基盤は、身体を介した処理の特徴を十分に活用せず、VLA推論の各段階に異なるボトルネックがあることも考慮しきれていない。 本論文ではまず、この種の処理の特徴を分析し、ロボットが繰り返し実行する課題間に大きな類似性があることを特定する。さらに、その類似性が観測や行動軌跡だけでなく、モデル内部の状態にも及ぶことを見いだす。これらの観察を基に、人の筋肉の記憶に着想を得たリアルタイムVLA推論基盤rMuscleを提示する。二段階の筋肉記憶キャッシュにより、実行をまたぐ類似性を利用する。Context Cacheは視覚トークンの出力を再利用して計算を減らし、Action Cacheはニューロンの活性化パターンを再利用して重みへのアクセスを減らす。 オンラインでのキャッシュ再計算、スライディングウィンドウによる検索、連続するノイズ除去ステップ間のマスク共有により、キャッシュのメモリー使用量とアクセス負荷の双方を低く保つ。rMuscleは、LIBERO、RoboTwin、実際の物体操作課題にわたり、RTX 4090とJetson Thorで1.29〜1.42倍の高速化を達成し、実ロボットでは元の成功率を維持した。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-16(UTC)
最新改訂
2026-09-16 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Factory work is a promising early scenario for embodied AI: assigning repetitive manual jobs to robots has clear economic payoff, and a structured station keeps the jobs tractable for current policies. Vision-Language-Action (VLA) models now dominate as the policy paradigm for these robots. The inference latency of VLA models directly affects robot responsiveness and motion smoothness. However, existing VLA inference frameworks do not fully exploit the characteristics of embodied workloads or account for the distinct bottlenecks across different stages of VLA inference. In this paper, we first characterize embodied workloads and identify substantial task similarity across repeated robot executions. We further find that such similarity extends beyond observations and action trajectories to internal model states. Drawing on these observations, we present rMuscle, a real-time VLA inference framework inspired by human muscle memory. It exploits cross-execution similarity through a dual-phase muscle-memory cache. The Context Cache reuses visual-token outputs to reduce computation, while the Action Cache reuses neuron activation patterns to reduce weight accesses. We keep both the cache memory footprint and access overhead low through online cache recomputation, sliding-window cache retrieval, and mask sharing across consecutive denoising steps. rMuscle achieves 1.29-1.42X speedup on RTX 4090 and Jetson Thor across LIBERO, RoboTwin, and physical manipulation tasks, while maintaining the original success rates on real-world robots.

arXiv ID: 2609.19104 / 要約の誤りについて