arXiv論文メモ
新着一覧
cs.RO · 査読状況未確認

ロボットと物体の3次元骨格から操作を学ぶ

SkeleWAM: Skeleton World-Action Modeling for Efficient Robotic Manipulation

Juyi Sheng, Hua Wang, Mengyuan Liu

この論文をやさしく読む

ひとことで言うと

映像全体を予測する代わりに、ロボットや物体の重要な点を3次元で表し、操作を学ぶ方法です。

何に役立つ?

考えられる用途は、見た目の細部より位置関係が重要なロボット操作です。要旨ではLIBERO-Plusでの成功率とモデル規模が報告されています。

この研究の面白いところ

将来の骨格を予測する学習は行いますが、実行時の行動は現在の骨格と言語指示から直接生成します。視覚再構成を省きながら幾何学的な監督信号を使います。

どこまで分かった?

示された定量結果はLIBERO-Plus上の評価です。実機全般での頑健性や骨格抽出の誤差への耐性の詳細は要旨に記載されていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

世界行動モデル(WAM)は、ロボットの行動生成と将来状態の予測を組み合わせる。既存のWAMは通常、動画や学習した視覚潜在表現を予測するが、これらは相互作用の幾何学を暗黙的にしか表さず、制御と無関係な外観情報を保持することもある。本研究では、操作場面を、ロボットの関節、物体の中心、相互作用点からなる疎な3次元骨格で表す、小型のWAMであるSkeleWAMを導入する。 現在のRGB-D観測とロボットの自己状態の感覚からオンラインで構成するこの骨格は、行動生成と将来の骨格予測のための統一的な幾何状態を与える。将来の骨格予測は、視覚的な再構成を必要とせず、行動学習に追加の幾何学的な教師信号を与える。推論時には、SkeleWAMは現在の骨格と言語指示から直接行動を生成する。Medoid Action Consensus(MAC)は、確率的に生成した行動サンプルに対する補助的な合意戦略として働く。 LIBERO-Plusでは、SkeleWAMは5,710万パラメータで全体成功率85.9%を達成し、Cosmos-Policyを3.7ポイント上回る。この結果は、疎な3次元のロボット・物体構造が、頑健でパラメータ効率の良い世界行動学習に有効な状態空間を与えることを示す。プロジェクトは https://skelewam-project.github.io/ で公開している。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-10-01(UTC)
最新改訂
2026-10-01 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

World action models (WAMs) combine robot action generation with future state prediction. Existing WAMs typically predict videos or learned visual latents, which represent interaction geometry only implicitly and may retain appearance information unrelated to control. We introduce SkeleWAM, a compact WAM that represents a manipulation scene as a sparse 3D skeleton composed of robot joints, object centers, and interaction points. Constructed online from current RGB-D observations and robot proprioception, the skeleton provides a unified geometric state for action generation and future skeleton prediction. Future skeleton prediction provides additional geometric supervision for action learning without requiring visual reconstruction. At inference, SkeleWAM generates actions directly from the current skeleton and language instruction, while Medoid Action Consensus (MAC) serves as an auxiliary consensus strategy for stochastic action samples. On LIBERO-Plus, SkeleWAM achieves an overall success rate of 85.9% with 57.1M parameters, outperforming Cosmos-Policy by 3.7 percentage points. These results demonstrate that sparse 3D robot--object structure provides an effective state space for robust and parameter-efficient world action learning. The project is available at https://skelewam-project.github.io/.

arXiv ID: 2610.02120 / 要約の誤りについて