arXiv論文メモ
新着一覧
cs.RO · 査読状況未確認

深度観測から作る3D形状をロボットの強化学習に組み込む

WeaveRL: Weaving Reconstruction into Scene-Aware Fabrics for Perceptive Reinforcement Learning

Remo Steiner, Vikram Ramasamy, David Tingdahl, Sam Mady, Karl Van Wyk, Nathan Ratliff, David Recasens Lafuente, Soha Pouya, Tuur Stuyck, Alex Millane

この論文をやさしく読む

ひとことで言うと

周囲を小さな表面要素の集まりとしてその場で再構成し、その形状情報を衝突回避とロボットの強化学習に使う方法です。

何に役立つ?

あらかじめ単純な形状で定義しにくい障害物がある操作環境で、センサー観測に基づく制御を学習する用途があります。

この研究の面白いところ

オンラインの3D再構成を、数千のシミュレーションで並列に動かす学習へ組み込んでいます。知覚と大規模学習を接続した点が特徴です。

どこまで分かった?

未見障害物での35%から61%への改善は、報告されたタスクでの衝突なし完了率です。実機への転移も報告されていますが、要旨はこの数値が実機のみの成績かを明示しておらず、一般的な安全保証ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

強化学習によりロボットは複雑な技能を獲得できるが、幾何学的に複雑な操作に対応する方策の生成は依然として難しい。有望な方法の一つは、geometric fabricsのような衝突回避制御器の上に学習を重ねることである。しかし、これらの方法は静的で人手指定の場面表現に依存してきた。能動的かつオンラインの3D知覚を大規模並列の強化学習に組み込むことは、これまで実現できていなかった。 本研究では、能動的なロールアウトの間、数千の並列シミュレーション環境で場面をサーフェルの集合として再構成する、GPU高速化手法を導入する。これにより方策は、人手で指定した形状ではなく、センサーから得た形状に基づいて動作できる。 衝突の起こりやすい一連の操作タスクにおいて、サーフェルを用いたfabricsにより、基本的な幾何形状に基づくベースラインが失敗する幾何学的に複雑な場面へ対応でき、シミュレーションから実機への転移も維持された。さらに、場面を認識するfabricとともに学習した方策は、試験時に新しい形状が導入された場合にも頑健であり、未見の障害物がある条件での衝突なしのタスク完了率が35%から61%に向上した。この方向の研究を促すため、再構成システム、学習コード、テストデータセットを公開する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-16(UTC)
最新改訂
2026-09-16 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Reinforcement learning allows robots to acquire complex skills, but producing policies for geometrically complex manipulation remains difficult. A promising approach is to learn on top of collision-avoidant controllers, such as geometric fabrics. However, these approaches have relied on static, hand-specified representations of the scene. Integrating active, online 3D perception into massively parallel RL training has so far been inaccessible. We introduce a GPU-accelerated method that reconstructs the scene as a collection of surfels across thousands of parallel simulation instances during active rollouts. This lets policies operate over sensor-derived, rather than hand-specified, geometry. On a suite of collision-dense manipulation tasks, our surfel fabrics enable policies to tackle geometrically complex scenes where primitive-based baselines fail, while maintaining sim-to-real transfer. Furthermore, policies learned with a scene-aware fabric are more robust to the introduction of novel geometry at test time, improving collision-free task completion under unseen obstacles from 35% to 61%. We release our reconstruction system, training code and test dataset to spur research in this direction.

arXiv ID: 2609.18685 / 要約の誤りについて