人の動作100時間から学ぶ人型ロボットの障害物通過
PASSAGE: Scaling Scene-Aligned Motion Learning for Perceptive Humanoid Traversal in Cluttered Environments
この論文をやさしく読む
ひとことで言うと
人の動作を大量に学び、ロボット自身のLiDARで見た障害物に応じて、またぐ・すり抜ける・かがむ動きを選ぶ人型ロボットの仕組みです。
何に役立つ?
事前地図のない障害物の多い場所で、機体内の計算だけで移動する用途が考えられます。未知の実環境配置50種類での試験も行っています。
この研究の面白いところ
1,500シーン・100時間の人の動作を使い、特定のスキルのラベルを付けずに行動を組み合わせます。動作計画は6.25 Hz、追従制御は50 Hzで機体上に統合されています。
どこまで分かった?
48.1%、68.9%、70.3%はシミュレーションの未学習シーンでの非接触成功率です。実環境50配置での試験について、要旨には成功率の具体値が示されていません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
人型ロボットは障害物をまたぎ、狭い隙間を通り、かがんで下をくぐれる。しかし、搭載センサーによる知覚から、これらの行動を選んで協調させることを学ぶのは依然として難しい。既存の多くの手法は、タスク固有の強化学習目標や、選別した動作ライブラリーに依存しており、幅広い行動を扱うには高いコストがかかる。本研究では、人型ロボットが環境を通過するための、知覚に条件づけられた計画器と追従器の枠組みPASSAGEを提示する。仮想現実と慣性式モーションキャプチャーを用い、1,500の障害物が多いシーンにわたる、シーンと対応づけた人の動作100時間を収集する。条件付きフローマッチングの計画器が、動作履歴、局所的な目的地、ロボット中心の多層高さ地図から短期の参照動作を生成する。 知覚を利用する全身追従器は、幾何学的フィードバックを用いて、それを50 Hzで実行する。リアルタイムのチャンク化はチャンク間の一貫性を高め、追従器を固定した状態で行う計画器側の強化学習による追加学習が、閉ループ性能をさらに改善する。スキルのラベルや障害物別の方策なしで、1組の計画器と追従器が、未知の形状に応じて通過動作を選び組み合わせる。シミュレーションでは、構成要素のアブレーションにより各段階の寄与を定量化する。3つの独立した学習シードにわたり、収集データを6時間から100時間へ増やすと、未学習シーンでの平均非接触成功率は48.1%から68.9%に上がり、検証済みのシーン拡張を含む最終モデルでは70.3%に達する。 すべてを機体上で処理するシステムは、自己視点の3D LiDAR知覚、オンライン占有地図作成、6.25 Hzの計画、50 Hzの制御をJetson AGX Orin上に統合する。未知の実環境配置50種類での試験により、事前作成地図や機体外の計算なしで通過できることを実証する。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-16(UTC)
- 最新改訂
- 2026-09-16 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-16 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Humanoid robots can step over, squeeze past, and duck under obstacles, but learning to select and coordinate these behaviors from onboard perception remains challenging. Many existing approaches rely on task-specific reinforcement-learning objectives or curated motion libraries, making broad behavioral coverage costly. We present PASSAGE, a perception-conditioned planner--tracker framework for humanoid traversal. Using virtual reality and inertial motion capture, we collect 100 h of scene-aligned human motion across 1,500 cluttered scenes. A conditional flow-matching planner generates short-horizon references from motion history, a local destination, and a robot-centric multi-layer elevation map, while a perceptive whole-body tracker executes them at 50 Hz with geometric feedback. Real-time chunking promotes inter-chunk consistency, and planner-side RL post-training under the frozen tracker further improves closed-loop performance. Without skill annotations or obstacle-specific policies, one planner--tracker pair selects and composes traversal behaviors across unseen geometries. In simulation, component ablations quantify the contribution of each stage. Across three independent training seeds, scaling captured data from 6 to 100 h increases mean contact-free success from 48.1% to 68.9% on held-out scenes, while the final model with validated scene augmentation reaches 70.3%. The fully onboard system integrates egocentric 3D LiDAR perception, online occupancy mapping, 6.25 Hz planning, and 50 Hz control on a Jetson AGX Orin; tests across 50 unseen physical layouts demonstrate traversal without prebuilt maps or offboard computation.
arXiv ID: 2609.18732 / 要約の誤りについて