触覚でつかむ動作を修正しロボットの把持を安定化
GraspTune: Tactile-Driven Execution Refinement for Robust Grasping
この論文をやさしく読む
ひとことで言うと
画像で決めたつかみ方を、実際に触った感覚で小さく修正し、落とさずにつかみやすくする方法です。
何に役立つ?
既存の把持候補生成器に実行時の補正を組み合わせる用途があります。実機でも追加学習なしで成功率の改善が報告されています。
この研究の面白いところ
候補を作り直すのではなく、接近から把持完了までの接触状態を学び、動作の残差として補正します。四つの生成器で比較している点も特徴です。
どこまで分かった?
6万回超はシミュレーション、1,000回超は特定構成の実機試行です。実機でのGraspNet成功率は84.3%であり、あらゆる物体や操作で成功を保証する結果ではありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
画像から把持候補を生成する技術は急速に進歩しているが、選んだ候補を物理的に安定した把持へ変えることは、依然として実行段階の中心的課題である。本論文では、触覚を使って実行段階を改善する枠組みGraspTuneを導入する。基準となる把持候補を出発点として、接近、接触形成、最終的な把持実行の各段階で、ツール中心点(TCP)に範囲を制限した残差運動を加える。GraspTuneは、状態に条件付けたエキスパートへの接触照会と、接触変化・接触リスク・把持を閉じた後の準備状態に関するマルチタスク教師信号を用い、局所的な深度情報、触覚信号、状態、履歴から制御に適した接触の意味表現を学習する。この表現を、拡散モデルで事前学習した残差方策の条件として与え、PPOによって閉ループ実行に整合させる。 20種類の物体カテゴリにわたる6万回を超えるシミュレーション実行で、四つの把持候補生成器に対する実行段階の効果を確認した。安定把持の成功率は、GraspNet、Contact-GraspNet、AnyGrasp、VGNで、それぞれ19.22、9.55、12.45、20.70パーセントポイント向上した。カテゴリを留保する4分割の評価では、未見物体での実行成功率が54.58%から70.33%へ上がり、カテゴリが重複しない条件でも接触修正が汎化することを示した。Xense指先センサーを備えたUR5eによる1,000回を超える実機試行では、GraspNetの実行成功率が71.0%から84.3%へ向上し、実世界で方策を追加学習せず直接転移できることを検証した。これらの結果は、視覚的にもっともらしい把持候補を、その後の接触を多く伴う操作に使える安定した物理的把持へ変える。補足動画はhttps://youtu.be/kcq7fSLNtzUで公開されている。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-21(UTC)
- 最新改訂
- 2026-09-21 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-21 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Visual grasp proposal generation has advanced rapidly, yet converting a selected proposal into a stable physical grasp remains a central execution-stage challenge. This paper introduces GraspTune, a tactile-driven execution-stage refinement framework that starts from a nominal proposal and applies bounded residual TCP motions during approach, contact formation, and final grasp execution. GraspTune learns control-facing contact semantics from local depth, tactile signals, state, and history using state-conditioned expert contact queries and multi-task supervision for contact change, contact risk, and post-close readiness. The representation conditions a diffusion-pretrained residual policy and is aligned with PPO for closed-loop execution. Across more than 60,000 simulated executions over 20 object categories, GraspTune establishes an execution-layer benefit across four proposal generators, raising stable grasp success by +19.22, +9.55, +12.45, and +20.70 percentage points for GraspNet, Contact-GraspNet, AnyGrasp, and VGN. A four-fold held-out category study raises unseen-object execution from 54.58% to 70.33%, showing category-disjoint generalization of contact correction. Across more than 1,000 real-robot trials on a UR5e setup with Xense fingertip sensors, GraspTune raises GraspNet execution from 71.0% to 84.3%, validating direct transfer without realworld policy fine-tuning. Together, these results turn visually plausible proposals into stable physical grasps for downstream contact-rich manipulation. A supplementary video is available at https://youtu.be/kcq7fSLNtzU.
arXiv ID: 2609.24180 / 要約の誤りについて