苦手な部分だけ練習してロボットの長い作業を改善
From Pretraining to Proficiency: Real-World Subtask RL for Long-Horizon Manipulation with Minimal Human Intervention
この論文をやさしく読む
ひとことで言うと
ロボットが長い作業の一部でつまずくとき、その部分に追加の練習を集中させる方法です。できている動作は元の方策を使い、苦手な箇所だけ補正します。
何に役立つ?
考えられる用途は、事前学習済みロボットを新しい作業に適応させる際の追加学習です。二つのロボット課題で作業全体の成功率を改善し、実機での練習時間も報告しています。
この研究の面白いところ
作業全体が失敗しても、途中の部分作業の成功から学べる報酬を用意しています。固定した元の方策に残差補正を重ねることで、既存の技能を使いながら改善します。
どこまで分かった?
人の介入はゼロではなく、最初の難所の特定と必要時の物理リセットを行います。32%から61%などは報告された課題での結果で、既存手法比の25%超が相対差かポイント差かは要旨で明示されていません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
事前学習済みのロボット基盤方策は、長い手順の作業の大半を実行できても、少数の重要な部分作業で繰り返し失敗することがある。教師あり微調整(SFT)のために作業全体の追加実演を集めるには、操作者が、方策がすでに得意な動作まで繰り返す必要がある。強化学習(RL)による微調整は、この隔たりを埋める有望な方法だが、既存手法は疎な報酬だけで長い作業を解くことに苦戦している。 私たちはPARTS(Policy Adaptation with RL on Targeted Subtasks)を提案する。これは、学習用の実行を最小限の人の介入で進めながら、こうしたボトルネックに練習を集中させる、実世界の部分作業RLの枠組みである。固定した事前学習済み方策が実行全体を通して標準となる行動を供給し、エージェントが生成した選択器と成功検証器が残差補正を有効にして、局所的な結果報酬を与える。これらの報酬により、作業全体の成功がまれでも、成功した部分作業から学べる。学習はオンラインRLと、成功に重みを置いた再学習を組み合わせ、再学習した残差方策を再び投入して追加の経験を集める。人は初期設定時にボトルネックを特定し、必要に応じて物理的なリセットを行う。 両腕のYAMと単腕のFrankaの課題では、PARTSは作業全体の成功率をそれぞれ32%から61%、50%から95%へ高めた。使用した実世界RLの実行時間は、1課題当たり平均数十分だった。既存の実世界RL微調整手法と比較すると、同じロボット実行予算で、より少ない人の関与により、作業全体の成功率を25%超高める。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-18(UTC)
- 最新改訂
- 2026-09-18 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-18 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
A pretrained robot foundation policy may execute most of a long-horizon task yet repeatedly fail at a few critical subtasks. Collecting additional full-task demonstrations for supervised fine-tuning (SFT) requires operators to repeat behaviors the policy already performs well. Reinforcement learning (RL) fine-tuning offers a promising path to bridge this gap, but existing approaches struggle to solve long-horizon tasks using only sparse rewards. We present PARTS (Policy Adaptation with RL on Targeted Subtasks), a real-world subtask RL framework that concentrates practice at these bottlenecks while allowing training rollouts to proceed with minimal human intervention. The frozen pretrained policy supplies nominal actions throughout execution, while agent-generated selectors and success verifiers activate residual corrections and provide local outcome rewards. These rewards support learning from successful subtasks even when complete-task successes are scarce. Training combines online RL with success-reweighted retraining, and each retrained residual policy is redeployed to collect further experience. Humans identify bottlenecks during setup and perform physical resets when needed. On bimanual YAM and single-arm Franka tasks, PARTS improves complete-task success from 32% to 61% and from 50% to 95%, respectively, using tens of minutes of real-world RL rollouts per task on average. Compared with existing real-world RL fine-tuning methods, PARTS raises full-task success by more than 25% under the same robot-rollout budget while requiring less human involvement.
著者のコメント
Project page: https://destiny000621.github.io/PARTS/
arXiv ID: 2609.21788 / 要約の誤りについて