arXiv論文メモ
新着一覧
cs.RO · 査読状況未確認

人が実演しにくいロボット作業を動作制約で学習する

Learning Beyond What Humans Can Demonstrate

Yuchen Song, Aditya Mittal, Unnat Jain

この論文をやさしく読む

ひとことで言うと

人が遠隔操作でうまく実演できない作業に対し、失敗しやすい動きを制限する仕組みを作り、学習用データの収集を助けます。その制約は学習後のロボットにも使います。

何に役立つ?

接触のタイミングや物の安定性が難しい操作で、実演データが集まらない問題への対処が考えられます。研究では3課題でデータ収集と方策実行の成功率を別々に評価しています。

この研究の面白いところ

専門家が最初に書いた制約に固定せず、実際の動作軌跡から制約を改善しています。実演を上手にする支援と、学習した方策の動作を制限する支援を一つの枠組みにしています。

どこまで分かった?

70〜90%はデータ収集の成功率で、学習した方策の成功率は課題別に70%、60%、60%です。3課題の結果であり、ガードレールがすべての失敗や危険を防ぐという保証は要旨にありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

ロボット操作の行動模倣は、専門家の実演に依存する。しかし、動的な安定性、正確な接触タイミング、器用な協調を必要とする課題では、人間の操作者がデータを収集するのは困難で、場合によっては不可能である。我々はこの実演が実行困難な状況を研究し、GLIDE(Guardrails for Learning from Infeasible Demonstrations Efficiently)を提案する。これは、課題固有の失敗の仕方を推定し、データ収集と方策の実行に使える実行可能なガードレールへ変換する枠組みである。課題の説明と、制御条件を与える遠隔操作コードを受け取ると、GLIDEはシステム状態を使って遠隔操作および方策の指令を選別し、失敗しやすい動作を制限するガードレールを書き、軌跡からのフィードバックで反復的に改善する。3つの課題を通じ、GLIDEは分野の専門家が手作業で実装したものを超えるガードレールを見いだし、単純なVR遠隔操作や専門家が手作業で実装したガードレールに比べ、データ収集を改善した。改善後には、3課題のデータ収集成功率を0〜10%から70〜90%へ引き上げた。方策実行時には、混合データを用いたガード付き方策が、トマトの皿の移動、マーカーの受渡しと直立、ワインの提供の各課題で、それぞれ70%、60%、60%の成功率に達した。これらの結果は、直接の実演が実行困難な場合にも、GLIDEが方策学習を支援できることを示す。プロジェクトサイト:http://guardrail-policy.github.io/

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-21(UTC)
最新改訂
2026-09-21 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Behavior cloning for robot manipulation relies on expert demonstrations. However, for tasks that require dynamic stability, precise contact timing, or dexterous coordination, human operators may find it hard or even impossible to collect data. We study this infeasible-demonstration regime and propose GLIDE: Guardrails for Learning from Infeasible Demonstrations Efficiently, a framework that infers task-specific failure modes and converts them into executable guardrails for data collection and policy deployment. Given a task description and the conditioning teleoperation code, GLIDE writes guardrails that use system states to filter teleoperation and policy commands, constrain failure-prone actions, and iteratively improve from trajectory feedback. Across three tasks, GLIDE discovers emergent guardrails that go beyond domain-expert hardcoded ones, improving data collection over naive VR teleoperation and domain-expert hardcoded guardrails. After refinement, GLIDE raises data-collection success from 0-10 percent to 70-90 percent across the three tasks. During policy execution, mixed-data guarded policies reach 70 percent, 60 percent, and 60 percent success on Tomato plate transfer, Marker handover and stand, and Wine serving tasks. These results show that GLIDE can support policy learning when direct demonstrations are infeasible. Project website: http://guardrail-policy.github.io/

著者のコメント

Accepted to CoRL 2026. Project website: http://guardrail-policy.github.io/

arXiv ID: 2609.24996 / 要約の誤りについて