進捗と失敗の評価で汎用ロボット方策を小型の専門方策へ学習する
FIERCE: From Generalist Robot Policies to Fast Specialists via Progress-Failure Feedback
この論文をやさしく読む
ひとことで言うと
汎用ロボットモデルから出発し、作業の進み具合と失敗の見込みを評価して、小型の専用モデルを追加学習する方法です。
何に役立つ?
考えられる用途は、大きな汎用モデルを常時呼び出さずに、特定の実作業を小さな方策で実行することです。学習時と運用時の役割を分けています。
この研究の面白いところ
進捗と失敗を同じ評価器で扱いつつ、終了時の報酬は独立に確認し、新しい経験に応じて評価器と方策を交互に更新します。
どこまで分かった?
要旨ではシミュレーションと2つの実機タスクでの評価構成を説明していますが、成功率や高速化率の具体的数値は示していません。進捗・選好ラベルなどの教師情報は必要であり、完全に注釈不要という方法ではありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
汎用ロボット方策は有用な初期状態を提供するが、限られた実機での相互作用によって小型の専門方策を改良するには、学習に有益なフィードバックが必要である。本研究では、統一されたタスク適応型の進捗・失敗評価器を中心とする、汎用方策で初期化した強化学習の枠組みFIERCEを示す。その構成では、観測された進捗を出力するヘッドと、行動を条件とする潜在状態予測器とが、観測と言語の表現を共有する。予測器の過去および現在の予測を因果的な系列処理ヘッドに与え、タスクの失敗を推定する。 評価器は、進捗・選好ラベル、同期した指令と観測、終了時の結果を組み合わせた教師信号で学習する。対象タスクの試行軌跡によって適応と較正を行う。固定した評価器のスナップショットは、独立に確認した終端報酬に加えて、進捗に基づく報酬整形と失敗リスクへの罰則を提供する。新たな経験を集めながら評価器と方策の更新を交互に行う。 この改良には、汎用方策への継続的な行動問い合わせ、対象タスク専用のシミュレーター、手作業で注釈を付けた密な報酬のいずれも必要ない。運用時には小型の専門方策だけを残す。評価では、シミュレーションと接触の多い2つの実機タスクを対象に、フィードバックの質、方策学習の効率、運用コストを分けて調べる。コード、モデルの重み、データ復元ツールはhttps://github.com/ar-mine/FIERCEで公開する。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-16(UTC)
- 最新改訂
- 2026-09-16 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-16 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Generalist robot policies offer useful initialization, but refining compact specialists through limited physical interaction requires informative learning feedback. We present FIERCE, a generalist-initialized reinforcement learning framework centered on a unified, task-adaptive progress-failure evaluator. Its architecture shares an observation-language representation between an observed-progress head and an action-conditioned latent predictor whose past and current predictions feed a causal sequence head for task-failure estimation. Joint supervision from progress and preference labels, synchronized commands and observations, and terminal outcomes trains the evaluator; target-task rollouts support adaptation and calibration. Fixed evaluator snapshots provide progress shaping and failure-risk penalties alongside independently verified terminal rewards, while evaluator and policy updates alternate as new experience is collected. Refinement requires neither continued generalist action queries nor a dedicated target-task simulator or manually annotated dense rewards. Only the compact specialist is retained at deployment. The evaluation separates feedback quality, policy-learning efficiency, and deployment cost across simulation and two contact-rich real tasks. Code, model weights, and data-restoration tools are released at https://github.com/ar-mine/FIERCE.
著者のコメント
8 pages, 5 figures
arXiv ID: 2609.18651 / 要約の誤りについて