カメラの幾何情報と複数視点でロボットの報酬評価を改善
AnyviewMeter: Adapting Robotic Reward Models with Camera Geometry and Multi-View Attention
この論文をやさしく読む
ひとことで言うと
ロボットの作業進捗を画像から点数化するとき、カメラの位置や複数視点の情報を取り入れて判定を安定させます。
何に役立つ?
視点や遮蔽物が変わっても同じ作業状態を同様に評価する、課題専用の報酬モデル調整に役立ちます。
この研究の面白いところ
カメラ光線の幾何情報と同期した視点の注意を、既存モデルの小規模な追加学習へ組み込みます。複数視点の点数を単純平均するより、内部で一緒に見る方法を評価しています。
どこまで分かった?
41〜69%の進捗誤差減はシミュレーション、約21%減は視野変更や実課題でのそれぞれ別の比較です。報酬予測の改善がそのままロボットの作業成功率の改善を意味するわけではありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
ロボットの報酬モデルは視覚観測からタスクの実行を評価するが、基礎となるタスクの状態が変わらなくても、カメラの視点や遮蔽によって予測が変わりうる。そのため、事前学習済みの報酬モデルを個別のタスクに適応させるには、そのタスクがどのように観測されるかを考慮する必要がある。 本研究では、タスクの進捗をスカラーの報酬信号として表すロボット報酬モデルのために、幾何情報を条件とする適応の枠組みAnyviewMeterを提案する。低ランクのファインチューニングに、トークンと対応づけたPlücker光線と同期ブロック注意を組み合わせる。光線による条件づけはカメラの幾何情報を視覚特徴および注意機構のクエリとキーに取り込み、ブロック注意は事前学習済みデコーダ内部で同期した複数視点を統合する。事前学習済みRobometerをパラメータ効率よく適応させることで、単一視点の報酬予測と複数視点を共同利用する評価の両方を可能にする。 PickCubeでは、単一視点での適応により全カメラ群で進捗予測が改善し、画角を変更した条件での平均絶対誤差はRGBだけによるファインチューニングより約21%減少した。シミュレーションによる物体操作タスクでは、複数視点の共同予測は単一視点のRGB予測の平均と比べて進捗誤差を41~69%減らし、タスクとカメラの組み合わせの約88%で時間的な順序づけを改善した。固定カメラと手首搭載カメラを用いる実タスクでは、平均絶対誤差はRGBによるファインチューニング結果の平均と比べて約21%減少した。これらの結果は、カメラの幾何情報と複数の視覚的証拠の共同利用が、タスク固有のロボット報酬モデルの適応に有用であることを支持する。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-17(UTC)
- 最新改訂
- 2026-09-17 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-17 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Robotic reward models evaluate task execution from visual observations, but their predictions can change with camera viewpoint and occlusion even when the underlying task state is unchanged. Adapting a pretrained reward model to a local task therefore requires accounting for how that task is observed. We introduce AnyviewMeter, a geometry-conditioned adaptation framework for robotic reward models that represent task progress as a scalar reward signal. It combines low-rank fine-tuning with token-aligned Plucker rays and synchronous block attention: ray conditioning incorporates camera geometry into visual features and attention queries and keys, while block attention fuses synchronized views inside the pretrained decoder. The framework supports both single-view reward prediction and joint multi-view evaluation through parameter-efficient adaptation of a pretrained Robometer model. On PickCube, single-view adaptation improves progress prediction in every camera group and reduces mean absolute error under a changed field of view by approximately 21% relative to RGB fine-tuning. Across simulated manipulation tasks, joint multi-view prediction reduces progress error by 41-69% compared with averaging single-view RGB predictions and improves temporal ordering in approximately 88% of task-camera groups. On real tasks with fixed and wrist-mounted cameras, mean absolute error decreases by approximately 21% relative to averaged RGB fine-tuning. These results support camera geometry and joint visual evidence as useful components of task-specific robotic reward adaptation.
著者のコメント
8 pages, 3 figures, 5 tables
arXiv ID: 2609.20106 / 要約の誤りについて