arXiv論文メモ
新着一覧
cs.RO · 査読状況未確認

言葉と指差しの曖昧さを考慮してロボットの操作対象を決める

MIGU: Multimodal Instruction Grounding under Uncertainty for Manipulation Planning

Mingke Lu, Anxing Xiao, David Hsu

この論文をやさしく読む

ひとことで言うと

「あれを取って」と指を差したとき、言葉と指の方向の両方から対象を推定するロボットの仕組みです。指差しや奥行きの誤差も扱い、必要なら確認を求めます。

何に役立つ?

人の自然な指示から物体操作へつなぐ用途が考えられます。対象を誤って断定する前に確認を求める判断を、操作計画に組み込める設計です。

この研究の面白いところ

視覚言語モデルの意味的な候補と、目・指・対象の位置関係から得る幾何学的な候補を統合しています。言葉か身振りのどちらかを一律に優先するのではなく、それぞれの不確かさを使います。

どこまで分かった?

実世界のベンチマークで評価対象の全ベースラインを上回ったと報告していますが、成功率や試行数は要旨にありません。確認行動の頻度や、未評価の環境への一般化も要旨からは判断できません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

人を中心とした環境でロボットを運用するには、人間の自然な指示を理解することが重要である。我々は、言語と身振りが相補的でありながら不確かな手掛かりを与える、マルチモーダルな指示のグラウンディングを研究する。意味的な証拠と幾何学的な証拠を統一された対象推定の確信分布へ組み合わせ、操作計画へつなぐモジュール式の枠組みMIGUを提示する。MIGUは、手の方向推定の誤差を考慮しながら、見る方向と奥行きの不確実性を目と指の幾何学的関係に沿って伝播させることで、3次元の幾何学的尤度を構築する。視覚言語モデル(VLM)は候補物体および領域について意味的な事前分布を与え、これをベイズ的な発想に基づく融合によって幾何学的尤度と組み合わせる。得られた確信分布は、そのまま後段の計画へ進むか、明確化を求めるかという行動計画を支援する。特定された対象は、移動を伴う物体操作と、卓上でのタスク・動作計画の目標を定める。実世界のベンチマークで、MIGUは評価したすべてのベースラインを上回り、構成要素を除いた比較実験は、マルチモーダルな不確実性を明示的にモデル化する利点を支持した。プロジェクトサイト:multimodal-instruction.github.io

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-21(UTC)
最新改訂
2026-09-21 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Understanding natural human instructions is crucial for deploying robots in human-centric environments. We study multimodal instruction grounding, where language and gesture provide complementary but uncertain cues. We present MIGU, a modular framework that combines semantic and geometric evidence into a unified grounding belief and connects it to manipulation planning. MIGU constructs a 3D geometric likelihood by propagating viewing-direction and depth uncertainty through eye-finger geometry while accounting for hand-direction estimation error. A vision-language model (VLM) provides semantic priors over candidate objects and regions, which are combined with the geometric likelihood through Bayes-inspired fusion. The resulting belief supports behavior planning to either proceed directly to downstream planning or request clarification. Grounded targets then define goals for mobile manipulation and tabletop task-and-motion planning. On a real-world benchmark, MIGU outperforms all evaluated baselines, while ablations support the benefit of explicit multimodal uncertainty modeling. Project website: multimodal-instruction.github.io

arXiv ID: 2609.24995 / 要約の誤りについて