arXiv論文メモ
新着一覧
cs.CV / cs.RO · 査読状況未確認

筋電位や画像注釈でロボットへの作業指示を補う

Continuous Conditioning of VLAs with Augmenting EMG and Visual Task Descriptors

Edward W. Staley, Connor O. Pyles, Rahul Hingorani, Frank Camargo, Griffin Milsap, Jared Markowitz, Matthew S. Fifer, and Michael Wolmetz

この論文をやさしく読む

ひとことで言うと

ロボットに言葉で指示するだけでなく、腕などの筋電位や画像上の領域注釈も与えると、選ぶ物が紛らわしい場面で助けになるかを調べています。

何に役立つ?

物が多く並ぶ場面で、どの対象を選んでほしいかを伝える補助入力としての利用が考えられます。実際の評価は立方体選択タスクで行われています。

この研究の面白いところ

筋電位を機体状態の入力に加える方法と、画像に注釈を加える方法を別々に試しています。どちらも、学習分布から外れた混雑場面で改善が大きいと報告しています。

どこまで分かった?

参加者は3人で、タスクは立方体選択です。要旨には成功率などの具体的な数値はなく、広範な日常作業や多数の利用者での効果まで実証したとは言えません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

視覚・言語・行動(VLA)モデルは、入力がマルチモーダルであるにもかかわらず、タスク情報を記述する際に言語へ強く依存している。われわれは、状態空間の他のモダリティがタスクの補助的な条件付けの機会を与え、とりわけ物が入り組んだ場面や、その他の曖昧な場面で有用となる可能性があると仮定する。この仮説を検証するため、調整した2つのモデルを導入する。1つ目は、生体電気信号で条件付けるVLA(EC-VLA)で、8チャネルの筋電位包絡線を固有受容ベクトルに連結し、連続的な条件付け入力として取り込む。2つ目は、視覚注釈付きVLA(VA-VLA)で、画像入力に視覚的なセグメンテーション注釈を取り込む。 3人の参加者にわたって評価した立方体選択タスクでは、EC-VLAは、物が入り組んでいない分布内の条件で言語プロンプトによるベースラインに匹敵し、物が入り組んだ分布外の場面では大幅に上回る。同様にVA-VLAも、分布内の場面では言語プロンプトによるベースラインを小幅に改善し、物が入り組んだ分布外の試行では大幅に改善する。これらの結果は、言語以外によるタスクの条件付けが有益となる可能性を強く裏付ける。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-10-01(UTC)
最新改訂
2026-10-01 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Vision-Language-Action (VLA) models rely strongly on language for describing task information, despite having multimodal inputs. We hypothesize that other modalities in the state space may present opportunities for supplemental task conditioning, which may be particularly relevant in cluttered or otherwise ambiguous scenes. We introduce two tuned models to test this hypothesis: (1) an electrophysiology-conditioned VLA (EC-VLA) that incorporates 8-channel electromyography envelopes as continuous conditioning input concatenated to the proprioceptive vector, and (2) a visually-annotated VLA (VA-VLA) that incorporates visual segmentation annotations to the image inputs. On a cube-selection task evaluated across three participants, EC-VLA matches a language-prompted baseline in uncluttered, in-distribution conditions and substantially outperforms it in cluttered, out-of-distribution scenes. Similarly, VA-VLA shows modest improvements over a language-prompted baseline in in-distribution scenes with substantial improvement in cluttered, out-of-distribution trials. Together, these results provide strong evidence for the potential benefit of task-conditioning beyond language.

著者のコメント

Presented at IROS WORLDS Workshop 2026. Four main pages double-column format plus references and appendices

arXiv ID: 2610.01794 / 要約の誤りについて