arXiv論文メモ
新着一覧
cs.RO · 査読状況未確認

接触作業に合わせてロボットの動きと柔らかさを予測

CompVLA: A Variable Compliance Vision-Language-Action Model for Contact-rich Manipulation

Jongmin Kim, Junsu Ha, Che-Sang Park, Minchang Song, Hyeokju Jeong, Himchan Hwang, Jianlong Fu, Frank C. Park

この論文をやさしく読む

ひとことで言うと

ロボットにどこへ動くかだけでなく、物に触れたときにどれくらい力に譲るかも予測させるモデルです。画像と言葉から動作と剛性を一緒に決めます。

何に役立つ?

接触しながら行う操作で、動きと力への応じ方を調整するための方法です。要旨では複数の接触タスクで既存VLAとの成功率比較を報告しています。

この研究の面白いところ

柔らかさを担当する専用の構成要素をVLAに追加し、時々刻々変わる剛性と仮想変位を制御につなげます。言語・画像からの行動予測と物理的な接触制御を結んでいます。

どこまで分かった?

比較対象中で最高の平均成功率としていますが、具体的な成功率、試行数、タスクの内訳は要旨にありません。あらゆる接触作業での性能や安全性が確認されたとは読み取れません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

接触を多く伴う操作では、ロボットは動きだけでなく、外力に対してどのように柔らかく応じるかも調整する必要があり、視覚・言語・行動(VLA)モデルの次の主要な課題となっている。しかし既存のVLAは運動学的な指令だけを出力するため、現実の接触を多く伴うタスクで性能が低下する。本論文では、RGB画像と言語入力から、動きと剛性行列を同時に予測する統一的なVLAの枠組みCompVLAを導入する。従来のアーキテクチャに専用のCompliance Expertを加え、時間変化する剛性と仮想変位のプロファイルを出力し、それを幾何学的インピーダンス制御によって実行する。CompVLAは多様な接触タスクにおいて、通常のVLAとコンプライアンスを考慮したVLAの両方の比較手法を上回り、最も高い平均成功率を達成することを示す。また、構成要素を取り除く検証により、それぞれの要素が不可欠であることを確認する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-20(UTC)
最新改訂
2026-09-20 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Contact-rich manipulation, requiring robots to regulate not only motion but also how they yield to external forces, has emerged as the next frontier for Vision-Language-Action (VLA) models. However, existing VLAs output purely kinematic commands, degrading performance on real-world contact-rich tasks. In this paper, we introduce CompVLA, a unified VLA framework that jointly predicts motion and stiffness matrix from RGB and language inputs. Our approach augments the conventional architecture with a dedicated Compliance Expert, which outputs time-varying stiffness and virtual displacement profiles executed via geometric impedance control. We demonstrate that CompVLA achieves the highest average success rate across diverse contact-rich tasks, outperforming both vanilla and compliance-aware VLA baselines, with ablations confirming each component is essential.

著者のコメント

Conference on Robot Learning (CoRL) 2026

arXiv ID: 2609.23614 / 要約の誤りについて