arXiv論文メモ
新着一覧
cs.CV · 査読状況未確認

画像内の対象の位置と領域を分けて学び、情報を組み合わせる

DeCo: Efficient Decouple-to-Couple Learning for Multi-Task Visual Grounding

Xiaoqiang Lu, Licheng Jiao, Long Sun, Yuting Yang, Xu Liu, Lingling Li, Wenping Ma, Fang Liu

この論文をやさしく読む

ひとことで言うと

言葉で指定した対象を画像の中で見つけ、その形の領域も切り出す方法です。位置特定と領域分割で必要な特徴をいったん分け、有用な情報を後から組み合わせます。

何に役立つ?

自然画像やリモートセンシング画像を、文章の指示で検索・解析する用途が考えられます。エンコーダーを凍結し、追加の学習可能パラメータを少なくする構成です。

この研究の面白いところ

課題間で何でも共有するのではなく、特徴の干渉を減らした上で、領域マスクが持つ位置情報を再利用します。分離と協調を二段階で行う点が特徴です。

どこまで分かった?

複数ベンチマークで最先端の性能を報告していますが、要旨にはスコア、パラメータ数、実行速度の具体値がありません。汎化に関する判断は提示された評価対象の範囲に基づきます。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

複数課題の視覚的グラウンディングでは、モデルが言語の意味を理解すると同時に、画像内の正確な位置特定と領域分割を行う必要がある。マルチモーダル大規模言語モデルが成果を上げているにもかかわらず、それらを複数のグラウンディング目標へ効果的に適応させることは依然として難しい。既存手法は一般に共有表現によって課題間の協調を促す一方、各課題が重視する特徴の間にある本質的な衝突を見落としている。 本論文では、この問題を、課題固有の表現を分離した後に相補的な事前情報を結合する二段階の方法で解消する、効率的な分離・結合学習枠組みDeCoを導入する。具体的には、まず課題を考慮した意味分離(TSD)を提案する。これは重要な単語レベルの情報を手掛かりに、共有された視覚的手掛かりを個別の特徴へ振り分け、位置特定と領域分割の間の表現の干渉を軽減する。さらに、領域分割は密な教師情報によって、有益な位置特定の事前情報を自然に与えることを見いだす。この知見に基づき、文レベルの意味的な事前情報と、マスクから得た空間的な事前情報を統合してグラウンディングを改善する、ハイブリッド事前情報結合(HPC)を導入する。 DeCoは凍結したマルチモーダルエンコーダー上に構築され、少量の学習可能パラメータで、複数のグラウンディング目標にわたる高い汎化性能を達成する。RefCOCO/+、G-Ref、ReferIt、Flickr、DIOR-RSVG、SARVG1.0、RRSIS-D、RIS-LAD、RefDIORでの広範な実験により、自然画像とリモートセンシングの両ベンチマークで最先端の性能を達成することを示す。コードとモデルはhttps://github.com/xiaoqiang-lu/DeCoで公開されている。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-21(UTC)
最新改訂
2026-09-21 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Multi-task visual grounding requires models to jointly understand linguistic semantics and perform accurate visual localization and segmentation. Despite the success of multimodal large language models, effectively adapting them to multiple grounding objectives remains challenging. Existing methods commonly enforce task cooperation through shared representations, while overlooking the intrinsic conflict between task-oriented feature interests. In this paper, we introduce $\textbf{DeCo}$, an efficient $\textbf{De}$couple-to-$\textbf{Co}$uple learning framework that resolves this dilemma through a two-stage paradigm: task-specific representation decoupling followed by complementary prior coupling. Specifically, we first propose Task-aware Semantic Decoupling (TSD) to route shared visual cues into individual features under salient word-level guidance, alleviating representation interference between localization and segmentation. Furthermore, we observe that segmentation naturally provides informative localization priors due to dense supervision. Based on this insight, we introduce Hybrid Prior Coupling (HPC), which integrates sentence-level semantic prior with mask-derived spatial prior for enhanced grounding. Built upon a frozen multimodal encoder, DeCo requires lightweight trainable parameters while achieving strong generalization across multiple grounding objectives. Extensive experiments on RefCOCO/+, G-Ref, ReferIt, Flickr, DIOR-RSVG, SARVG1.0, RRSIS-D, RIS-LAD, and RefDIOR demonstrate that DeCo achieves state-of-the-art performance on both natural and remote sensing benchmarks. The code and models are available at https://github.com/xiaoqiang-lu/DeCo.

著者のコメント

34 pages,9 figures

arXiv ID: 2609.24409 / 要約の誤りについて