arXiv論文メモ
新着一覧
cs.CV · 査読状況未確認

画像内の対象を言葉で指定する分割を少数の更新パラメータで改善

0.5%>100%: Bidirectional Reciprocal Learning for Referring Image Segmentation

Xiaoqiang Lu, Licheng Jiao, Lingling Li, Yuting Yang, Long Sun, Wenping Ma, Xu Liu, Fang Liu

この論文をやさしく読む

ひとことで言うと

言葉で指定した画像の部分を切り出す課題に、視覚と言語の双方向の情報交換を組み込む方法。

何に役立つ?

考えられる用途は、参照画像分割モデルを少ない更新パラメータで適応させること。要旨では3つのベンチマークでの性能を報告している。

この研究の面白いところ

トークン単位の相互注意とチャネル単位の相互ゲートを組み合わせ、視覚から言語へのフィードバックも使う点。

どこまで分かった?

要旨で示される評価はRefCOCO系列の3ベンチマークであり、更新対象は基盤モデルの0.5%未満。具体的な精度値や他の環境での結果は要旨に記載されていない。

v2のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

視覚基盤モデルはさまざまな単一の視覚課題で高い能力を示している。しかし、言葉で指定された画像領域を分割する参照画像分割に適応するには、通常、視覚と言語を正確に対応付けるための全体的な追加学習が必要であり、計算負荷が大きく、破滅的忘却の恐れもある。既存のパラメータ効率の高い追加学習法は、少ない学習費用で知識を移せるものの、主に個々のモダリティを別々に扱うか、言語から視覚への一方向の誘導に限られ、段階的な相互作用や、視覚情報を使ったテキスト表現の改善を見落としている。 そこで著者らは、凍結した基盤モデルのトークン混合層とチャネル混合層の両方で、階層的かつ双方向に情報を流す、アダプター型のパラメータ効率の高い学習手法BRLを提案する。相互注意アダプターRAAはトークン単位でモダリティ間のクエリとキーを交換し、視覚と言語のトークンが互いを参照して細かな位置を特定できるようにする。相互ゲートアダプターRGAはチャネル単位でモダリティ間のゲート信号を作り、一方の全体的な意味情報で他方のチャネルの活性を適応的に調整する。RefCOCO、RefCOCO+、RefCOCOgでの実験では、基盤モデルのパラメータの更新を0.5%未満に抑えながら、従来の参照画像分割法を上回り、最先端の性能を達成した。コードとモデルは指定のGitHubリポジトリで公開予定である。

v2の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-21(UTC)
最新改訂
2026-09-22 · v2
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Recent advances in vision foundation models (VFMs) have shown remarkable capabilities across diverse unimodal visual tasks. However, adapting VFMs to referring image segmentation (RIS) typically necessitates precise vision-language alignment via full fine-tuning, incurring substantial computational overhead and risking catastrophic forgetting. While existing parameter-efficient fine-tuning (PEFT) methods enable safe knowledge transfer with minimal training costs, they predominantly operate independently within individual modalities or focus exclusively on unidirectional guidance from language to vision, overlooking progressive cross-modal interaction and visual feedback for textual refinement. To address these limitations, we propose $\textbf{B}$idirectional $\textbf{R}$eciprocal $\textbf{L}$earning ($\textbf{BRL}$), a novel adapter-based PEFT framework that facilitates hierarchical, bidirectional information flow within both token-mixing and channel-mixing layers of frozen foundation models. Specifically, BRL introduces two complementary lightweight modules. The Reciprocal Attention Adapter (RAA) performs cross-modal query-key exchanges at the token level, enabling visual and linguistic tokens to mutually attend to each other for fine-grained spatial grounding. The Reciprocal Gate Adapter (RGA) generates cross-modal gating signals at the channel level, allowing global semantic context from one modality to adaptively recalibrate channel activations of the other. Extensive experiments on RefCOCO, RefCOCO+, and RefCOCOg benchmarks demonstrate the superiority of BRL over prior RIS methods, achieving state-of-the-art performance while requiring less than 0.5% backbone parameter updates. Code and models will be released at https://github.com/xiaoqiang-lu/BRL.

著者のコメント

16 pages, 8 figures

arXiv ID: 2609.24510 / 要約の誤りについて