小さく目立たない物体を画像から探すための切り出し検索
MINER: Multi-crop INference-time Enhancement for Rare-Object Retrieval with Frozen Dual Encoders
この論文をやさしく読む
ひとことで言うと
文章で指定した小さな物体を画像から探すため、画像全体の表現に複数の切り出し領域の表現を加えた。
何に役立つ?
モデルを再学習せずに、小さな物体への言及を含む文章からの画像検索を改善したい場合の方法になる。
この研究の面白いところ
CLIPなど三つの基礎モデルで改善し、効果の中心は切り出しの精密さより画像の広い範囲を覆うことだった。
どこまで分かった?
要旨には具体的な検索指標の改善幅は示されておらず、評価はROCSと標準分割に基づく。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
学習済みの二重エンコーダを固定して使う文章から画像への検索は、質問が、物の多い場面にある小さく目立たない物体を指す場合に性能が低下する。画像全体を一つの埋め込みにすると、その場所に限られた視覚的証拠が十分に表されないためである。本研究は、学習不要で推論時に使う枠組みMINERを提示する。固定した二重エンコーダの画像全体の埋め込みに、少数の領域ごとの埋め込みを加え、類似度の再採点で一部の候補が過度に選ばれる傾向も補正する。これにより、全体をまとめる処理では軽視される局所的な証拠を取り戻す。この状況を評価するため、Flickr30KとMS COCOから物の多い画像を選び、目立たない物体を一つ名指す説明文を付け直したベンチマークROCSを導入する。CLIP、SigLIP、SigLIP 2での実験では、MINERはROCSと標準的なデータ分割の両方で、すべての基礎モデルの検索性能を改善した。分析から、改善の主因は切り出し位置の正確さではなく、より広い空間を覆うことだと分かった。これは固定された表現から局所的な証拠を取り戻す単純で汎用的な方法を示す。コードとデータセットは公開されている。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-22(UTC)
- 最新改訂
- 2026-09-22 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-22 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Text-to-image retrieval with frozen dual encoders degrades when the query names a small, visually subordinate object in a cluttered scene: a single global image embedding underrepresents the localized visual evidence. We present MINER, a training-free inference framework that augments a frozen dual encoder's global image embedding with a small bank of region-level embeddings and a hubness-correcting similarity rescoring, recovering visual evidence that global pooling underweights. To evaluate this setting, we introduce ROCS, a benchmark built from high-clutter subsets of Flickr30K and MS COCO whose images are re-captioned to name a single low-salience object. Experiments on CLIP, SigLIP, and SigLIP 2 show that MINER improves retrieval on every backbone, on ROCS and on the standard splits. Analyses show that these gains come primarily from broader spatial coverage rather than precise crop placement, revealing a simple and general way to recover localized evidence from frozen representations. Code: https://github.com/aalquwayfili/MINER. Dataset: https://huggingface.co/datasets/aalquwayfili/ROCS.
著者のコメント
Accepted at ACML 2026 (PMLR). 29 pages, 10 figures
arXiv ID: 2609.27142 / 要約の誤りについて