arXiv論文メモ
新着一覧
cs.AI / cs.CV · 査読状況未確認

画像・動画検索を対話的に絞り込むAiSearch

AiSearch: Interactive Multi-Modal Search with VLMs

Ali Koksal, Mei Chee Leong, Vicky Sintunata, Ching Ling Chin, Wee Teck Fong

この論文をやさしく読む

ひとことで言うと

文章で画像や動画を検索し、結果を見ながらフィードバックで絞り込む仕組みです。複数の視覚言語モデルの検索結果も比較できます。

何に役立つ?

考えられる用途は、画像・動画の中から意図に合うものを探し、課題に合う検索モデルを選ぶことです。要旨が紹介しているのは、そのための検索と比較の機能です。

この研究の面白いところ

検索結果を一度出して終わりにせず、利用者の反応で調整する操作と、モデル同士の視覚的な比較を同じ枠組みで扱っています。課題固有の追加学習なしに使えるVLMの能力を利用します。

どこまで分かった?

要旨には検索精度、応答時間、利用者実験、比較対象モデルの具体名は示されていません。リアルタイムの検索・絞り込みを目指す機能説明と、性能が数値で実証されたことは区別する必要があります。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

現代の検索システムには、自動化されていることと対話的であることの両方が求められ、利用者がリアルタイムで検索し、結果を絞り込める必要がある。本研究では、視覚言語モデル(VLM)のゼロショット能力を活用し、画像と動画を自然言語で検索する柔軟なマルチモーダル検索の枠組み、AiSearchを提示する。 AiSearchは、利用者のフィードバックを通じた対話的な検索の絞り込みに対応し、利用者の意図に合わせて結果を調整する。また、複数のVLMを視覚的に比較評価できるため、利用者は自分の課題に最も適したモデルを選べる。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-10-01(UTC)
最新改訂
2026-10-01 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Modern retrieval systems must both be automated and interactive, allowing users to search and refine results in real time. We present AiSearch, a flexible multimodal retrieval framework that leverages the zero shot capabilities of Vision Language Models (VLMs) for natural language search over images and videos. AiSearch supports interactive search refinement through user feedback to tailor results to the user's intent, and allows visual benchmarking across multiple VLMs, enabling users to select the most suitable model for their task.

著者のコメント

The demo paper with 1 page main paper, 7 pages supplementary material accepted and presented in ECCV 2026

arXiv ID: 2610.01389 / 要約の誤りについて