動画の複数カットを照合して人物関係を検索
SALI: Shot-Aware Late Interaction for Cross-Shot Relation Matching in Text-to-Video Retrieval using Film-Grammar Knowledge
この論文をやさしく読む
ひとことで言うと
登場人物を別々のカットで映す動画でも、文章に書かれた人物関係を探せるようにする方法。
何に役立つ?
人物間のやり取りを文章で指定する動画検索の評価や改善に役立つ。
この研究の面白いところ
検索文の主語と目的語を分け、クリップの各カットと照合して、平均表現では失う関係を拾う。
どこまで分かった?
MSR-VTTでは関係検索が改善する一方、全体のR@1は1.4点下がった。改善幅は評価したデータセットと検索条件に依存する。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
文章から動画を探す方法は、通常、動画クリップを一つの埋め込みで表すため、人物間の重要な関係を失いやすい。たとえば「アンナがマークに詰め寄る」場面は、二人を交互に映すショットと逆ショットで撮られることが多く、どの一カットも、カットを平均した表現も、その関係を捉えられない。著者らはSALIという、カットを考慮した後段での照合方法を提案する。単文の検索文から主語と目的語を取り出し、検索文全体と主語・目的語それぞれの文章埋め込みを、クリップの各映像カットの埋め込みに照合する。照合演算には貪欲な最大値または最適輸送を使う。追加学習では映画の文法を考慮したペナルティが小さいが一貫した変化を加える。CLIP4Clip-meanPを土台としたSALIは、Condensed MoviesとActivityNetで全体の再現率を同程度に保ちつつ、複数カットにまたがる関係を問う検索のR@1をそれぞれ3点、12点高め、比較した方法の中で最大の改善を得た。MSR-VTTでもその種の検索を改善したが、全体のR@1は1.4点下がった。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-24(UTC)
- 最新改訂
- 2026-09-24 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-24 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Text-to-video retrieval usually represents a video clip by a single embedding. This embedding often loses important relations between people. E.g., an interaction "Anna confronts Mark" is regularly filmed as alternating shot and reverse shot of both (Fig. 1a). No single shot or averaged embedding over clip shots captures this relation. Thus, we propose SALI (Shot-Aware Late Interaction). It extracts the subject and object from a single-sentence query, and matches the query, its subject and object text embeddings against each visual shot embedding of a video clip. The matching operator is greedy max or optimal transport. A film-grammar penalty in fine-tuning adds a small, consistent shift. Built on CLIP4Clip-meanP, SALI keeps overall recall on par on Condensed Movies and ActivityNet while raising R@1 on multi-shot relation queries by 3 and 12 points, the most among all compared methods, and improves such queries on MSR-VTT at a cost of 1.4 R@1 overall.
著者のコメント
5 pages, 2 figures, 4 tables. Submitted to ICASSP 2027
arXiv ID: 2609.29721 / 要約の誤りについて