arXiv論文メモ
新着一覧
cs.CV · 査読状況未確認

画像内の複数の顔の偽造を位置情報付きの指示で検出

IMFD: End-to-end Multi-Face Forgery Detection through Instruction-based Large Vision-Language Models

Dasom Choi, Sangjun Moon, Hyeongchan Im, Jaeeon Park, Jingun Kwon, Hidetaka Kamigaito, Taro Watanabe, and Manabu Okumura

この論文をやさしく読む

ひとことで言うと

複数の顔を含む画像全体を見て、顔の位置とそれぞれの偽造判定を一度に行う視覚言語モデルです。

何に役立つ?

顔を個別に切り抜くと失われる背景や顔同士の関係を使い、複数人が写ったディープフェイクの検出を改善する用途です。

この研究の面白いところ

予測した顔の枠を単なる出力にせず、指示文に視覚的な手がかりとして組み込みます。顔の位置を言語指示と結びつけて、偽造判定を助ける構成です。

どこまで分かった?

既存の複数顔データを指示形式に変換して評価し、既存法を上回ると報告しています。要旨に具体的な精度や未知の生成法に対する評価条件は示されていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

ディープフェイクの急増は、ソーシャルメディア上での拡散により大きな懸念を生んでいる。従来の複数顔の偽造検出器は、それぞれの顔を切り出して独立に検証するため、背景の文脈や顔同士の関係を無視し、性能が十分でないことが多い。これらの制約を克服するため、画像全体を解釈し、複雑な文章の指示に従うことができる、指示ベースの大規模視覚言語モデル(LVLM)を活用する。 本研究は、IMFD(Instruction-based Multi-face Forgery Detector)と呼ぶ、単純でありながら有効な1段階の複数顔偽造検出器を提案する。IMFDは、顔の位置を特定し、各顔の偽造ラベルを予測することを同時に行うよう、端から端まで一体として学習される。顔の囲み枠の予測を単に同時学習の目標とするだけでなく、予測した顔の囲み枠を、指示と画像の対応づけおよび偽造検出を強める視覚的な手がかりとして、明示的に指示へ組み込む。 IMFDの学習と評価を支えるため、既存の複数顔偽造データセットを指示ベースの形式へ変換する。実験結果と分析により、IMFDは顔の囲み枠を指示へ組み込むことで複数顔の偽造検出を改善し、さまざまな最先端手法を一貫して上回ることを示す。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-17(UTC)
最新改訂
2026-09-17 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

The rapid increase of deepfakes has raised significant concerns due to their spread on social media. Traditional multi-face forgery detectors crop and verify each face independently, ignoring background context and inter-face relationships, which often yields suboptimal performance. To overcome these limitations, we leverage instruction-based Large Vision-Language Models (LVLMs), which can interpret entire images and follow complex textual instructions. We propose a simple yet effective single-stage multi-face forgery detector, called IMFD (Instruction-based Multi-face Forgery Detector), which is trained end-to-end to jointly localize faces and predict per-face forgery labels. Rather than treating face box prediction only as a joint objective, IMFD explicitly integrates predicted face bounding boxes into the instruction as visual cues that enhance instruction grounding and forgery detection. To support the training and evaluation of IMFD, we convert existing multi-face forgery datasets into an instruction-based format. Experimental results and analyses show that IMFD improves multi-face forgery detection by integrating face bounding boxes into the instruction, and consistently outperforms various state-of-the-art methods.

著者のコメント

8 pages, 5 figures, 5 tables. Accepted to Findings of AACL-IJCNLP 2026

arXiv ID: 2609.19693 / 要約の誤りについて