arXiv論文メモ
新着一覧
cs.CV / cs.SD · 査読状況未確認

音声・映像ディープフェイク検出を共通の実験系で比較する

DFD-Lab: A Modular Audio-Visual Deepfake Detection Pipeline

Jan Rybarczyk, Mateusz Roszkowski, Jacek Komorowski

この論文をやさしく読む

ひとことで言うと

複数の音声・映像偽造検出モデルを同じ手順で学習・評価できる実験基盤です。データを劣化させる操作が、指標ごとに違う結果をもたらすことを示しています。

何に役立つ?

検出器の比較で、学習時に変えた条件とテスト画像の劣化を分け、結果を再現しやすくするために役立ちます。

この研究の面白いところ

JPEG50拡張で3モデルすべてのAUROCが上がる一方、正解率は下がりました。順位をうまく付けられることと、判定閾値で正しく分類することが同じではないと分かる例です。

どこまで分かった?

結果はFakeAVCelebで学習し、選別したDeepfake-Eval-2024で評価した条件に基づきます。AUROCの改善を検出性能全般の改善と一括りにはできず、実運用で高精度に検出できると示したものでもありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

音声・映像ディープフェイク検出器を比較するには、データセットへの適応、時間方向の入力表現、モデルのインターフェース、実験条件を調整する必要がある。本研究は、これらの役割を分離しながら共通の学習・評価手順を支える、モジュール式の処理系DFD-Labを提示する。Xceptionベースの最大ロジット融合、時間方向のLSTM融合を用いるResNet、および著者らによるAVFFの再実装という3つの実装を統合する。実験では、外部データでのテスト、劣化を用いた学習データ拡張、評価時の破損を扱う。 選別したDeepfake-Eval-2024の部分集合では、FakeAVCelebで学習したモデルのベースラインAUROCは順に0.504、0.538、0.458だった。JPEG50による学習データ拡張はこれらをそれぞれ0.691、0.605、0.570へ高めたが、正解率は3モデルすべてで低下した。この結果は、共通の処理系の中でも、学習時の介入、評価時の破損、指標に依存する結果を区別すべき理由を示している。本研究の貢献は、音声・映像処理、交換可能な検出器、設定可能な実験手順を統合し、実証的な事例研究で支えたことである。知見は、データセットをまたぐ検出の難しさと、順位付け指標および分類指標が与える情報の相補性を強調する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-20(UTC)
最新改訂
2026-09-20 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Comparing audio-visual deepfake detectors requires coordinating dataset adaptation, temporal input representation, model interfaces and experimental conditions. We present DFD-Lab, a modular pipeline that separates these responsibilities while supporting shared training and evaluation workflows. We integrate three implementations: Xception-based maximum-logit fusion, ResNet with temporal LSTM fusion, and our AVFF reimplementation. Experiments cover external testing, degradation-based training augmentation and evaluation-time corruption. On a filtered subset of Deepfake-Eval-2024, models trained on FakeAVCeleb attain baseline AUROC values of 0.504, 0.538 and 0.458. JPEG50 training augmentation raises these to 0.691, 0.605 and 0.570, respectively, while all three accuracies decrease. These results illustrate why training interventions, evaluation corruptions and metric-dependent outcomes should remain distinct within a common pipeline. The contribution is the integration of audio-visual processing, interchangeable detectors and configurable experimental workflows, supported by empirical case studies. The findings highlight the challenge of cross-dataset detection and the complementary information provided by ranking and classification metrics.

arXiv ID: 2609.23830 / 要約の誤りについて