動画の有害内容検出で見逃しと誤検出を調整する
Controllable Multi-label Video Safety Detection via Adaptive Tversky Policy Optimization
この論文をやさしく読む
ひとことで言うと
動画に複数の有害カテゴリを付ける検出器で、見逃しを減らすか、誤って有害と判定する回数を減らすかを調整する研究です。訓練中の報酬で二種類の誤りへの重みを変えます。
何に役立つ?
カテゴリや審査工程によって異なる検出基準を持つ動画モデレーションへの利用が考えられます。報告された実証結果はベンチマーク上の性能改善と、適合率・再現率の調整です。
この研究の面白いところ
安全・危険の二択にせず、一つの動画が複数の問題を含む設定を扱います。SafeWatch-Bench-RealではJaccard Indexが40.66から75.44へ改善したと具体的な値を示しています。
どこまで分かった?
評価対象はSafeWatch-BenchとXD-Violenceです。要旨にはカテゴリごとの詳細な誤り率や、実運用での審査負担・ポリシー適合性の検証結果は示されていません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
動画を中心とするソーシャルメディアの急成長によって、利用者が有害な内容に触れる機会が増え、信頼できる自動動画安全性検出が必要になっている。近年の視覚言語モデル(VLM)は高い動画理解能力を示しているが、既存の有害動画検出システムには二つの重要な限界がある。通常、安全性検出を二値分類に縮約し、安全でない動画が本来複数のラベルを持つことを見落とす点と、静的な訓練目的に依存して、適合率と再現率の制御可能なトレードオフを支援しない点である。望ましい動作点は、モデレーションの処理系や有害カテゴリによって異なり得る。 これらを解決するため、マルチラベル動画安全性検出(Multi-VSD)の強化学習フレームワーク、Adaptive Tversky Policy Optimization(ATPO)を提案する。ATPOはAdaptive Tversky Reward(ATR)を導入し、訓練中に偽陽性と偽陰性への罰則を動的に調整することで、適合率と再現率のトレードオフを制御可能にする。SafeWatch-BenchとXD-Violenceでの実験から、ATPOはマルチラベル性能を大きく改善し、SafeWatch-Bench-RealのJaccard Indexを40.66から75.44へ高めることを示す。さらにATRは、適合率と再現率の動作点を安定して誘導でき、異なるポリシー要件を持つ導入場面を支援する。コードとチェックポイントは https://bruceyg.github.io/ATPO-project-page/ で提供する。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-10-01(UTC)
- 最新改訂
- 2026-10-01 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-10-01 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
The rapid growth of video-based social media has increased users' exposure to harmful content, creating a need for reliable automated video safety detection. Although recent Vision-Language Models (VLMs) show strong video understanding capabilities, existing harmful video detection systems face two key limitations: they typically reduce safety detection to binary classification, overlooking the inherently multi-label nature of unsafe videos, and they rely on static training objectives that do not support controllable precision-recall trade-offs, though the desired operating point may vary across moderation pipelines and unsafe categories. To address these gaps, we propose Adaptive Tversky Policy Optimization (ATPO), a reinforcement learning framework for Multi-label Video Safety Detection (Multi-VSD). ATPO introduces the Adaptive Tversky Reward (ATR), which dynamically adjusts false-positive and false-negative penalties during training to enable controllable precision-recall trade-offs. Experiments on SafeWatch-Bench and XD-Violence show that ATPO substantially improves multi-label performance, increasing the Jaccard Index from 40.66 to 75.44 on SafeWatch-Bench-Real. Moreover, ATR enables reliable steering of the precision-recall operating point, supporting deployment scenarios with heterogeneous policy requirements. Code and checkpoints are provided at https://bruceyg.github.io/ATPO-project-page/ .
arXiv ID: 2610.02019 / 要約の誤りについて