arXiv論文メモ
新着一覧
cs.CV · 査読状況未確認

生成動画とモデル複製の検証に使う生成時透かし

An Efficient and Effective Watermarking Scheme for the Protection of the Intellectual Property Rights of Video Generative Models

Wenhong Huang, Jianwei Fei, Benedetta Tondi, Bin Ma, Fangjun Huang

この論文をやさしく読む

ひとことで言うと

動画生成モデルを微調整し、生成した動画にモデル固有の見えにくい透かしが入るようにして、動画の出所やモデルの複製を検証する方法です。

何に役立つ?

保護対象のモデルから生成された動画か、疑わしいモデルがそのコピーかを調べる技術的な手掛かりになります。二つの検証課題を共通の透かし方式で扱います。

この研究の面白いところ

後から動画に印を足すだけでなく、固定したデコーダを使う微調整によって、生成時点で透かしを持つ動画を出すようにします。空間スケールと時間方向の情報を組み合わせています。

どこまで分かった?

99%超は透かし抽出、100%は二つの検証課題での実験正解率です。試験された条件での値であり、未知のあらゆる攻撃への保証や、法的な権利帰属そのものの確定を意味しません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

動画生成モデル(VGM)の急速な発展により、非常に現実的な合成動画を生成できるようになり、これらのモデルの知的財産権(IPR)への懸念が生じている。特に、密接に関係する二つのフォレンジック課題は、十分に対処されていない。一つは合成動画検証で、動画が保護対象のVGMから生成されたかを判定する。もう一つはモデル所有権検証で、疑わしいVGMが保護対象モデルの無許可コピーかを判定する。本論文では、この二つに対処できる新たな生成時透かし方式を提案する。まず、二つのスケールの離散ウェーブレット変換(DWT)分解と大域的時間注意ブロック(GTAB)を組み込み、透かしの頑健性と知覚されにくさを高める動画透かしネットワークVidMarkを提示する。次に、デコーダに誘導される微調整手順を示す。固定したVidMarkデコーダを利用することで、VGMが、知覚されにくく頑健でモデル固有の透かしを持つ動画を合成できるようにする。最後に、合成動画検証とモデル所有権検証を行う二つの検証の枠組みを構築する。代表的なVGMでの広範な実験により、動画生成品質への影響を無視できる程度に抑えながら、99%を超える透かし抽出正解率と、両課題で100%の検証正解率を達成することを示す。また、透かしは、動画レベルとモデルレベルの幅広い攻撃に対して高い頑健性を示す。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-20(UTC)
最新改訂
2026-09-20 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

The rapid development of video generative models (VGMs) has enabled the generation of highly realistic synthetic videos, raising concerns about the intellectual property rights (IPR) of these models. In particular, two closely related forensic tasks remain largely unaddressed: synthetic video verification (determining whether a video was generated by a protected VGM) and model ownership verification (determining whether a suspect VGM is an unauthorized copy of a protected VGM). In this paper, we propose a new in-generation watermarking scheme that can address the two verification tasks. First, a novel video watermarking network named VidMark is presented, which incorporates a two-scale discrete wavelet transform (DWT) decomposition and a global temporal attention block (GTAB) to enhance watermark robustness and imperceptibility. Second, we present a decoder-guided fine-tuning procedure. By leveraging the frozen VidMark decoder, this process enables VGMs to synthesize videos carrying an imperceptible, robust, and model-specific watermark. Finally, two verification frameworks are established to perform synthetic video verification and model ownership verification. Extensive experiments on representative VGMs demonstrate that the proposed scheme achieves over 99% watermark extraction accuracy and 100% verification accuracy on both tasks, with negligible impact on video generation quality. Furthermore, the watermarks exhibit strong robustness against a comprehensive range of video-level and model-level attacks.

arXiv ID: 2609.23586 / 要約の誤りについて