arXiv論文メモ
新着一覧
cs.CV / cs.SD · 査読状況未確認

音声と映像を同時生成する拡散モデルの強化学習

AV-GRPO: Modality-Anchored Decoupling Diffusion Reinforcement Learning for Joint Audio-Video Generation

Zhiyu Xu, Weilong Yan, Yufei Shi, Shiyang Li, Yihao Liu, Kin-Man Lam, Yuewen Cao

この論文をやさしく読む

ひとことで言うと

音声と映像を一緒に作る拡散モデルを、各形式の報酬を分けて強化学習する方法です。

何に役立つ?

考えられる用途は、文章に合い音声と映像が同期した生成です。論文では二つのベンチマークで品質と同期を評価しました。

この研究の面白いところ

片方の生成系を凍結するなどして、音声側と映像側の改善の寄与を分け、計算費用も抑える設計です。

どこまで分かった?

要旨での比較相手はLTX-2.3で、評価はJavisBenchとVABenchです。実運用での品質や計算費用の具体値は要旨にありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

音声と映像を同時に生成する技術は大きく進歩したが、従来モデルには、それぞれの形式での品質不足、文章と生成物の対応不足、音声と映像の同期の弱さが残る。強化学習による後段の訓練は改善策となり得るものの、音声と映像に直接適用するのは難しい。異なる形式の報酬が学習信号を絡み合わせ、どちらに改善を帰属させるかを難しくする。動きの異なる二つの生成系を同時に最適化する計算費用も高い。さらに、同期の評価の難しさは組にした標本に依存し、報酬の公平な比較を妨げる。 そこで、形式を基準にするオンライン拡散強化学習の枠組みAV-GRPOと、要因を分離し難易度を制御できる訓練データセット5DAVを提案する。AV-GRPOには、学習信号を分離して難易度を安定させる形式基準のロールアウト、軌道を固定して一方の生成系を凍結し費用を減らして寄与を割り当て直す最適化、形式ごとの動きに合わせた適応的な目的関数と摂動強度、という三つの要素がある。これにより、結合した複数形式の選好学習を、報酬の寄与を明確にする単一形式の部分問題へ変え、同期を改善する。5DAVは五つの軸で標本を分離して系統的な訓練を可能にする。JavisBenchとVABenchの実験では、LoRAと全パラメータ微調整の両方で、生成品質、意味の一致、音声と映像の同期についてLTX-2.3を上回った。要素除去実験も設計の効果を確認した。コードとデータは公開している。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-24(UTC)
最新改訂
2026-09-24 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Recent years have witnessed major progress in joint audio-video generation. Existing models still suffer from limited per-modality fidelity, insufficient text-modality alignment and weak cross-modal synchronization. While reinforcement-learning post-training offers a promising remedy, directly adapting it to joint audio-video generation is challenging. Heterogeneous multimodal rewards entangle learning signals and complicate credit assignment. Joint optimization of two modality towers is computationally expensive given their divergent dynamics. Moreover, synchronization evaluation difficulty depends on paired samples, preventing fair reward comparisons. We propose AV-GRPO, a modality-anchored online diffusion RL framework, and 5DAV, a decoupled, difficulty-controllable training dataset. AV-GRPO includes three key modules: (1) modality-anchored rollouts to disentangle learning signals and stabilize difficulty; (2) trajectory-locked frozen-tower optimization to reduce cost and reassign credit; (3) adaptive objectives and perturbation strengths tailored to modality-specific dynamics. This converts coupled multimodal preference learning into unimodal subproblems for precise reward attribution and better synchronization. Our 5DAV dataset decouples samples across five dimensions for systematic training. Experiments on JavisBench and VABench demonstrate AV-GRPO outperforms LTX-2.3 in generation quality, semantic alignment and cross-modal synchronization under LoRA and full fine-tuning. Ablations confirm our designs. Code and data: https://github.com/zhiyuxu03/AV-GRPO

著者のコメント

22 pages

arXiv ID: 2609.29816 / 要約の誤りについて