動画の修正が必要なトークンに強化学習を集中させる
Token-Level Video Reinforcement Learning
この論文をやさしく読む
ひとことで言うと
動画全体に同じ学習信号を与えるのではなく、評価スコアに影響する部分をトークン単位で見つけ、そこを重点的に更新する方法です。
何に役立つ?
プロンプトに合う動画を生成する強化学習で、すでに良好な部分への不要な変更を抑えることが考えられます。評価では複数のサンプラーと報酬モデルで改善しています。
この研究の面白いところ
評価用の視覚言語モデルを固定したまま、その回答と入力勾配から全体報酬と局所的な寄与の両方を得ています。新たな位置ごとの正解ラベルを要旨の方法は前提にしていません。
どこまで分かった?
数値はVBench-2.0など、報告された評価条件でのスコア改善です。要旨には計算コスト、人による評価、どの種類の映像で失敗するかの内訳はありません。勾配の大きさはスコアへの影響を表し、誤りの正解位置そのものではありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
動画生成の強化学習(RL)は通常、生成した動画全体に1つのスカラー報酬を割り当てる。しかし動画の欠点は一様ではない。すでにプロンプトを満たしている視覚トークンもあれば、修正が必要なものもある。スカラー報酬は誤りの場所を特定できないため、最適化が良好なトークンを変えてしまう一方で、本当に変更すべきトークンには十分に働き掛けられない。 本研究では、最適化する報酬からトークン単位の寄与を導く枠組みToken-Level Video Reinforcement Learning(TVRL)を提案する。中心となる着想は、固定した視覚言語モデルの回答尤度が2つの信号を与えるという点である。その出力は動画単位の報酬に寄与し、動画入力に関する勾配の大きさは、そのスコアに最も影響する生成動画トークンを示す。 TVRLをGroup Relative Policy Optimization(GRPO)に実装する際には、プロンプトから作った質問への報酬を平均して1つのグループ相対アドバンテージとし、勾配の伝播を切り離した、質問を条件とするトークン寄与マップを用いる。このマップによって、クリップされた方策比の内側にある密なノイズ除去遷移の対数確率を重み付けし直す。 VBench-2.0では、TVRLは総合スコア57.69を達成し、基礎モデルを3.60ポイント上回る。また、条件をそろえたGRPOの基準手法に対して、3つの確率微分方程式(SDE)サンプラー、SAGE、Flow、Danceで2.68〜3.15ポイント、4つの報酬モデル、VideoAlign、VideoScore2、UnifiedReward2、Qwen3.5-9Bで1.33〜3.15ポイント改善する。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-10-01(UTC)
- 最新改訂
- 2026-10-01 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-10-01 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Reinforcement learning (RL) for video generation usually assigns one scalar reward to an entire sampled video. Yet a video is not uniformly flawed: some visual tokens may already satisfy the prompt, whereas others require correction. A scalar reward cannot localize errors, causing optimization to perturb satisfactory tokens while under-targeting the tokens that actually need to change. We introduce Token-Level Video Reinforcement Learning, TVRL, a framework that derives token-level credit from the reward being optimized. Our key insight is that the answer likelihood of a frozen vision-language model provides both signals: its outputs contribute to the video-level reward, while magnitudes of its video-input gradients reveal which generated video tokens most affect that score. We instantiate TVRL in Group Relative Policy Optimization by averaging prompt-derived question rewards into one group-relative advantage and using detached, question-conditioned token-credit maps to reweight dense denoising-transition log-probabilities inside the clipped policy ratio. On VBench-2.0, TVRL achieves an Overall score of 57.69, outperforming the base model by 3.60 points. TVRL also improves matched GRPO baselines across three SDE samplers (SAGE, Flow, and Dance) by 2.68--3.15 points and across four reward models (VideoAlign, VideoScore2, UnifiedReward2, and Qwen3.5-9B) by 1.33--3.15 points.
arXiv ID: 2610.01973 / 要約の誤りについて