arXiv論文メモ
新着一覧
cs.CV · 査読状況未確認

未来の交通動画を少ない追加学習で生成する

JEPA Guided Diffusion: Predictive Vision-Language Conditioning for Generative Traffic Forecasting

Trinh Tra Giang Nguyen, Thanh Nguyen Vo, Nguyen Hoai Thuong Bui and Ha Duc Bui

この論文をやさしく読む

ひとことで言うと

交通の動きを読み取るAIと動画を描くAIを固定したまま、その間をつなぐ小さな部分だけを学習します。観測した交通動画から、続きの動画を作る方法です。

何に役立つ?

考えられる用途は、交通場面の将来動画を生成するモデルを少ない追加学習で構築することです。要旨では大会ベンチマークでのスコアと順位が報告されています。

この研究の面白いところ

場面の理解と映像の生成を別々の既存モデルに任せ、潜在表現の橋渡しだけを学習します。巨大な生成モデル全体を再学習しない設計が中心です。

どこまで分かった?

75.1297という値は指定大会の評価スコアで、事故回避率や実際の交通予測の正答率ではありません。要旨には学習コスト削減の具体値や実道路での安全性評価は記載されていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

正確な交通予測には、場面の動態を理解することと、現実的な将来の観測を合成することの両方が必要である。近年の拡散モデルによる動画生成は、見た目にもっともらしい予測を作る一方、計算コストの高いエンドツーエンド学習を必要とし、場面理解と画像合成が絡み合いがちである。本研究では、将来の表現学習と動画生成を分離した予測の枠組みを提案する。 まず、重みを固定したV-JEPAエンコーダーが、観測された交通動画から予測に使う潜在表現を抽出し、意味的な潜在空間で場面の基礎的な動態を捉える。次に、軽量な潜在表現整合モジュールが、その表現を重み固定のCosmos拡散モジュールの条件付け空間へ写像する。これにより、大規模な生成モデルを再学習せずに将来の動画を合成できる。すべての基盤モデルを固定し、軽量な整合モジュールだけを学習することで、予測能力を保ちながら最適化の複雑さを大きく減らす。 AI City Challenge 2026 Track 5ベンチマークでの実験では、提案手法は75.1297のスコアを達成し、大会で3位となった。この結果は、V-JEPAが学習した予測的な世界表現が後段の動画生成を効果的に導けることを示唆しており、エンドツーエンドの拡散型予測に代わる、実用的かつ効率的な選択肢を提供する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-18(UTC)
最新改訂
2026-09-18 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Accurate traffic forecasting requires both understanding scene dynamics and synthesizing realistic future observations. Recent diffusion-based video generation models produce visually plausible predictions but require expensive end-to-end training and often entangle scene understanding with image synthesis. In this work, we propose a decoupled forecasting framework that separates future representation learning from video generation. A frozen V-JEPA encoder first extracts predictive latent representations from the observed traffic videos, capturing the underlying scene dynamics in a semantic latent space. A lightweight latent alignment module then projects these representations into the conditioning space of a frozen Cosmos diffusion module, enabling future video synthesis without retraining the large generative model. By freezing all foundation models and training only the lightweight alignment module, the proposed framework substantially reduces optimization complexity while preserving forecasting capability. Experimental results on the AI City Challenge 2026 Track 5 benchmark demonstrate that the proposed method achieved a score of 75.1297, ranking third in the competition. These results suggest that predictive world representations learned by V-JEPA can effectively guide downstream video generation, providing a practical and efficient alternative to end-to-end diffusion-based forecasting.

著者のコメント

ECCV Workshop 2026, AI City Challenge 2026 Track 5

arXiv ID: 2609.21379 / 要約の誤りについて