arXiv論文メモ
新着一覧
cs.CV / cs.AI / cs.GR · 査読状況未確認

過去の視点を記憶し、動画内の3次元空間を一貫して生成

WorldCrafter: Consistent Video World Model with Implicit 3D-aware Memory

Wangbo Yu, Kunhao Liu, Wenbo Hu, Shenghai Yuan, Chaoran Feng, Haiyang Zhou, Yukun Huang, Yiran Wang, Wang Zhao, Yingmin Luo, Ying Shan

この論文をやさしく読む

ひとことで言うと

視点を動かしたり以前の場所に戻ったりしても、過去に見た景色とのつじつまを保つ動画生成モデルです。

何に役立つ?

考えられる用途は、画像や文章から作った仮想空間を対話的に見回すことです。要旨では分単位の探索を評価しています。

この研究の面白いところ

次に見る視点に必要な情報を優先して、限られたトークン数へ圧縮します。明示的な深度対応を使わず、記憶機構と生成器を一緒に学習します。

どこまで分かった?

静的・動的シーンでの実験ですが、要旨には改善率やデータの詳細はありません。分単位を超える探索の一貫性は、この要旨からは分かりません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

動画世界モデルは動的な環境を対話的に探索できるようにするが、長時間にわたり、また視点が変わっても過去の観測と整合することには課題がある。この目的のため、カメラ情報で問い合わせ可能な、3次元構造を考慮した暗黙的な記憶を学習する動画世界モデルWorldCrafterを提案する。重要な着想は、要求された視点に応じて、複数視点の証拠を動画生成器の限られたトークン数へ圧縮する方法を変えることである。動画生成器と共同で学習する記憶エンコーダと姿勢条件付き読み出しモジュールが、明示的な深度ベースの対応付けを使わず、ノイズ除去の前に過去の観測を対象視点に特化した固定個数のトークンへ統合する。この記憶を直近の時間的文脈および少数ステップへの蒸留と組み合わせることで、WorldCrafterは1枚の入力画像またはテキストプロンプトから、ストリーミング形式でシーンを探索できる。静的・動的なシーンでの実験では、分単位の探索中の視覚品質を保ちつつ、長時間の一貫性とカメラ制御の精度が大幅に向上することを示した。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-21(UTC)
最新改訂
2026-09-21 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Video world models enable interactive exploration of dynamic environments, yet struggle to respect prior observations over long horizons and across viewpoints. We present WorldCrafter, a video world model that learns a camera-queryable implicit 3D-aware memory for this purpose. The key insight is to let the requested viewpoint shape how multi-view evidence is compressed into the video generator's limited token budget. Trained jointly with the video generator, a memory encoder and pose-conditioned readout module integrate historical observations into a fixed set of target view-specific tokens before denoising, without explicit depth-based correspondences. By combining this memory with recent temporal context and few-step distillation, WorldCrafter enables streaming scene exploration from a single input image or text prompt. Experiments across static and dynamic scenes show substantial gains in long-horizon consistency and camera-control accuracy while preserving visual quality during minute-scale exploration.

著者のコメント

Project webpage: https://drexubery.github.io/WorldCrafter

arXiv ID: 2609.24984 / 要約の誤りについて