arXiv論文メモ
新着一覧
cs.CV / cs.GR · 査読状況未確認

過去映像の部分的な記憶を組み合わせて再登場時の姿を保持

MosaiChunk: Compositing Spatio-Temporal Memory for Autoregressive Video Generation

Yiwen Zhang, Haocheng Xi, Michael Tian-Yue Liu, Alexei A. Efros, Hadar Averbuch-Elor, Qianqian Wang, Haiwen Feng

この論文をやさしく読む

ひとことで言うと

過去動画をまとまった区間ごとに思い出す代わりに、必要な場所・時点の内部記憶を寄せ集めます。再登場した物体の細部を保つための仕組みです。

何に役立つ?

長い動画で以前の場所や物体が戻ってくる場面の一貫性を改善する研究に役立ちます。同じメモリ量で既存の参照方式と比較しています。

この研究の面白いところ

生成モデル自体は固定し、どのKV記憶を使うかを選ぶ小さなルーターだけを学習します。離れた時空間の記憶を直接利用できる性質を活用します。

どこまで分かった?

改善はRememBenchのT2V・I2V設定で、メモリ予算をそろえた比較です。要旨には数値的な改善幅、検索時間、扱える動画長の上限は示されていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

長時間の自己回帰型動画生成は、有限の文脈窓によって制限される。物体や場面が文脈から外れると、細かな視覚的特徴が失われ、再登場時に回復しにくくなることがある。こうした特徴を参照できるようにするため、空間と時間をまたいで選んだ過去のキー・バリュー(KV)要素をモザイク状に組み合わせる、時空間記憶機構MosaiChunkを導入する。 本手法は、固定した動画生成器が、このような不連続な過去のKVを直接受け取り、対応する視覚内容を回復できるという観察に基づく。そのため生成器は固定し、利用中の記憶量の予算を一定に保ちながら、過去のどの部分をモザイクに含めるかを決める軽量なルーターだけを学習する。さらに、プロンプト駆動のテキストから動画への生成(T2V)と、カメラ駆動の画像から動画への生成(I2V)の分割を持つ、長時間後の再訪問のベンチマークRememBenchを導入する。実験では、T2VとI2Vの両方において、メモリ予算をそろえたスライディングウィンドウ推論とチャンク全体の検索のいずれよりも、MosaiChunkが再訪問時の一貫性を安定して改善した。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-10-01(UTC)
最新改訂
2026-10-01 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Long-horizon autoregressive video generation is limited by a finite context window. When an object or scene falls out of context, its fine-grained visual details may be lost and difficult to recover upon reappearance. To retain access to such visual details, we introduce MosaiChunk, a spatio-temporal memory mechanism that composes a mosaic of selected historical key-value (KV) entries across space and time. Our approach is motivated by the observation that a frozen video generator can directly consume such non-contiguous historical KV and recover the corresponding visual content. We therefore keep the generator fixed and learn only a lightweight router that determines which historical sections to include in the mosaic under a fixed active-memory budget. We further introduce RememBench, a benchmark of long-horizon revisits with prompt-driven text-to-video (T2V) and camera-driven image-to-video (I2V) splits. Our experiments show that MosaiChunk consistently improves revisit consistency over both sliding-window inference and whole-chunk retrieval under matched memory budgets, across both T2V and I2V settings.

著者のコメント

27 pages. Project page: https://mosaichunk.github.io/

arXiv ID: 2610.02153 / 要約の誤りについて