arXiv論文メモ
新着一覧
cs.CV · 査読状況未確認

視野外の物体の変化を別視点で追う動画世界モデル

World Observer: Joint Actor-Observer Generation for Persistent World Modeling

Hyunwook Choi, Dahyun Chung, Hyunsung Kim, Siyoon Jin, Jinhyeok Choi, Junyoung Seo, Seungryong Kim

この論文をやさしく読む

ひとことで言うと

見えなくなった物体を別の生成視点で追い続け、再び見えたときに変化を反映する動画世界モデルです。過去の姿を保存するだけでなく、視野外の時間経過も扱います。

何に役立つ?

カメラが移動する長い動画で、画面外に出た物体の状態を保つ研究に役立ちます。実場面と合成場面を含む専用評価も提案しています。

この研究の面白いところ

行動主体の視点とは独立した全方位観測者を置き、共通の幾何対応でつなぎます。視野外の動作を制御信号で指定できる構成です。

どこまで分かった?

ここでの観測者は世界モデルが生成する視点であり、現実の見えない場所をセンサーで実測する仕組みとは異なります。要旨には改善値、観測者を増やした際の計算負担、追跡可能な時間の上限はありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

世界モデルは、行動主体の現在の視野を超えた領域を、どうすれば継続的に観測できるだろうか。動画世界モデルは、エージェントの行動によって環境がどう変化するかをシミュレートするが、依然として行動主体の視点が中心である。物体がその視野から外れると、変化の直接的な証拠を失い、再び視野に入ったときに状態や動きを保てないことが多い。私たちはWorld Observerを提案し、エージェント中心の透視投影の行動主体視点と、選んだ世界領域を見る1つ以上の全方位観測者を共同で生成することで、観測と行動を分離する。これにより、行動主体の視野を離れた物体も観測者の中では視覚的に変化し続け、再び現れたときに更新済みの状態が反映される。 共通の全方位画像からワーピングすることで、行動主体と観測者の明示的な幾何対応を定める。また、再登場時に細かな外観を回復するため、高解像度の透視投影参照画像からなるObserver Sinkを導入する。観測者は行動主体と分離されているため、場面内に自由に配置でき、複数地点へ拡張して広い領域を覆い、制御信号によって視野外の変化を誘導できる。視野外の変化を評価するため、さらに世界座標系の指標と、実場面・合成場面を含むベンチマークを導入する。World Observerは、視覚的忠実度、カメラ制御、3Dへの整合性で競争力を保ちながら、視野外の動きを大きく改善する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-10-01(UTC)
最新改訂
2026-10-01 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

How can a world model continuously observe regions beyond the actor's current view? Video world models simulate how an environment evolves from an agent's actions, yet remain actor-centric. Once an object leaves the actor's view, they lose direct evidence of its evolution, often failing to preserve its state and dynamics upon re-entry. To address this, we introduce World Observer, which decouples observing from acting by jointly generating a perspective actor for the agent-centric view with one or more panoramic observers that watch selected world regions. This allows objects that leave the actor's view to remain visually evolving in an observer, so their updated states are reflected when they re-enter. We ground the actor and observers by warping from a shared panoramic source for explicit geometric correspondence, and introduce an Observer Sink of high-resolution perspective references to restore fine appearance upon re-entry. Since the observers are decoupled from the actor, they can be placed freely across the scene, extended to multiple locations for broader coverage, and driven by control signals to steer out-of-view evolution. To evaluate out-of-view evolution, we further introduce world-space metrics and a benchmark spanning real and synthetic scenes. World Observer substantially improves out-of-view dynamics while remaining competitive in visual fidelity, camera control, and 3D adherence.

arXiv ID: 2610.02162 / 要約の誤りについて