映像から物体の動力学を学ぶ世界モデルNeuIDO
NeuIDO: Neural Intrinsic Dynamics Operator for Physics-Informed 4D World Models
この論文をやさしく読む
ひとことで言うと
物体がどう動くかを映像から学び、新しい場面の運動を推定する枠組みです。人が物理的な仮定を設定するだけでなく、観測と動力学の対応を学習します。
何に役立つ?
考えられる用途は、物体の相互作用を予測する世界モデルや身体性を持つエージェントです。少数例による現実の動きへの適応も扱っています。
この研究の面白いところ
個々の映像を別々に処理するだけでなく、観測の分布と動力学の分布の間の写像を作用素学習として捉えています。
どこまで分かった?
要旨には評価データ、誤差や推論速度の具体値がありません。ゼロショット推論と少数例適応を区別しており、任意の現実環境で完全な世界モデルになったことを示すものではありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
世界モデルは環境の動力学を捉え、将来の軌道を予測することを目指し、身体性を持つ知能への可能性を広げている。物理情報を取り入れた4D生成は、物理シミュレーションを統合して3D物体の相互作用を予測し、世界モデルへの有望な道筋を提供する。しかし、この方式は世界の動力学を内部に学び取るのでなく、手動で課した動力学の仮定に依存するため、真の世界モデルとの間に隔たりが残る。 この隔たりを埋めるため、視覚観測から統一された内在的動力学の表現を学習し、物理情報を取り入れた4D生成を世界モデルへ進める、新たな動力学モデリングの枠組みNeuIDOを提案する。具体的には、世界モデリングをニューラル作用素学習問題として定式化し、視覚観測の分布から内在的動力学の分布への、汎化可能な写像を学ぶ2段階の学習戦略を導入する。 この観測–動力学の写像により、NeuIDOは映像から直接、ゼロショットで動力学を推論でき、少数例での適応を通じて複雑な現実世界の動力学へさらに合わせられる。広範な実験は、多様な視覚観測の背後にある内在的動力学を共有表現へ効果的に統合し、新しい場面で動力学を素早く推論できることを示す。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-21(UTC)
- 最新改訂
- 2026-09-21 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-21 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
World models aim to capture environmental dynamics and predict future trajectories, showing growing potential for embodied intelligence. Physics-informed 4D generation integrates physical simulation to predict 3D object interactions, offering a promising pathway toward world models. However, this paradigm relies on manually imposed dynamical assumptions rather than internalizing world dynamics, and thus still leaves a gap toward a true world model. To bridge this gap, we propose NeuIDO, a novel world dynamics modeling framework that learns a unified intrinsic dynamics representation from visual observations, advancing physics-informed 4D generation toward a world model. Specifically, we formulate world modeling as a neural operator learning problem and introduce a two-stage training strategy to learn a generalizable mapping from the visual observation distribution to the intrinsic dynamics distribution. Building on this observation-dynamics mapping, NeuIDO enables zero-shot dynamics inference directly from videos and can be further aligned with complex real-world dynamics via few-shot adaptation. Extensive experiments demonstrate that NeuIDO effectively unifies the intrinsic dynamics underlying diverse visual observations into a shared representation and rapidly infers dynamics in novel scenes.
著者のコメント
Accepted by ECCV 2026; Project Page: https://github.com/JiajingLin/NeuIDO
arXiv ID: 2609.24313 / 要約の誤りについて