因果的な推論を先に行う身体性世界モデルCausalWM
CausalWM: Causal Chain-of-Thought Reasoning for Embodied World Model
この論文をやさしく読む
ひとことで言うと
将来の動画を作る前に、動きの原因となる変数を順に考える世界モデルを提案する。
何に役立つ?
ロボットなどの行動後の様子を予測するモデルの設計に役立つ可能性がある。
この研究の面白いところ
限られた因果推論の教師信号でも、複数の動画予測ベンチマークで高い性能を報告する。
どこまで分かった?
結果は記載されたベンチマークでの評価であり、実世界での因果理解そのものを証明するものではない。
v2のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
身体性を持つ世界モデルは、画像による観測と制御信号から将来の物理的な変化を予測するが、物理的な知識は潜在表現の中に暗黙に絡み合っている。本研究は、未来の動画を予測する前に、因果関係について明示的な思考の連鎖に沿って推論する、160億パラメータの身体性世界モデルCausalWMを導入する。役立つ変数を推論の軌跡に並べ、物理的な変化の背後にある因果的な依存関係を段階的に捉えられるようにする。 学習のため、身体的な行動を含むデータを3万1000時間集め、大規模動画の事前学習、因果的な思考の連鎖の中間学習、複数目的の強化学習による追加学習という三段階の方法を開発した。教師信号として与えた思考の連鎖の変数は限られるが、CausalWMは文脈から学ぶ能力を示し、画像の特徴を文脈に応じて導き、少ない段階で効率よく動画を生成できる。言語条件、行動条件、単一視点、複数視点の各ベンチマークで最先端の性能を達成し、TriWorldBenchの順位表でも首位となった。
v2の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-19(UTC)
- 最新改訂
- 2026-09-22 · v2
- 査読・掲載
- 査読状況未確認
更新履歴
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Embodied world models learn to predict future physical dynamics from visual observations and control signals, where physical knowledge is implicitly entangled within latent representations. We introduce CausalWM, a 16B embodied world model that performs explicit causal chain-of-thought reasoning before future video prediction. CausalWM organizes useful variables into a reasoning trajectory, allowing the model to progressively capture causal dependencies underlying physical evolution. To train CausalWM, we collect 31K hours embodied data and develop a three-stage paradigm consisting of large-scale video pre-training, causal CoT mid-training, and multi-objective RL post-training. Despite using only a limited set of supervised CoT variables, CausalWM exhibits emergent in-context learning capabilities, enabling contextual visual feature guidance and efficient few-step generation. CausalWM achieves state-of-the-art performance across language-conditioned, action-conditioned, single-view and multi-view benchmarks, including Top-1 performance on TriWorldBench leaderboard.
arXiv ID: 2609.23184 / 要約の誤りについて