arXiv論文メモ
新着一覧
cs.CV / cs.RO · 査読状況未確認

交通参加者の関係を教師情報に使う自動運転の世界モデル

Relationally Grounded Latent World Models for Autonomous Driving

Fabian Schmidt, Markus Enzweiler, Abhinav Valada

この論文をやさしく読む

ひとことで言うと

車や歩行者などの関係をグラフで表し、学習中だけ自動運転モデルに教える手法です。運用時にはその補助入力を外し、通常の視覚表現だけで予測します。

何に役立つ?

推論時の追加計算を避けつつ、学習データに含まれる関係情報を利用する方法として参考になります。nuScenesで軌道誤差と衝突率の改善が報告されています。

この研究の面白いところ

同じ意味情報でも文章のキャプション形式より、関係を明示したグラフ形式が良い結果でした。学習時だけ豊富な情報を与える構成を比較しています。

どこまで分かった?

比較対象は著者らが再学習したLAWで、結果はnuScenes上の評価です。衝突率の元の値に要旨は%記号を付けていないため、52.4%は相対的な削減率として読む必要があります。実道路での安全性を示す結果ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

潜在世界モデルは、自動運転のために予測的な表現を学ぶが、その状態がどのような関係の意味を保持しているかは、しばしば暗黙的なままである。本研究では、交通シーングラフが潜在世界表現に対する特権的な意味教師情報として使えるかを調べる。 LAWを基盤に、nuScenesの3次元注釈から交通参加者を中心としたシーングラフを構築し、その直列化した関係構造を固定済みのテキスト埋め込みモデルで符号化する。学習時には、視覚の潜在表現をこの意味的な目標に整合させる。推論時には教師情報の分岐を取り除くため、シーングラフも3次元注釈も不要で、テスト時の計算は増えない。 nuScenesでは、再学習したLAWベースラインに対して、平均軌道L2誤差が0.661から0.622へ、5.9%減少し、衝突率が0.456から0.217へ、52.4%減少した。また、非構造化のキャプション形式の意味目標よりも良い結果を示し、潜在世界モデルの表現学習で明示的な関係構造を使う利点を支持する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-21(UTC)
最新改訂
2026-09-21 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Latent world models learn predictive representations for autonomous driving, but the relational semantics these states preserve often remain implicit. We investigate whether traffic scene graphs can serve as privileged semantic supervision for latent world representations. Building on LAW, we construct actor-centric scene graphs from nuScenes 3D annotations, encode their serialized relational structure using a frozen text embedding model, and align the visual latent representations with this semantic target during training. We remove the supervision branch at inference, so it requires neither scene graphs nor 3D annotations and adds no test-time computation. On nuScenes, our method reduces average trajectory L2 error from 0.661 to 0.622 (5.9%) and collision rate from 0.456 to 0.217 (52.4%) relative to our retrained LAW baseline. It also outperforms an unstructured caption-style semantic target, supporting the benefit of explicit relational structure for latent world-model representation learning.

著者のコメント

Accepted at the NeuRo-SymBolic World Models (RoBoWoMo) Workshop at IROS 2026

arXiv ID: 2609.24626 / 要約の誤りについて