複数カメラとLiDARを生成する運転世界モデル
HelloWorld: Towards Practical Applications of Generative Driving World Models
この論文をやさしく読む
ひとことで言うと
自車の動きや地図の指定に従い、複数カメラの映像と LiDAR を順次生成する運転シミュレーションモデル。
何に役立つ?
運転システムの学習・評価に使う仮想データや対話的なシミュレーションを作る用途が考えられる。安全性の実証を示したものではない。
この研究の面白いところ
7台のカメラを同期させ、LiDAR も条件付きで作り、生成した過去の場面を次の生成へ利用する。
どこまで分かった?
要旨には評価した項目が列挙されるが、具体的な得点や実車での安全性・性能は示されていない。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
運転の世界モデルは、記録済みの走行ログを超える反事実的なデータ生成と対話的なシミュレーションを、大規模に実現する手段として有望である。これを実現するには、多様な場面に一般化し、指定した制御に忠実に反応し、複数センサーの整合した観測を生成し、繰り返し推論しても効率的に動くシステムが必要となる。本研究は、これらの要件に合わせて設計した20億パラメータの運転世界モデル HelloWorld を提示する。多様な動画データから得た一般的な視覚と動きの事前知識を、自車位置、高精度地図、三次元の境界ボックスを使って、制御可能な運転場面の生成へ段階的に特化させる。ブロック単位で因果関係を保つ生成のインターフェースと、自分で生成した文脈への適応によって、逐次的なシミュレーションに合わせる。また、同期した7台のカメラの RGB 画像生成と、条件付きの LiDAR 合成に対応し、効率的な運用に向けて少数ステップの推論へ蒸留する。実験では、視覚的品質、制御への忠実度、視点間の整合性、繰り返し生成したときの頑健性、推論効率、LiDAR 合成を評価する。HelloWorld は、大規模な運転データ生成と対話的シミュレーションのための統一的な枠組みを提供する。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-24(UTC)
- 最新改訂
- 2026-09-24 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-24 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Driving world models provide a promising route toward scalable counterfactual data generation and interactive simulation beyond recorded driving logs. Realizing this potential requires a system that can generalize across diverse scenes, respond faithfully to prescribed controls, generate coherent multi-sensor observations, and operate efficiently under repeated inference. We present \textbf{HelloWorld}, a 2B driving world model system designed around these requirements. HelloWorld progressively specializes broad visual and motion priors from heterogeneous video data into controllable driving generation using ego pose, HD maps, and 3D boxes. A block-causal generation interface, together with adaptation to self-generated context, aligns the model with sequential simulation. The system further supports synchronized seven-camera RGB generation and conditional LiDAR synthesis, and is distilled toward few-step inference for efficient deployment. Experiments evaluate visual quality, control fidelity, cross-view consistency, robustness under repeated generation, inference efficiency, and LiDAR synthesis. Together, HelloWorld provides a unified framework for scalable driving data generation and interactive simulation.
著者のコメント
website: https://helloworld-4d.github.io
arXiv ID: 2609.28931 / 要約の誤りについて