過去の行動を記憶して運転軌跡を予測するFIVE-VLA
FIVE-VLA: Fast and EffectIVE Autonomous Driving with Recurrent Action Memory
この論文をやさしく読む
ひとことで言うと
画像から運転軌跡を予測するモデルを軽くし、直前の行動も参照させることで、速度と時間的な判断の両方を改善する研究です。
何に役立つ?
考えられる用途は、計算資源に制約のある運転システムでの軌跡予測です。要旨ではベンチマークとシミュレーションで性能を評価しています。
この研究の面白いところ
画像のトークン数削減とテキスト生成の省略に加えて、小さな行動記憶を使う点が特徴です。T4とA100のそれぞれで動作速度を報告しています。
どこまで分かった?
実世界データを使う評価も開ループシミュレーションであり、公道で安全性を実証したという記載はありません。T4はエッジ機器の代替で、実際の車載機器の結果とは区別が必要です。約10%という完走数の増加を10ポイントの改善と読み替えることはできません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
自動運転向けの最先端の視覚・言語・行動モデル(VLA)には、過大なパラメータ数、高解像度画像の非効率な処理、時間的な記憶の欠如という重大な制約がある。本研究では、2つの主要な貢献によってこれらに対処するFast and EffectIVE VLA(FIVE-VLA)を導入する。 第1に、高解像度(448 × 896)画像を処理しながら生成するトークン数をわずか98個に抑える効率的な視覚エンコーダーを用いる。これは既存手法の5分の1未満であり、テキスト生成を完全に省いて1回の処理で軌跡を予測する。第2に、以前の行動トークンを条件として行動を予測する軽量なRecurrent Action Memory(RAM)を提案する。これにより、追い越しや緊急制動などの操作に重要な時間的文脈を与える。 FIVE-VLAはわずか6億4100万パラメータで、難度の高い閉ループ運転ベンチマークBench2Driveにおいて、従来最高性能のVLAより約10%多くの経路を交通規則違反なしに完走する。大規模な実世界データであるNVIDIA Physical AI AVデータセットを使った、周囲が反応しない開ループシミュレーションでは、SimLingoに比べ、単一視点と4視点の設定で衝突違反率がそれぞれ10.2%と7.7%低い。さらに、A100で約30 fps、エッジ機器の代替として用いたT4 GPUで約4 fpsで動作し、従来手法に比べ8~30倍の高速化を実現する。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-16(UTC)
- 最新改訂
- 2026-09-16 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-16 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
State-of-the-art vision-language-action models (VLA) for autonomous driving face critical limitations: excessive parameter counts, inefficient high-resolution image processing, and lack of temporal memory. We introduce Fast and EffectIVE VLA (FIVE-VLA) to address these through two key contributions. First, we employ an efficient vision encoder that processes high-resolution ($448 \times 896$) images while generating only 98 tokens, over $5\times$ fewer than existing approaches, and bypass text generation entirely for single-pass trajectory prediction. Second, we propose Recurrent Action Memory (RAM), a lightweight module that conditions action prediction on previous action tokens, providing temporal context critical for manoeuvres such as overtaking and emergency braking. With only 641M parameters, FIVE-VLA completes $\sim$10% more routes without traffic rule infractions than the previous state-of-the-art VLA on the challenging Bench2Drive closed-loop driving benchmark. Non-reactive open-loop simulation on the large-scale real-world NVIDIA Physical AI AV dataset shows 10.2% and 7.7% lower collision-violation rates than SimLingo in single- and four-view settings, respectively. Additionally, FIVE-VLA runs at $\sim$30 fps on an A100 and $\sim$4 fps on a T4 GPU (proxy to an edge device), representing an 8-30$\times$ speedup over previous methods.
arXiv ID: 2609.18623 / 要約の誤りについて