arXiv論文メモ
新着一覧
cs.RO · 査読状況未確認

写真に近い閉ループ環境で自動運転方策の安全性を比較

NavSafe-$\infty$: Benchmarking Closed-Loop Driving Safety in Photorealistic Environments

Yuxin Bao, Hongwei Ruan, Luobin Wang, Seth Z. Zhao, Ziyang Leng, Zihan Zhang, Yu Zeng, Rowan McAllister, Henrik Christensen, Bolei Zhou

この論文をやさしく読む

ひとことで言うと

記録済みの場面でよい運転判断を出すだけでなく、その判断で状況が変わり続ける環境でも安全に走れるかを評価する研究です。

何に役立つ?

自動運転方策の評価で、誤差の累積や回復、周囲との相互作用を点検するためのベンチマークになります。

この研究の面白いところ

同じように見える性能改善でも、実際に判断を繰り返すと安全余裕を削る方向へ進む場合を示しています。事象を28種類に分け、失敗の種類を診断できる設計です。

どこまで分かった?

写実的な閉ループ評価環境での結果であり、公道走行での事故率の測定ではありません。公開と維持は要旨では今後の予定として述べられており、公開済みと断定できません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

エンドツーエンド(E2E)の運転方策は、開ループ(OL)ベンチマークで急速に進歩してきた。しかし開ループ評価では、誤差が積み重なっても耐えられるか、失敗から回復できるか、周囲の交通参加者と安全に相互作用できるかは分からない。本研究では、28種類の事象にまたがる280シナリオからなる、写実的な閉ループ(CL)ベンチマークNavSafe-∞を導入する。各シナリオの成功・失敗条件は構造化した交通安全分類の中で定義され、交通衝突、交通弱者との衝突、交通違反、交通上のインシデントの各カテゴリーの能力スコアが得られる。 20種類のE2E方策を評価したところ、開ループでの改善が閉ループの安全性へ確実に移るわけではなかった。一般的な2つの対策をさらに解析すると、受動的なデモンストレーションへの摂動は、閉ループ実行が摂動を加えた学習状態の近くにとどまる場合に主として役立つことが分かった。また、開ループの強化学習による微調整は、自車の前進と引き換えに安全余裕を犠牲にする報酬ハッキングを示し、閉ループのフィードバックはこれを、安全上重大な誤りの累積へ増幅した。これらの結果は、開ループの指標から閉ループで安全に成功できると判断する際の盲点を示す。今後の研究を支援するため、ベンチマークと、事象の独自作成や方策診断に使う拡張可能なツール群を、オープンソース化して維持する予定である。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-22(UTC)
最新改訂
2026-09-22 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

End-to-end (E2E) driving policies have progressed rapidly on open-loop (OL) benchmarks, yet OL evaluation cannot reveal whether a policy withstands compounding errors, recovers from failures, or interacts safely with surrounding actors. We introduce NavSafe-$\infty$, a photorealistic closed-loop (CL) benchmark of 280 scenarios spanning 28 event types, each with success and failure criteria defined within a structured traffic-safety taxonomy, which yields category-level capability scores for Traffic Crashes, Vulnerable Road User Crashes, Traffic Violations, and Traffic Incidents. Evaluating 20 E2E policies, we find that OL gains do not reliably transfer to CL safety. Analyzing two common remedies further shows that passive demonstration perturbation helps mainly when CL rollouts stay near its perturbed training states, and that OL reinforcement-learning fine-tuning exhibits reward hacking by trading safety margin for ego progress, which CL feedback amplifies into compounding safety-critical errors. Together, these results demonstrate the blind spot of OL benchmarks indicating CL safety success. The benchmark and an extensible toolbox for customizable event curation and policy diagnosis will be open-sourced and maintained to facilitate future research.

arXiv ID: 2609.26618 / 要約の誤りについて