arXiv論文メモ
新着一覧
cs.CL · 査読状況未確認

自動車の危険分析とリスク評価でLLMの信頼性を測る

SAFARI: An Industrial Benchmark for LLM-Assisted Hazard Analysis and Risk Assessment

Chenxi Wu, Zimu Wang, Haiyang Zhang, Wei Wang, Zhijie Xu

この論文をやさしく読む

ひとことで言うと

自動車の危険分析とリスク評価をAIがどこまで行えるか、実業務由来の事例で調べます。

何に役立つ?

安全工学の支援にAIを使う際、専門家が特に確認すべき失敗箇所を見つける評価基盤になります。

この研究の面白いところ

匿名化した3,000件で九モデルを比較し、もっともらしい説明に比べてリスク分類が弱く、最良ASIL macro-F1でも0.261と示します。

どこまで分かった?

思考過程を促す方法も分類を改善せず悪化する場合があります。基準に沿う評価ベンチマークであり、AIに安全判断を任せられることを示す結果ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

大規模言語モデル(LLM)は安全性が重要な工学分野で利用が検討されるようになっているが、規制に基づく機能安全の作業工程での信頼性は十分に調べられていない。本研究では、ISO 26262に基づく自動車のハザード分析・リスクアセスメント(HARA)をLLMで支援するための、初の産業ベンチマークSAFARI(Safety-Aware Functional Automotive Risk Inference)を導入する。識別情報を除去した産業界のHARA事例3,000件を収録し、自由記述型のハザード分析と、規格に基づくリスク評価という、相互に関連する二つの課題を評価する。 自由記述型のHARA成果物を評価するため、専門家との高い相関を持ち、参照例に基づいてLLMを評価者として用いる初の手順を提案する。最先端のLLM九つを用いた実験では、モデルはもっともらしい危険シナリオを作成することが多い一方、ISO 26262のリスク分類には依然として弱く、最高のASILマクロF1でも0.261にとどまった。思考の連鎖によるプロンプトの効果は限定的で、カテゴリによるリスク評価を悪化させる場合も多い。 誤りの分析から、主要な失敗は、危険生成時にシナリオに不可欠な文脈を落とすことと、リスク評価時に制御可能性を誤って判断することに集中していると分かり、専門家の監督を重点的に置くべき箇所が示された。データセットは https://github.com/xixi47520-hash/HARA から入手できる。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-17(UTC)
最新改訂
2026-09-17 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Large language models (LLMs) are increasingly considered for safety-critical engineering, yet their reliability in regulated functional-safety workflows remains underexplored. We introduce SAFARI (Safety-Aware Functional Automotive Risk Inference), the first industrial benchmark for LLM-assisted automotive Hazard Analysis and Risk Assessment (HARA) under ISO 26262. It contains 3,000 de-identified industrial HARA cases and evaluates two coupled tasks: open-ended hazard analysis and standards-grounded risk assessment. To evaluate open-ended HARA artifacts, we propose the first reference-anchored LLM-as-a-judge protocol with high expert correlation. Experiments with nine frontier LLMs show that models often produce plausible hazard narratives but remain weak at ISO 26262 risk classification, with the best ASIL macro-F1 reaching only 0.261. Chain-of-Thought prompting provides limited benefit and often degrades categorical risk assessment. Error analysis further localizes major failures to scenario-critical context omissions during hazard generation and to controllability misjudgments during risk assessment, indicating where expert oversight should be concentrated. The dataset can be obtained from https://github.com/xixi47520-hash/HARA.

著者のコメント

Accepted at EMNLP 2026 Industry Track

arXiv ID: 2609.20584 / 要約の誤りについて