arXiv論文メモ
新着一覧
cs.CR / cs.AI · 査読状況未確認

AIエージェントの脅威と評価研究の偏りを整理

Connecting the Dots in Agentic AI Security: A Cross-Dimensional Threat Taxonomy, Evaluation Maturity, and Open Challenges

Heewon Baek, Alsharif Abuadbba, Kristen Moore, Hyoungshick Kim, Surya Nepal

この論文をやさしく読む

ひとことで言うと

AIエージェントへの攻撃を、侵入口だけでなく、信頼境界・被害・システム構成とのつながりで分類した文献レビューです。

何に役立つ?

安全性評価を計画するとき、どの構成や相互作用を検証するか、比較に必要な記録がそろっているかを整理する材料になります。

この研究の面白いところ

知られている脅威の一覧と、実験で検証された脅威の範囲を分けています。66件のレビューに加え、実装などの成果物がある研究とベンチマークを具体的に分析しています。

どこまで分かった?

網羅範囲の偏りは選定文献の中での結果です。人間との相互作用や複数エージェントの研究が分野全体に存在しないと結論付けるものではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

エージェント型AIでは、LLMの安全性の問題が、生成内容だけでなく、持続的な状態、自律的な行動、ツール利用、人間や他のエージェントとの相互作用へ広がる。既存の脅威分類は個々の側面を重視することが多く、侵入口、影響を受ける構成要素、安全性への帰結の間のつながりを見えにくくしている。また、知られている脅威の全体像と、実証研究で実際に扱われた範囲も異なる。 2022~2026年に公開された66件の研究を構造化してレビューし、T={S,B,P,A}という、複数の側面を横断する表現を導入する。これは、影響を受ける機能・システム上の対象面S、相互作用または信頼の境界B、侵害される安全性の性質P、実証的に調べられたアーキテクチャAを結び付けるものである。成果物に裏付けられた22件のレッドチーミング研究と、代表的な11件の安全性ベンチマークを分析し、実証的な網羅範囲と評価の成熟度を整理する。 選定した研究では、証拠は主に単一エージェント環境におけるプロンプト・推論、メモリ、ツールを介した攻撃に集中している。持続的な脅威、人間とエージェントの相互作用、複雑な複数エージェント、システム全体、長期にわたる脅威の扱いは少ない。これらの知見は選定した文献集合を記述するものであり、実証研究全体での空白を確定するものではない。指標の不統一、適応的な防御評価の不足、アーキテクチャの偏り、実行状態の不完全な記録が、比較と再現性をさらに制約する。より体系的で、アーキテクチャを考慮し、再現可能なエージェント型AIの安全性評価を導くため、13の未解決研究課題を導出する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-20(UTC)
最新改訂
2026-09-20 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Agentic AI extends LLM security beyond generated content to persistent state, autonomous actions, tool use, and interactions with humans and other agents. Existing threat classifications often emphasize individual dimensions, obscuring connections among entry points, affected components, and security consequences. The known threat landscape also differs from the coverage demonstrated by empirical research. Through a structured review of 66 studies published from 2022 to 2026, we introduce T={S, B, P, A}, a cross-dimensional representation linking affected functional or system surfaces {S}, interaction or trust boundaries {B}, violated security properties {P}, and empirically examined architectures {A}. We analyze 22 artifact-backed red-teaming studies and 11 representative security benchmarks to characterize empirical coverage and evaluation maturity. Within the selected studies, evidence concentrates on prompt/reasoning, memory, and tool-mediated attacks, predominantly in single-agent settings. Persistent, Human--Agent, complex multi-agent, systemic, and long-horizon threats receive less coverage. These findings describe the selected corpus rather than establish gaps across all empirical research. Heterogeneous metrics, limited adaptive defense evaluation, architectural imbalance, and incomplete execution-state capture further constrain comparison and reproducibility. We derive 13 open research questions to guide more systematic, architecture-aware, and reproducible security evaluation of agentic AI.

著者のコメント

22 pages

arXiv ID: 2609.23894 / 要約の誤りについて