AIの情報漏えいを最終回答だけで評価すると何を見逃すか
ASLEval: Measuring Privacy Exposure Displacement in LLM Agent Sessions
この論文をやさしく読む
ひとことで言うと
AIから情報が外へ出たかを調べるとき、最終回答だけでなく、宣言したすべての出力経路を同じ基準で確認する評価方法です。
何に役立つ?
業務エージェントのプライバシー評価で、漏えいの見逃しや攻撃成功の過大申告を減らすための設計に役立ちます。
この研究の面白いところ
内部で情報を扱ったことと、可視の出口に無許可で露出したことを分け、業務を完了できるかも同時に測ります。
どこまで分かった?
46.9%は評価した環境で、可視出口全体から把握した露出に対する見逃し割合です。宣言していない経路まで検出したという結果ではなく、人手でも判定の難しい例が残っています。
v2のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
ツールを使うLLMエージェントのプライバシー評価では、指定された動作、最終回答、攻撃者の報告が検査対象になることが多い。こうした局所的な代理指標は、複数段階のセッションの別の場所で起きる無許可の露出を見逃し得るうえ、出力先、報告、ツール経路を通じた共通の正解基準を持たない。本研究では、局所的な評価指標と、対象に基づくセッション全体の露出との食い違いを「プライバシー露出のずれ」として導入する。また、非公開の対象集合を事前登録し、宣言されたすべての可視の出口を測定し、内部トレースは診断用に限定する、認可を考慮した枠組みASLEvalを提案する。 複数の企業業務型環境と独立に実装された実行基盤で、3つの反復的なパターンが見られた。想定した出力先だけを見ると、可視出口の和集合から把握される露出の46.9%を見逃す。攻撃者の自己申告には、見落としと高い誤検出が共存する。また、スキーマに整合する内部の証拠は、リクエスト・プローブの単位で見ると、通常は可視の露出に先行する。モデルに見せる返り値を減らすとこの経路は変わるが、通常業務の成功を失わせることもある。独立した人手のレビューは判定手順を支持する一方、コンソール出力や候補の判定には難しい例があると特定した。以上は、可視範囲全体の境界を明示し、事前に定めた対象と認可に基づいて主張を判断し、プライバシーと業務上の有用性を併せて報告するベンチマークの必要性を示す。
v2の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-16(UTC)
- 最新改訂
- 2026-09-18 · v2
- 査読・掲載
- 査読状況未確認
更新履歴
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Privacy evaluations of tool-using LLM agents often inspect a designated action, final response, or attacker report. These local proxies can miss unauthorized exposure elsewhere in a multi-step session and lack common ground truth across outlets, reports, and tool paths. We introduce privacy exposure displacement, the mismatch between a local evaluation proxy and target-grounded session exposure, and ASLEval, an authorization-aware framework that pre-registers a hidden target set, measures all declared visible exits, and reserves internal traces for diagnosis. Across multiple enterprise-style environments and independently implemented runtimes, we observe three recurring patterns. An expected-outlet-only view misses 46.9% of exposure recovered by the visible-exit union; attacker self-reports combine omissions with high false discovery; and schema-aligned internal evidence usually precedes visible exposure at the request/probe level. Reducing model-visible returns changes this path but can eliminate normal-task success. Independent human review supports the adjudication pipeline while identifying harder console and candidate cases. These findings motivate benchmarks that declare the complete visible boundary, ground claims in pre-specified targets and authorization, and report privacy together with task utility.
著者のコメント
13 pages, 3 figures; includes appendix
arXiv ID: 2609.18864 / 要約の誤りについて