arXiv論文メモ
新着一覧
cs.CR / cs.AI · 査読状況未確認

AIエージェントから実際に取り出せる個人情報を評価

CIPL: A Channel-Aware Framework for Recoverable Privacy Leakage in LLM Agents

Tao Huang, Guosen Wu, Guolong Zheng, Jiayang Meng, Chen Hou, Xu Yang, Xuechao Yang, Feng Xia

この論文をやさしく読む

ひとことで言うと

AIが内部で秘密を参照したかだけでなく、外から見える応答などを通じて、その秘密をどこまで取り出せるかを評価する研究です。

何に役立つ?

エージェントのメモリ、検索、ツール利用を共通の観点で比較し、どの観測経路で情報が漏れるかを調べるのに役立ちます。保存場所の分類だけでは分からない漏えいを捉える狙いがあります。

この研究の面白いところ

漏えいを情報源から抽出までの段階に分けています。文字列の完全一致では検出できない、意味として有用な情報開示も監査対象にしています。

どこまで分かった?

複数の処理系とBrowserUseの事例を評価した結果です。漏えいの程度は観測面や検索条件、提供事業者の挙動に依存し、要旨にはすべてのエージェントに対する保証や個別の数値は示されていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

LLMエージェントのプライバシー漏えいは、一般にメモリ、検索、ツール利用の処理系など、個々の構成要素の内部で評価される。そのため、内部で情報が露出することと、外部の観測者が実際に復元できる情報とを区別しにくい。本研究では、LLMエージェントのブラックボックス型プライバシー漏えいを対象に、情報の伝達経路を考慮した評価枠組みCIPL(Channel Inversion for Privacy Leakage)を提示する。CIPLは評価対象を、機微情報の情報源、選択、組み立て、実行、観測、抽出という段階で表現し、選択された機微情報の単位から、攻撃者が復元可能な出力に至る過程を共通の手順で評価する。 メモリ型、検索を介する型、ツールを介する型の対象での実験と、BrowserUseの稼働エージェントを用いた事例研究から、保存時のラベルだけでは復元可能性が決まらないことを示す。メモリ型の対象は復元がほぼ飽和した参照事例となり、検索を介した漏えいは部分的であることが多い。一方、ツールを介する漏えいと稼働エージェントの漏えいは、観測できる面、プロンプトと伝達経路の適合、検索の深さ、提供事業者の挙動に強く左右される。さらに、層別の意味内容監査によって、標準的な完全一致判定が見逃す、攻撃者に有用な情報開示を特定する。したがってCIPLは、異なるエージェント処理系において、内部で機微情報に依存することが、外部で復元可能な漏えいとしてどのように現れるかを比較するための共通の枠組みを提供する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-18(UTC)
最新改訂
2026-09-18 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Privacy leakage in LLM agents is commonly evaluated within individual components such as memory, retrieval, or tool-use pipelines, which makes it difficult to distinguish internal exposure from information that an external observer can actually recover. We present CIPL (Channel Inversion for Privacy Leakage), a channel-aware evaluation framework for black-box privacy leakage in LLM agents. CIPL represents a target through sensitive source, selection, assembly, execution, observation, and extraction stages and evaluates the transition from selected sensitive units to attacker-recoverable output under a shared protocol. Experiments across memory-based, retrieval-mediated, and tool-mediated targets, together with a BrowserUse live-agent case study, show that storage labels alone do not determine recoverability. Memory targets form a near-saturated reference case, retrieval-mediated leakage is frequently partial, and tool-mediated and live-agent leakage varies strongly with observation surface, prompt-to-channel alignment, retrieval depth, and provider behavior. A stratified semantic audit further identifies attacker-useful disclosures that canonical exact matching misses. CIPL therefore provides a common framework for comparing how internal sensitive dependence is realized as externally recoverable leakage across heterogeneous agent pipelines.

著者のコメント

58 pages, 4 figures; includes appendix

arXiv ID: 2609.21686 / 要約の誤りについて