arXiv論文メモ
新着一覧
cs.AI / cs.CL / cs.CR · 査読状況未確認

会話の話題が変わった後のLLMによる秘密情報漏えい

PrivDrift: Auditing User-Secret Leakage Under Topic Drift in Active LLM Conversations

Luciano Maldonado

この論文をやさしく読む

ひとことで言うと

会話で伝えた秘密が、無関係な話題に移った後もLLMから引き出されるかを測った。

何に役立つ?

対話型サービスで秘密情報の扱いを点検する評価基準として使える。要旨の数値は三つのモデルと設定した対話での実験結果である。

この研究の面白いところ

話題を変えるほど安全になるとは限らず、秘密の種類や説得の強さでも漏えい率が変わった。

どこまで分かった?

1000件の制御された対話と三つのLLMで38.7〜54.6%の漏えい率を報告した。他のモデルや実際の利用状況への一般化は要旨からは分からない。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

大規模言語モデルは、利用者向けの継続的な助手、共有セッション、ツールを使う環境でますます利用されている。利用者が会話中に機密情報を明かすと、その後に無関係な話題へ移っても、後続の質問によってその情報を引き出せる可能性がある。本研究はPrivDriftという評価基準を提案し、利用者が明かした秘密が話題の移行と説得を用いた探りの後にも取り出せるかを監査する。PrivDriftには、あらかじめ設定した秘密、内容の濃い話題移行の発話、標準化された抽出質問を含む、制御された複数往復の対話1000件がある。長い文脈を扱える三つのLLMで、対話単位の複合的な漏えい率は38.7〜54.6%と高く、モデル、秘密の種類、説得の強さによって大きく変わった。試験した話題移行の範囲では、話題をさらに変えても漏えいは安定して減らなかった。この結果は、進行中のLLM対話におけるプライバシーリスクを、学習データの記憶や直後の脱獄行為だけでなく、持続する行動上の失敗として評価すべきことを示唆する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-24(UTC)
最新改訂
2026-09-24 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Large language models increasingly operate as persistent assistants in user-facing, shared-session, and tool-augmented settings. When users disclose sensitive information during an active conversation, that information may remain behaviorally recoverable through later prompts even after the dialogue shifts to unrelated topics. We introduce \textbf{PrivDrift}, a benchmark for auditing whether user-disclosed secrets remain recoverable after conversational topic drift and persuasion-based probing. PrivDrift contains 1{,}000 controlled multi-turn dialogues with seeded secrets, content-dense drift turns, and standardized extraction probes. Across three LLMs with extended context windows, dialogue-level hybrid leakage remains substantial, ranging from 38.7\% to 54.6\%, and varies strongly by model, secret type, and persuasion intensity. Within the tested drift window, additional topic drift does not reliably reduce leakage, suggesting that privacy risk in active LLM contexts should be evaluated as a persistent behavioral failure mode rather than only as training-data memorization or immediate jailbreak behavior.

著者のコメント

Preprint, 10 Pages, 6 figures

arXiv ID: 2609.30094 / 要約の誤りについて