arXiv論文メモ
新着一覧
cs.CR · 査読状況未確認

追加学習で言語モデルの潜在的な個人情報が再び現れる

Sleeping Secrets: How Fine-Tuning Reawakens Privacy Risks in Language Models

Jianhong Li, Jiahao Chen, Yuwen Pu, Chunyi Zhou, Oubo Ma, Zhou Feng, Hangtao Zhang, Jichao Bi, Chunqiang Hu

この論文をやさしく読む

ひとことで言うと

直接質問して出なくなった個人情報でも、追加学習後には取り出せるようになる場合があると検証した研究です。

何に役立つ?

モデルのプライバシー評価で、現在の応答だけでなく、その後の適応で情報が再び出る可能性を考える材料になります。

この研究の面白いところ

対象情報に接したことのあるモデルと、接していないモデルに同じアダプターを適用し、過去の学習経験の影響を切り分けています。

どこまで分かった?

結果は列挙された6モデルでの評価です。情報が直接出ないことを忘却と同一視できない一方、あらゆるモデルや個人情報が回復できると示したものでもありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

大規模言語モデル(LLM)の追加学習は、専門用途への適応に加え、直接の質問では取り出せなくなった個人情報を回復させ得ることが近年示されている。ただし、従来の追加学習による回復攻撃では、同じ分布、すなわち以前の学習データ集合から得た、本物の個人情報を教師データとして必要とする。本研究では、こうした現実的でない知識がなくても回復は可能だと論じる。LLMが生成した候補が、以前に学習された個人情報の対応関係を回復するための十分な教師信号になり得ることを示す。 これに基づき、タスクの構造を使って個人情報の対応関係を回復し、回答トークンの尤度で候補を選別し、低ランク適応によって対象モデルを更新する、データ不要の攻撃ReGapを提案する。ReGapは、対象の答えも、補助的な本物の個人情報教師データも必要としない。GPT-2、OPT、Qwen3の6モデルで、学習後の対象モデルに比べ、対象の対応関係の回復率を6~21パーセントポイント改善する。適応に使う人物IDが、記憶された全IDおよび評価用の全IDと重ならず、生成・選別した教師データに対象の正確な答えが一つも含まれない場合でも、大きな回復が残る。 さらに、同じ学習済みアダプターは、対象情報に以前接したチェックポイントでは回復率を42%から63%へ高めるが、対象に一度も接していない対応するチェックポイントでは改善を生まない。この対比は、観測された回復を適応だけでは説明できず、対象への過去の接触が適応後の回復可能性に強く影響することを示す。知見は、日常的なモデルのカスタマイズが潜在的なプライバシーリスクを再び表面化させ得ることを示し、学術界と産業界の早急な注意を促す。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-10-01(UTC)
最新改訂
2026-10-01 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Beyond adapting Large Language Models (LLMs) to specialized applications, fine-tuning has recently been shown to recover private information that is no longer accessible through direct queries. Previous fine-tuning recovery attacks, however, require genuine private supervision drawn from the same distribution, i.e., the previous training dataset. We argue that such recovery remains possible without such impractical knowledge. We show that LLM-generated candidates can provide sufficient supervision to recover previously learned private associations. Based on this, we propose ReGap, a data-free attack that recovers private associations using task structure, filters them by answer-token likelihood, and updates the target model via low-rank adaptation. Specifically, ReGap requires neither target answers nor auxiliary genuine private supervision. Across six GPT-2, OPT, and Qwen3 models, ReGap improves target-association recovery by 6-21 percentage points over the post-training target model. Recovery remains substantial even when the adaptation identities are disjoint from all memorized and evaluation identities, with no exact target answers appearing in the generated or selected supervision. Moreover, the same trained adapters increase recovery from 42\% to 63\% on a previously exposed checkpoint, but produce no gain on a matched checkpoint that never encountered the targets. This contrast shows that adaptation alone is insufficient to explain the observed recovery and that prior target exposure strongly affects post-adaptation recoverability. Our findings highlight that routine model customization can reawaken latent privacy risks, warranting urgent attention from the academic and industrial communities.

著者のコメント

34 pages

arXiv ID: 2610.01365 / 要約の誤りについて