arXiv論文メモ
新着一覧
cs.LG / cs.CV · 査読状況未確認

視覚言語モデルで残す知識を保ちながら個人情報を忘れさせる

SIEVE: Selective attention-value Suppression for Vision-Language Models Unlearning

Si Qi Goh, Cap Dang Xuan Kiet, Tat-Jen Cham, Kwok-Yan Lam

この論文をやさしく読む

ひとことで言うと

同じ人物に関する情報のうち、消したい知識と残したい知識を分け、視覚言語モデルの内部表現と出力の両方を調整する方法です。

何に役立つ?

個人情報を選択的に除去しつつ、許可された知識に答える能力を保つためのモデル編集に使うことが考えられます。

この研究の面白いところ

忘却対象の注意バリューはゼロへ近づけ、保持対象のバリューは元の参照モデルへ近づけるという、反対向きの制約を同時に使っています。

どこまで分かった?

要旨は複数設定での比較結果を述べますが、モデル名、データ規模、具体的な忘却率はありません。個人情報の完全な消去や、任意の質問からの再抽出防止を保証したとは記載されていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

視覚言語モデル(VLM)は、見た目による人物の識別と経歴情報を結び付けられる。このため、同じ人物について保持が認められる知識を保ちながら、個人を特定できる情報(PII)を選択的に忘れさせる必要がある。この設定は難しい。機微情報と保持すべき情報が、同じ視覚入力や中間表現を共有し得るためである。 本研究では、選択的なVLMのアンラーニングを行う、単純かつ有効な枠組みSIEVEを提案する。SIEVEはモデルの出力を制御するとともに、注意機構のバリュー表現を直接正則化する。忘却対象の例のバリューを定数ゼロへ向けて抑制しつつ、保持対象の例の表現は、固定した参照モデルと一致させることで保存する。これらの目的を、系列単位の忘却および保持の教師信号と組み合わせることで、保持すべき知識に大きく影響せず、対象を絞った忘却を可能にする。 広範な実験では、SIEVEは複数のモデルとモダリティの設定で、保持対象に対する有用性を競争力のある水準に維持しながら、アンラーニングで最先端の性能を達成する。要素を取り除く比較実験では、バリューの抑制と負の交差エントロピーが相補的な忘却信号を与え、参照モデルに基づくバリューの一致が有用性の低下を大きく抑えることも示す。これらの結果は、機微な知識と保持すべき知識が密接に関係する場合、注意機構のバリューが選択的なマルチモーダル忘却の有効な介入点となることを示している。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-10-01(UTC)
最新改訂
2026-10-01 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

The ability of vision-language models (VLMs) to associate visual identities with biographical information creates a need for selective unlearning of personally identifiable information (PII) while preserving permitted knowledge about the same individual. This setting is challenging because both sensitive and retained information can share the same visual inputs and intermediate representations. We introduce SIEVE, a simple and effective framework for selective VLM unlearning. SIEVE directly regularizes attention-value representations while also controlling model outputs. SIEVE suppresses attention values for forget examples toward a constant zero, while preserving retain-example representations by matching them to a frozen reference model. These objectives are combined with sequence-level forget and retain supervision, enabling targeted forgetting without largely affecting retained knowledge. Extensive experiments show that SIEVE achieves state-of-the-art performance on unlearning with multiple model-modality settings, while maintaining competitive retained utility. Ablation studies further show that value suppression and negative cross-entropy contribute complementary forgetting signals, while reference-based value matching substantially reduces utility degradation. These results demonstrate that attention values provide an effective intervention point for selective multimodal unlearning when sensitive and retained knowledge are closely related.

arXiv ID: 2610.01962 / 要約の誤りについて