arXiv論文メモ
新着一覧
cs.CV · 査読状況未確認

画像への微小な変更で無断の人物認識を妨げる

Anti-Persona: Disrupting Unauthorized Identity Binding and Recognition in Personalized Vision--Language Models

Abhishek Basu, Fahad Shamshad, Karthik Nandakumar

この論文をやさしく読む

ひとことで言うと

少数の写真から人物などを覚える画像対話AIに対して、画像を目立たない範囲で加工し、無断の識別を難しくする方法です。

何に役立つ?

考えられる用途は、公開する写真を、本人の同意のないモデル個人化や識別から保護することです。報告された防御効果は評価対象のモデルと質問課題での結果です。

この研究の面白いところ

1枚ごとの特徴ではなく、複数画像に共通する識別の手掛かりを集約して妨げます。質問文を変えた場合や、視覚エンコーダーが異なる場合も調べています。

どこまで分かった?

最大95.0%はすべての条件での保護率ではありません。要旨の評価対象は2種類の個人化LVLMで、あらゆる認識器や画像加工に対する保護を保証するものではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

少数事例による個人化により、大規模視覚言語モデル(LVLM)は、個人向け検索や対象を考慮した質問などに使える、ユーザー固有の視覚概念を学習できる。しかし、これはプライバシー上の危険も生む。攻撃者は少数の参照画像から対象のアイデンティティーを結び付け、その後、自然言語の質問を通じて新たな画像内でその対象を検出できる。本研究では、個人化LVLMにおける無断のアイデンティティーの結び付けと認識を防ぐ、画像単位の防御手法Anti-Personaを導入する。 中心となる着眼点は、アイデンティティーの個人化が複数の参照画像に共通する視覚特徴に依存することである。これらの特徴をアイデンティティーのプロトタイプへ集約し、視覚エンコーダー空間におけるプロトタイプとの整合を崩す、視覚的に目立たない摂動を最適化する。空間的な平滑化と低周波成分の保持によって、見た目の忠実性と画像圧縮に対する実用的な耐性をさらに高める。得られた保護は特定のプロンプトに依存せず、個人化を事前に妨げる防御と、事後的な画像保護の両方に対応する。代表的な2種類の個人化LVLMでの実験では、見た目の忠実性を維持しつつ、最大95.0%の保護率を示した。プロンプトの変更と評価対象のアイデンティティー質問課題に対して安定性を保ち、エンコーダーが一致しない条件でのブラックボックス転移も改善した。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-10-01(UTC)
最新改訂
2026-10-01 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Few-shot personalization enables large vision--language models (LVLMs) to learn user-specific visual concepts for applications such as personalized retrieval and subject-aware querying. However, it also creates a privacy risk: an adversary can bind a target identity from a few reference images and subsequently detect that identity in new images through natural-language queries. We introduce Anti-Persona, an image-level defense against unauthorized identity binding and recognition in personalized LVLMs. Our key insight is that identity personalization relies on visual features shared across multiple reference images. We aggregate these features into an identity prototype and optimize visually subtle perturbations that disrupt prototype alignment in the vision-encoder space. Spatial smoothing and low-frequency preservation further promote visual fidelity and practical resilience to image compression. The resulting protection does not depend on a specific prompt and supports both proactive anti-personalization and reactive image protection. Experiments on two representative personalized LVLMs demonstrate protection rates of up to $95.0\%$ while preserving visual fidelity. The method remains stable across prompt variations and evaluated identity-query tasks, and improves black-box transfer under encoder mismatch.

著者のコメント

Code available at https://github.com/iabh1shekbasu/anti-persona

arXiv ID: 2610.01944 / 要約の誤りについて