arXiv論文メモ
新着一覧
cs.CV / cs.LG · 査読状況未確認

写真から居場所を推測されにくくする拡散モデル防御

Hiding in Plain Sight: A Diffusion-based Mitigation of Geolocation Privacy Leakage in Vision-Language Models

Yining Wang, Xi Li, Mi Zhang, Xiaohan Zhang, Xiaoyu You, Zhenxing Qian, Mi Wen

この論文をやさしく読む

ひとことで言うと

写真の見た目を保ちつつ、AIが撮影場所を推測するための手掛かりを変える防御方法です。画像の画素だけでなく、拡散モデル内部の意味表現を操作します。

何に役立つ?

考えられる用途は、SNSへ投稿する前に写真の位置情報漏えいを抑える処理です。投稿サービスへの統合は提案の方向性であり、実際のサービス導入実績は要旨にありません。

この研究の面白いところ

GPSと画像の関係を学んだGeoCLIPを使い、位置推定に関係する情報を狙って変えます。モデルの拒否に頼る防御と画像自体を加工する防御の問題をつなげて検討しています。

どこまで分かった?

100%という数値は特定の脱獄プロンプトによる応答率で、位置推定の正解率ではありません。要旨には防御後の位置推定誤差や対象モデル別の数値はなく、完全な位置秘匿の保証とは読み取れません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

マルチモーダル大規模推論モデル(MLRM)は、複雑な視覚理解で優れた能力を示してきた。しかし、その能力自体が重大でありながら十分に研究されていないプライバシー上の脅威を生む。攻撃者は、建築様式、植生、照明条件などの微妙な視覚的手掛かりを構造的に推論させることで、気軽に共有された写真から利用者の地理的位置を正確に推測するためにMLRMを悪用できる。本研究では、MLRMによる位置情報プライバシー漏えいを体系的に調べる。まず、慎重に作られた脱獄プロンプトによりモデルの応答率が100%に達し得ることを示し、拒否に基づく安全策が著しく不十分であることを明らかにする。さらに、共有画像へ知覚しにくい摂動を加える既存の防御には、画素空間での最適化に固有の構造的限界があり、ブラックボックス対象への転移性の低下と顕著な視覚的アーティファクトにつながることを特定する。 これらの知見を踏まえ、位置情報プライバシーの漏えいに対し、対象を絞った予防的防御を行う拡散モデルに基づく枠組みを提案する。逆サンプリング中に拡散モデルの潜在空間へ摂動を加え、高水準の意味表現を直接操作することで、有効性と有用性の間のボトルネックを構造的に解消する。さらに、GPS座標と明示的に対応付けられたモデルGeoCLIPを代理モデルとして最適化の基礎に据え、MLRMが位置推定に利用する地理的信号を特定して乱す。この標的を絞った意味的撹乱により、知覚的な画質を維持しつつ、ブラックボックス対象への転移性が大幅に高まり、ソーシャルメディア基盤への円滑な統合が可能になる。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-18(UTC)
最新改訂
2026-09-18 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Multimodal large reasoning models (MLRMs) have demonstrated remarkable capabilities in complex visual understanding. However, this very power introduces a critical yet underexplored privacy threat: adversaries can exploit MLRMs to precisely infer users' geographic locations from casually shared photographs, by performing structured reasoning over subtle visual cues such as architectural styles, vegetation, and lighting conditions. In this work, we present a systematic study of MLRM-driven geolocation privacy leakage. We first reveal that refusal-based safeguards are critically insufficient, as carefully crafted jailbreak prompts can raise model response rates to 100%. We further identify that existing defenses, which inject imperceptible perturbations into shared images, suffer from structural limitations intrinsic to their pixel-space optimization, resulting in degraded black-box transferability and pronounced visual artifacts. Motivated by these findings, we propose a diffusion-based framework that provides targeted, proactive defense against geolocation privacy leakage. By injecting perturbations into the latent space of a diffusion model during reverse sampling, our method operates directly on high-level semantic representations, thereby resolving the effectiveness-utility bottlenecks by construction. We further ground our optimization with GeoCLIP, a model explicitly aligned with GPS coordinates, as a surrogate to pinpoint and disrupt the geographic signals that MLRMs exploit for location inference. This targeted semantic disruption yields significantly stronger black-box transferability while preserving perceptual image quality, offering a seamless integration on social media platforms.

著者のコメント

NDSS 2027

arXiv ID: 2609.21363 / 要約の誤りについて