arXiv論文メモ
新着一覧
cs.CR / cs.CV · 査読状況未確認

二つのLoRAを組み合わせた時だけ起動する画像生成モデル攻撃

LoRango: It Takes Two LoRAs to Unlock Hidden Behaviors in Diffusion Models

Jin Wei, Rundong Li, Ruihao Yang, Yikai Wang, Xiaoyuan Duan, Jianxiong Wu, Yanbo Wang, Chang Xu, Lingyun Zhang, Zhuyang Yu, Ping Chen, Jun Dai, and Xiaoyan Sun

この論文をやさしく読む

ひとことで言うと

画像生成で二つのLoRAを同時に読み込んだときだけ隠れた動作が現れる攻撃を調べた。

何に役立つ?

複数のLoRAを組み合わせて使うサービスで、個別の検査に加えて組み合わせを監査する必要性を判断する資料になる。

この研究の面白いところ

単独ではほぼ打ち消される信号が、対応する二つのアダプターを組み合わせると現れ、攻撃成功率が大きく変わった。

どこまで分かった?

報告された成功率はSD v1.5とSDXLでの実験に関する。すべての画像生成モデルで同じ成功率になるとは示していない。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

利用者は画像に異なる対象、画風、視覚的属性を与えるため、複数の低ランク適応(LoRA)アダプターを組み合わせることが多い。しかしアダプターを一つずつ調べるだけでは、組み合わせた際の安全性は分からない。著者らは、テキストから画像を作る拡散モデルに対し、個別には有用で無害に見えるアダプターが、特定の相手と同時に読み込まれた場合だけ画像生成を別の方向へ誘導する、組み合わせ条件付きの攻撃を特定して特徴付ける。この攻撃を実現するLoRangoでは、相補的なSignatureとPayloadの二つのアダプターを使う。Signatureは中間の表現に組み合わせ固有の符号を書き込み、Payloadはその符号を選択的に読む応答と、互いに反対に働く信号枝と参照枝を使う。アダプターを単独で使う場合や組み合わせが合わない場合には両枝がほぼ打ち消し合うが、対応する符号と読み取り側が一致すると、標準のGEGLUブロック内で相殺が破れ、仕込んだ動作が現れる。両アダプターは通常の静的なLoRAファイルとして書き出され、標準的な読み込み機構に対応し、プロンプト内の引き金や基本パイプラインの変更は要らない。対応する組み合わせでの攻撃成功率はSD v1.5で97.9%、SDXLで98.7%で、仕込んだアダプターを個別に読み込む場合は2.8~4.6%だった。さらに組み合わせの選択性、単独での忠実度、運用条件の違いに対する頑健性、異なるノイズ除去器構造への適用を評価した。結果は、複数LoRAによる画像の個人化の安全性を評価するには個々のアダプターの検査だけでは足りず、組み合わせを監査する必要があることを示す。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-22(UTC)
最新改訂
2026-09-22 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Users commonly combine multiple Low-Rank Adaptation (LoRA) adapters to personalize images with different subjects, styles, and visual attributes. Yet inspecting adapters individually does not establish the safety of their composition. We identify and characterize a pair-conditioned attack in text-to-image diffusion: individually useful and benign-appearing adapters redirect image generation when co-loaded with a specifically matched partner, whose identity serves as the trigger. We introduce LoRango to realize this attack through complementary Signature and Payload adapters. The Signature writes a pair-specific code into intermediate carrier representations, while the Payload uses code-selective responses and opposing signal/reference branches. These branches approximately cancel for standalone adapters and mismatched pairs; matched code-reader alignment breaks cancellation within native GEGLU blocks and releases the programmed action. Both adapters are exported as ordinary static LoRA files compatible with standard loaders, requiring no prompt trigger or base-pipeline modification. LoRango achieves matched-pair attack success rates of 97.9\% on SD v1.5 and 98.7\% on SDXL, compared with 2.8--4.6\% when implanted adapters are loaded individually. Further experiments evaluate pair selectivity, standalone fidelity, robustness to deployment variations, and applicability across denoiser architectures. These findings show that individual-adapter inspection is insufficient to assess the security of multi-LoRA personalization and motivate auditing adapter compositions.

arXiv ID: 2609.25884 / 要約の誤りについて