arXiv論文メモ
新着一覧
cs.CV · 査読状況未確認

画像の作風を移しつつ元画像の内容の混入を抑える

SafeStyle: Calibrated Style Residual Injection for Controllable Style-Leakage Trade-off in Diffusion Stylization

Zhangping Yang, Min Li, Song Yan, Rong Gao, Xinliang Bi, Guanye Xiong, Yujie He

この論文をやさしく読む

ひとことで言うと

参考画像の雰囲気は取り入れたいが、その画像に写った物まで生成画像に混ざってほしくないという問題に取り組んでいます。作風の情報を選び、その強さも制限します。

何に役立つ?

考えられる用途は、文章で指定した被写体を保ちながら参照画像の作風を使う画像制作です。追加学習を行わない方式ですが、作風と内容を見分けるための較正用集合は利用します。

この研究の面白いところ

作風と内容を完全に切り離そうとせず、有益な重なりを残す点が特徴です。質感と形状の違いに合わせた空間粒度と、残差の強さの制約を組み合わせています。

どこまで分かった?

0.8%という混入率と0.474という類似度は、意味内容を分離した特定のストレステストでの値です。あらゆる参照画像での混入防止を保証する数値ではなく、要旨には評価集合の規模や追加の限界は記載されていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

参照画像を使う拡散モデルのスタイル変換は、テキストプロンプトが指定する意味内容を保ちながら、参照画像の視覚的な作風を移すことを目的とする。しかし、画像による条件付けでは、移せる作風の手掛かりと参照画像固有の内容が絡み合いやすく、本質的なトレードオフが生じる。条件付けを強くすると作風への忠実度が上がる一方、内容の混入も増える。逆に、強く抑制すると混入は減るが、作風の表現が損なわれる。この課題は、質感が支配的な作風と形状が支配的な作風で空間的な構成が異なることによって、さらに複雑になる。 これらに対処するため、重みを固定した拡散モデルに、較正したスタイル残差を注入する追加学習不要の枠組みSafeStyleを提案する。まず、小規模な較正用集合から、作風を支える部分空間と内容に関連する部分空間を推定する。有用な重なりを保持しながら、役に立たない内容の変動を抑える。その後、純化した作風の情報を適応的な空間粒度で伝達し、明示的な残差ノルムの予算によって実効的な影響を制限する。 質感主体と形状主体の作風にまたがる実験で、SafeStyleはテキストとの整合性を競争力のある水準に保ちながら、DINOによる作風類似度0.432を達成した。意味内容が重ならないようにした混入のストレステスト用ベンチマークでは、意味内容の混入をわずか0.8%に抑えつつ、DINO作風類似度0.474を達成し、作風への忠実度と参照画像の内容抑制の有効な両立を示した。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-18(UTC)
最新改訂
2026-09-18 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Reference-guided diffusion stylization aims to transfer visual style from a reference image while preserving the semantics specified by a text prompt. However, image conditioning often entangles transferable style cues with reference-specific content, leading to an inherent trade-off: stronger conditioning improves style fidelity but increases content leakage, whereas aggressive suppression reduces leakage at the cost of style expression. This challenge is further complicated by the distinct spatial organization of texture- and geometry-dominant styles. To address these issues, we propose SafeStyle, a training-free framework for calibrated style residual injection in frozen diffusion models. SafeStyle first estimates style-supported and content-associated subspaces from compact calibration sets, preserving their informative overlap while suppressing useless content variations. It then transports the purified style evidence over adaptive spatial granularity and constrains its effective influence through an explicit residual-norm budget. Experiments across texture- and geometry-dominant styles show that SafeStyle achieves a DINO style similarity of 0.432 while maintaining competitive text alignment. On a semantically disjoint leakage-stress benchmark, it further achieves a DINO style similarity of 0.474 with only 0.8\% semantic leakage, demonstrating an effective balance between style fidelity and reference-content suppression.

著者のコメント

5pages, 6figures

arXiv ID: 2609.21242 / 要約の誤りについて