arXiv論文メモ
新着一覧
cs.CV · 査読状況未確認

文章への注意配分を変えて画像生成の訓練例再現を抑える

Rethinking Memorization Mitigation in Diffusion Models: Reinforcing Text Conditioning

Hyungjun Joo, Sehwan Kim, Hyeonggeun Han, Sangwoo Hong, Jungwoo Lee

この論文をやさしく読む

ひとことで言うと

画像生成モデルが文章中のどの情報をどれだけ参照するかを調整し、訓練画像のそっくりな再現を抑えながら指示への一致を保つ方法です。

何に役立つ?

生成画像の指示への忠実さと訓練例への類似を両方見ながら、既存モデルの推論処理を調整するための手法になります。追加学習やノイズ除去器の追加実行を必要としません。

この研究の面白いところ

文章の影響を一律に弱めるのではなく、注意の集中を緩めたうえで内容トークンを強めます。あるモデルで決めた設定を別系列のモデルへ調整なしで適用した結果も報告しています。

どこまで分かった?

パレート最前線という評価は実験した比較範囲での結果です。要旨は訓練例の再現を完全に防ぐ保証や、すべての拡散モデルで同じ効果が得られる保証を示していません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

文章から画像を生成する拡散モデルは画像合成で著しく進歩した一方、個々の訓練例を非常によく似た形で再現する記憶現象を示すことがある。有効な緩和策には、別の描写へ導くために有用なプロンプト情報を保持する必要がある。本研究では、ガウス平滑化でクロスアテンションを再配分した後、内容トークンの寄与を強め、パディングの寄与を弱める、追加学習不要の方法を導入する。ノイズ除去器の追加評価は必要ない。この介入により、訓練画像との類似度が同程度のまま、内容による条件付けを強めてプロンプトとの一致を改善できる。 局所解析では、再配分によって局所に集中した注意の量を減らしつつ、強化によって共有されたvalue情報を保持できる条件を特定する。Stable Diffusion v1.4とv2.0では、評価したすべての平滑化幅が、訓練画像との類似度とプロンプトとの一致、および訓練画像との類似度と画像の好ましさという双方の比較で、経験的なパレート最前線上に位置する。Stable Diffusionで選定した設定は、追加調整なしでDeepFloyd IFにおけるテンプレートの再現も減らす。これらの知見は、条件付けの配分と強さを併せて制御することが、プロンプトに沿った別の画像を生成するうえで有効であることを支持する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-10-01(UTC)
最新改訂
2026-10-01 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Text-to-image diffusion models have achieved remarkable progress in image synthesis, yet can exhibit memorization by closely reproducing individual training examples. Effective mitigation must preserve useful prompt information to guide alternative depictions. We introduce a training-free method that redistributes cross-attention with Gaussian smoothing before reinforcing content-token contributions and attenuating padding contributions, without additional denoiser evaluations. With this intervention, stronger content conditioning can improve prompt alignment at comparable training-image similarity. A local analysis identifies when reinforcement preserves shared value information while redistribution reduces localized attention mass. On Stable Diffusion v1.4 and v2.0, all evaluated smoothing widths lie on the empirical Pareto frontiers for training-image similarity versus both prompt alignment and image preference. A configuration selected on Stable Diffusion reduces template reproduction in DeepFloyd IF without further tuning. These findings support jointly controlling conditioning allocation and strength to generate prompt-consistent alternatives.

arXiv ID: 2610.01723 / 要約の誤りについて