arXiv論文メモ
新着一覧
cs.CV · 査読状況未確認

画像表現の手掛かりで画素空間の拡散モデルを学習

PixelDiT2: Representation-Grounded Pixel Diffusion Transformers

Yongsheng Yu, Wei Xiong, Yichen Sheng, Shiqiu Liu, Jiebo Luo

この論文をやさしく読む

ひとことで言うと

画像を直接画素から生成する拡散モデルに、学習済みの視覚モデルから画像の表現を教える仕組みを加えています。

何に役立つ?

画素空間で画像を生成するモデルの学習方法を設計する際の選択肢になります。要旨ではImageNetにおける二つの解像度の画質指標を示しています。

この研究の面白いところ

潜在空間への圧縮を導入する代わりに、凍結した視覚モデルからパッチ単位の指針を与えて、表現の獲得と画素生成の役割を分けています。

どこまで分かった?

報告されたFIDは256×256で600エポック、512×512で680エポック学習した条件での値です。要旨には比較モデルの具体的なFID、実時間、計算資源量がなく、これらの値だけで速度や計算費用の優位性までは判断できません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

画素空間の拡散モデルは近年の進歩によって潜在空間の拡散モデルとの画質の差を縮めてきたが、依然として収束が遅く、最終的な画質でも後れを取っている。著者らは、その主な理由の一つが、明示的な表現の事前知識を欠いていることだと論じる。通常、コンパクトで構造化された潜在空間でノイズを除去する潜在拡散とは異なり、画素拡散では、生のRGB空間から、ノイズ除去に適した表現と画素生成を同時に学習しなければならない。 この問題に対処するため、オートエンコーダーや潜在表現の再構成ボトルネックを導入せずに、表現学習を画素生成から切り離すよう設計した、エンドツーエンドの画素空間拡散モデルPixelDiT2を提案する。事前学習済みの視覚基盤モデルを凍結して用い、ノイズ除去の全過程でパッチごとの明示的な表現の指針を与える、表現に基づく誘導を提案する。これにより、画素拡散Transformerは画素生成により集中できる。ImageNetの256×256では600エポック後にFID 1.46を達成し、512×512解像度では680エポック後にFID 1.48を達成する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-21(UTC)
最新改訂
2026-09-21 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Recent advances in pixel-space diffusion models have narrowed the image quality gap with latent-space diffusion, but still converge more slowly and lag behind in final image quality. We argue that a key reason is the lack of an explicit representation prior: unlike latent diffusion, which usually denoises in a compact and structured latent space, pixel diffusion needs to learn denoising-friendly representations and pixel generation simultaneously from raw RGB space. To address this problem, we propose PixelDiT2, an end-to-end pixel-space diffusion model designed to decouple representation learning from pixel generation without introducing an autoencoder or latent reconstruction bottleneck. We propose representation grounding that uses a frozen pretrained vision foundation model to provide explicit per-patch representation guidance throughout denoising, allowing the pixel diffusion transformer to focus more on pixel generation. On ImageNet-256x256, PixelDiT2 achieves an FID of 1.46 after 600 epochs; at 512x512 resolution, PixelDiT2 achieves an FID of 1.48 after 680 epochs.

arXiv ID: 2609.24919 / 要約の誤りについて