arXiv論文メモ
新着一覧
cs.LG / cs.AI · 査読状況未確認

拡散モデルの報酬適合と生成の多様性を両立する学習

iADD: Improving Alignment and Diversity in Diffusion Policy Optimization

Ashok Prasad Neupane, Saugat Adhikari, Pramish Paudel, Ajad Chhatkuli, Danda Pani Paudel

この論文をやさしく読む

ひとことで言うと

画像などを生成する拡散モデルを報酬に合わせて調整するとき、出力が似たものばかりになる問題を抑える学習方法です。報酬への適合と生成の多様性を同時に評価しています。

何に役立つ?

考えられる用途は、望ましい特徴を持つ生成物を増やしつつ、出力の選択肢を保つことです。要旨で報告されている実証は、3課題での既存手法との比較と構成要素別の検証です。

この研究の面白いところ

拡散過程の後半だけを更新すればよいという先行の結論を理論面から再検討しています。その上で、Feynman–Kacに基づく学習によって適合と多様性のバランスを改善します。

どこまで分かった?

要旨には3課題の具体的な名称、改善量、計算コストは記載されていません。後半だけの更新については多様性を損ない得るという主張で、あらゆる設定で必ず損なうという意味ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

Denoising Diffusion Policy Optimization(DDPO)など、強化学習に基づく拡散モデルの事後学習は、報酬関数の下で逆拡散過程を最適化する。しかし、現在の報酬最適化手法では、多様性と品質が犠牲になる。本論文では、理論的な検討と手法設計を慎重に行うことで、より良いトレードオフを実現する。 理論的枠組みを解析し、先行研究で示された結論とは対照的に、拡散モデルの後半の時間ステップだけを更新すると、多様性に悪影響を及ぼす可能性があることを数学的に示す。さらに、これまでで最良の報酬への適合と多様性のトレードオフを達成するため、確かな理論的基盤に基づく逐次的なFeynman–Kac学習を提案する。3つの異なる課題で広範な実験を行い、関連する拡散方策最適化手法と比較する。また、各構成要素について十分なアブレーション実験を行い、報酬への適合と多様性の両方で大きな性能向上が得られることを検証する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-10-01(UTC)
最新改訂
2026-10-01 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Reinforcement learning based post training of diffusion models, such as Denoising Diffusion Policy Optimization (DDPO), optimizes a reverse diffusion process under a reward function. However, current approaches to reward optimizations do so at the cost of diversity and quality. In this paper, we provide better tradeoffs through careful theoretical considerations and method design. We analyze the theoretical framework and mathematically demonstrate that \emph{only-latter timestep} updates of diffusion model may be harmful for diversity contrary to the conclusions presented in a previous work. Additionally, we propose an incremental Feynman-Kac training based on strong theoretical foundations in order to achieve the best-yet alignment-diversity tradeoffs. We perform extensive experiments and compare our method against related diffusion policy optimization approaches in three different tasks and also provide strong ablations for each component, thus validating strong performance gains in both alignment and diversity.

arXiv ID: 2610.01789 / 要約の誤りについて