病変と内視鏡の視野を考慮したポリープ画像の生成
Beyond the Foreground: FOV-Aware Polyp Image Synthesis via Lesion-Guided Adaptive Mucosal Context Propagation
この論文をやさしく読む
ひとことで言うと
ポリープの形を保ちながら、周囲の粘膜が自然につながる大腸内視鏡画像を合成する方法です。
何に役立つ?
注釈付きの内視鏡画像が少ないとき、画像と病変マスクの組を増やして領域分割モデルを学習する用途に役立ちます。
この研究の面白いところ
病変、実際に見える粘膜、カメラの視野外を明示的に分離します。黒い視野外の領域が生成組織へ混ざらないようにし、粘膜の質感と照明の広い範囲の整合を保ちます。
どこまで分かった?
5つのポリープデータセットと5つの領域分割モデルで改善を報告しています。画像合成と後段の評価であり、患者診療での有効性や安全性を検証した結果ではありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
合成画像とマスクの組は、大腸内視鏡画像のアノテーション不足を緩和できる。しかし、現実的な画像を合成するには、与えられた病変を保持しつつ、それと整合する粘膜を生成する必要がある。既存の前景誘導手法は、前景以外の全画素を背景として扱い、主に局所的な統合に依存している。これらを大腸内視鏡画像へ直接適用すると、粘膜ではない黒い領域が生成組織に混入することと、局所的な推論によって粘膜の質感や照明に不整合が生じることの、二つの問題が起こる。 本研究では、病変に誘導された適応的な粘膜コンテキスト伝播に基づく、ポリープ画像合成のための初の前景誘導フレームワークLAMPを提案する。LAMPは視野(FOV)マスクを用い、病変、有効な粘膜領域、カメラ視野の外側を明示的に分離する。病変から粘膜への交差注意により、有効な粘膜位置に対する病変外観の条件を抽出し、FOVで制約した多方向のVision Receptance Weighted Key Valueによって、その条件を組織として許容される領域上に伝播させる。続いて適応的なゲートが、拡散U-Netへの残差としての融合を制御する。 五つのポリープデータセットを用いた広範な実験により、LAMPは生成品質全体で既存手法を大きく上回り、後段の五つのセグメンテーションモデルを一貫して改善することが示された。コードはhttps://github.com/wangtong627/LAMP で公開予定である。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-17(UTC)
- 最新改訂
- 2026-09-17 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-17 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Synthetic image and mask pairs can alleviate scarce colonoscopy annotations, but realistic synthesis requires preserving the supplied lesion while generating compatible mucosa. Existing foreground-guided methods treat all non-foreground pixels as background and rely mainly on local integration. Directly applying them to colonoscopy causes two problems: non-mucosal black regions contaminate generated tissue, and local reasoning produces inconsistent mucosal texture and illumination. We propose LAMP, the first foreground-guided framework for polyp image synthesis based on lesion-guided adaptive mucosal context propagation. LAMP explicitly separates the lesion, valid mucosa, and camera exterior using a field-of-view (FOV) mask. Lesion-to-Mucosa cross-attention extracts lesion appearance conditions for valid-mucosa locations, while FOV-constrained multidirectional Vision Receptance Weighted Key Value propagates them over legal tissue support. An adaptive gate then controls their residual fusion into the diffusion U-Net. Extensive experiments on five polyp datasets demonstrate that LAMP substantially outperforms existing methods in overall generation quality and consistently improves five downstream segmentation models. Our code will be released at https://github.com/wangtong627/LAMP.
arXiv ID: 2609.19966 / 要約の誤りについて