少数の見本から鋼板表面の傷を切り分ける画像認識
P$^3$-SAM: SAM with Perceptual Parallel Prompt for Few-Shot Strip Steel Surface Defect Segmentation
この論文をやさしく読む
ひとことで言うと
鋼板の細かな傷や欠陥を、少数の見本から画像内で塗り分ける方法です。汎用画像モデルSAMに、工業画像の見えにくさを補う仕組みを加えています。
何に役立つ?
考えられる用途は、欠陥の見本を大量に用意しにくい製造現場での画像検査です。今回実証されたのは、三つのベンチマークにおける欠陥領域の分割性能です。
この研究の面白いところ
画像の局所コントラストとテクスチャを改善する処理に加え、欠陥が何かを示す情報と、どこにあるかを示す情報を並行して生成します。入力側とモデルへの誘導の両方を工業画像に合わせています。
どこまで分かった?
要旨には実際の生産ラインでの速度や照明変動への耐性の詳細はありません。mIoUの12.00%向上についても、相対改善率かパーセントポイント差かは要旨だけでは明確ではありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
帯鋼表面欠陥(S³D)の少数ショット意味的セグメンテーション(FSS)には、自然画像とは異なる大きな課題がある。自然画像と違い、S³Dには局所的なコントラストの低さ、不均一な照明、複雑で細かなテクスチャパターンという独特の特徴がある。近年、Segment Anything Model(SAM)を用いる手法は、強力な事前学習済み表現を活用することで自然画像のFSSに有望な結果を示している。しかし、S³D画像が持つこうした産業用途特有の特徴により、SAMを工業製品の欠陥検出へ直接適用すると性能が低下する。 本論文では、SAMの能力を高める新たなPerceptual Parallel Prompt(P³)フレームワークを提案し、二つの主要な戦略でこれらの課題に対処するP³-SAMモデルを構築する。第一に、S³Dの領域分割に向けて局所コントラストを強調し、重要なテクスチャの細部を保持するPerceptual-Optimized Encoding(POE)戦略を開発する。第二に、意味情報と空間情報の両方のプロンプトを同時に生成するParallel Prompt Generator(PPG)戦略を導入し、さまざまな画像でSAMのデコーダを包括的に誘導する。 三つの少数ショットS³Dベンチマークで広範な実験を行った結果、P³-SAMは最先端の性能を達成した。特にSurface Defects-4iデータセットでは、平均IoU(mIoU)が12.00%向上した。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-18(UTC)
- 最新改訂
- 2026-09-18 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-18 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Few-shot semantic segmentation (FSS) of strip steel surface defects (S$^3$D) has posed significant challenges distinct from natural scenes. Unlike natural images, S$^3$D task exhibits unique characteristics including low local contrast, uneven illumination, and complex fine-grained texture patterns. Although recent methods based on Segment Anything Model (SAM) have shown promise in FSS on natural images by leveraging SAM's powerful pre-trained representations, these unique industrial characteristics of S$^3$D images lead to performance drop when directly applying SAM to industrial defect scenarios. In this paper, we propose a novel Perceptual Parallel Prompt (P$^3$) framework that empowers SAM, creating the P$^3$-SAM model to address these challenges through two core strategies. First, we develop a Perceptual-Optimized Encoding (POE) strategy that enhances local contrast and preserves critical texture details for S$^3$D segmentation. Second, we introduce the Parallel Prompt Generator (PPG) strategy that simultaneously generates both semantic and spatial prompts, enabling comprehensive guidance for SAM's decoder across varying images. Extensive experiments on three few-shot S$^3$D benchmarks demonstrate that P$^3$-SAM achieves state-of-the-art performance, with particularly notable improvements of 12.00% in mIoU on Surface Defects-4i dataset.
著者のコメント
Accepted by ICME 2026, 6 pages, 3 figures. Corresponding authors: Anpeng Wang and Runmin Cong
arXiv ID: 2609.21424 / 要約の誤りについて