RGB画像と深度画像の領域分割用データセットRGBD20K
RGBD20K: A Large-Scale Benchmark for RGB-D Semantic Segmentation
この論文をやさしく読む
ひとことで言うと
色と奥行きの画像から領域を分類するため、160カテゴリと2万組の画像を持つデータセットを提案します。
何に役立つ?
RGB-D領域分割モデルの学習や比較に使える可能性があります。要旨は注釈の再評価と修正も報告しています。
この研究の面白いところ
既存の代表的なデータセットより細かなカテゴリを扱い、新しい融合手法も評価したすべてのベンチマークで最先端の性能を報告しています。
どこまで分かった?
一般化しやすいモデルの学習は期待として述べられています。要旨に個別のベンチマークの得点は記載されていません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
本論文は、豊富なカテゴリと高品質な注釈を備え、より頑健で汎用的なRGB画像と深度画像による意味領域分割の開発を助ける新しいデータセットRGBD20Kを提案する。第一に、意味カテゴリの範囲を拡大し、細かな160カテゴリを収録する。これは既存の代表的なRGB-DベンチマークであるNYUv2の40クラスやSUN RGB-Dの37クラスを大きく上回る。この範囲の拡大によって、より一般化しやすい領域分割モデルの学習が期待される。第二に、既存のベンチマークと比べて規模が大きく、20,000組のRGB-D画像を提供し、より強力な深層モデルの開発に使える学習資源となる。第三に、既存ラベルを厳格に再評価して修正し、長年の注釈ノイズを解消して、信頼できる正解データを作った。 さらに、新しいスコア精製融合(SPF)法を提案する。この手法は評価したすべてのベンチマークで最先端の性能を達成し、高品質な複数種類の情報をRGB-D意味領域分割に活用する有効性を示した。データセットはhttps://github.com/ShaohuaDong2021/RGBD20K/で公開している。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-24(UTC)
- 最新改訂
- 2026-09-24 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-24 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
In this paper, we propose RGBD20K, a novel dataset for facilitating the development of more robust and general RGB-D semantic segmentation by encompassing abundant categories and high-quality annotations. RGBD20K possesses several attractive properties: (1) Expanded Semantic Space. In particular, it covers 160 fine-grained categories, largely surpassing the category diversity of existing popular RGB-D benchmarks (e.g., NYUv2 with 40 classes and SUN RGB-D with 37 classes). With such enriched semantic coverage, we expect to promote the learning of more generalizable segmentation models. (2) Larger Scale. Compared with current benchmarks, RGBD20K offers 20,000 RGB-D image pairs, providing a substantially larger training resource that benefits the development of more powerful deep models. (3) High-Fidelity Annotation. We perform rigorous re-evaluation and correction of existing labels to resolve long-standing annotation noise, resulting in a clean and reliable ground-truth foundation. Furthermore, we propose a novel score-purified fusion (SPF) method, which achieves state-of-the-art performance across all evaluated benchmarks, demonstrating the effectiveness of our approach in leveraging high-quality multimodal information for RGB-D semantic segmentation. The dataset is here: https://github.com/ShaohuaDong2021/RGBD20K/.
arXiv ID: 2609.29028 / 要約の誤りについて