arXiv論文メモ
新着一覧
cs.CV · 査読状況未確認

RGB画像と深度画像の領域分割用データセットRGBD20K

RGBD20K: A Large-Scale Benchmark for RGB-D Semantic Segmentation

Shaohua Dong, Zexuan Meng, Haiyan Sun, Bing Fan, Cuicui Zhang, Dylan Joseph, Kewei Sha, Yunhe Feng and Heng Fan

この論文をやさしく読む

ひとことで言うと

色と奥行きの画像から領域を分類するため、160カテゴリと2万組の画像を持つデータセットを提案します。

何に役立つ?

RGB-D領域分割モデルの学習や比較に使える可能性があります。要旨は注釈の再評価と修正も報告しています。

この研究の面白いところ

既存の代表的なデータセットより細かなカテゴリを扱い、新しい融合手法も評価したすべてのベンチマークで最先端の性能を報告しています。

どこまで分かった?

一般化しやすいモデルの学習は期待として述べられています。要旨に個別のベンチマークの得点は記載されていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

本論文は、豊富なカテゴリと高品質な注釈を備え、より頑健で汎用的なRGB画像と深度画像による意味領域分割の開発を助ける新しいデータセットRGBD20Kを提案する。第一に、意味カテゴリの範囲を拡大し、細かな160カテゴリを収録する。これは既存の代表的なRGB-DベンチマークであるNYUv2の40クラスやSUN RGB-Dの37クラスを大きく上回る。この範囲の拡大によって、より一般化しやすい領域分割モデルの学習が期待される。第二に、既存のベンチマークと比べて規模が大きく、20,000組のRGB-D画像を提供し、より強力な深層モデルの開発に使える学習資源となる。第三に、既存ラベルを厳格に再評価して修正し、長年の注釈ノイズを解消して、信頼できる正解データを作った。 さらに、新しいスコア精製融合(SPF)法を提案する。この手法は評価したすべてのベンチマークで最先端の性能を達成し、高品質な複数種類の情報をRGB-D意味領域分割に活用する有効性を示した。データセットはhttps://github.com/ShaohuaDong2021/RGBD20K/で公開している。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-24(UTC)
最新改訂
2026-09-24 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

In this paper, we propose RGBD20K, a novel dataset for facilitating the development of more robust and general RGB-D semantic segmentation by encompassing abundant categories and high-quality annotations. RGBD20K possesses several attractive properties: (1) Expanded Semantic Space. In particular, it covers 160 fine-grained categories, largely surpassing the category diversity of existing popular RGB-D benchmarks (e.g., NYUv2 with 40 classes and SUN RGB-D with 37 classes). With such enriched semantic coverage, we expect to promote the learning of more generalizable segmentation models. (2) Larger Scale. Compared with current benchmarks, RGBD20K offers 20,000 RGB-D image pairs, providing a substantially larger training resource that benefits the development of more powerful deep models. (3) High-Fidelity Annotation. We perform rigorous re-evaluation and correction of existing labels to resolve long-standing annotation noise, resulting in a clean and reliable ground-truth foundation. Furthermore, we propose a novel score-purified fusion (SPF) method, which achieves state-of-the-art performance across all evaluated benchmarks, demonstrating the effectiveness of our approach in leveraging high-quality multimodal information for RGB-D semantic segmentation. The dataset is here: https://github.com/ShaohuaDong2021/RGBD20K/.

arXiv ID: 2609.29028 / 要約の誤りについて