樹冠の輪郭を矩形注釈だけで学習する画像分割法
Latent Commonality Expectation-Maximisation for Box-supervised Tree Crown Instance Segmentation
この論文をやさしく読む
ひとことで言うと
木の輪郭を一つずつ描いて教えなくても、木を囲む矩形の注釈から樹冠の形を取り出す画像解析法です。
何に役立つ?
考えられる用途は、注釈作成の負担を抑えながら、疎林や乾燥地の樹冠を航空写真から監視することです。炭素量や生物多様性そのものを直接推定した評価ではありません。
この研究の面白いところ
学習済み画像特徴を固定したまま、矩形内に共通して現れる樹木の特徴を期待値最大化法で分けます。異なる評価集合で、輪郭教師あり手法と比較しています。
どこまで分かった?
AP50とF1@0.4は異なる指標です。DINOv3の事前学習済み特徴は利用しており、少数の矩形だけで基盤モデルまでゼロから学習したわけではありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
航空画像から個々の樹冠を分割することは、樹木単位の炭素量評価、生物多様性、景観規模の再生状況の監視を支える。しかし既存モデルは主に樹冠が密な森林画像で訓練され、樹冠が疎で見た目の変化が大きく、注釈付きベンチマークでも十分に代表されないサバンナや乾燥地では性能が低下する。また、これらのモデルは通常、費用のかかる多角形の注釈に依存する。 本研究では、矩形教師ありのインスタンス分割モデルLACE(潜在共通性の期待値最大化法)を導入し、0.1 m/画素の航空RGB樹冠画像で評価する。LACEは凍結したDINOv3-web ViT-L/16エンコーダーを4つの空間オフセットで適用し、特徴を交互に組み合わせて密な特徴格子を作る。軽量なCenterNet型検出ヘッドは、境界矩形だけで訓練する。期待値最大化法を用いて、矩形内で繰り返し現れる見た目、すなわち「樹木らしさ」を周囲から分離する。 OAM-TCDのベンチマークテスト集合では、マスク注釈を使わず、矩形注釈付き画像900枚で訓練したLACEのマスクAP50は0.663 ± 0.001(3シード)となる。これは、約4200枚の全画像集合で訓練された、Restorが公開するマスク教師ありMask R-CNNの0.626を上回る。樹冠が疎な保持集合では、マスクAP50は0.691で、マスク教師ありの比較手法Detectree2は0.612だった。 NeonTreeEvaluationでは公式評価コードを使い、手作業で注釈したRGB矩形2万3424個だけから、F1@0.4が0.728 ± 0.003(5シード)に達する。これは同データの著者らのDeepForestモデルの公表値0.719に匹敵する。訓練注釈はその0.1%未満で、LiDAR由来の3000万樹冠の事前学習集合は一切使わない。凍結した自己教師あり特徴を利用することで、LACEは矩形だけから完全教師ありの専用比較手法と同等以上の性能を達成する。ラベル付きデータが少ない疎な樹冠環境で、樹冠インスタンス分割の多角形注釈を不要にする。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-22(UTC)
- 最新改訂
- 2026-09-22 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-22 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Individual tree crown segmentation from aerial imagery underpins tree-level carbon accounting, biodiversity, and restoration monitoring at landscape scale. However, existing models are predominantly trained on dense canopy forest imagery and degrade in savannah and drylands, where tree crowns are sparse, of variable appearance, and underrepresented in annotated benchmarks. These models also typically depend on costly polygon annotations. We introduce LACE (LAtent Commonality Expectation-maximisation), a box-supervised instance segmentation model, evaluated on 0.1 m/px aerial RGB tree crown imagery. LACE uses a frozen DINOv3-web ViT-L/16 encoder, applied at four spatial offsets and interlaced into a denser feature grid, with a lightweight CenterNet-style detection head trained solely on bounding boxes. We use expectation-maximisation to separate recurring appearance, the "treeness", within bounding boxes from surroundings. On the OAM-TCD benchmark test set, LACE reaches a mask AP$_{50}$ of $0.663 \pm 0.001$ (3 seeds) trained on 900 box-annotated images and without mask annotations, above the 0.626 scored by Restor's released mask-supervised Mask R-CNN, which was trained on the full ~4.2k image set. On a sparse-canopy holdout set, mask AP$_{50}$ rises to $0.691$ versus $0.612$ for Detectree2, a mask-supervised baseline. On NeonTreeEvaluation, using the official evaluation code, LACE reaches $0.728 \pm 0.003$ F1@0.4 (5 seeds) from 23,424 hand-annotated RGB boxes alone, matching the authors' DeepForest model's published 0.719, using under 0.1% of its training annotations and none of its LiDAR-derived 30M-crown pretraining set. By leveraging frozen self-supervised features, LACE matches or surpasses fully-supervised specialist baselines from boxes alone, removing the need for polygon annotation in tree crown instance segmentation for sparse-canopy environments where labelled data is scarce.
著者のコメント
37 pages, 18 tables. Code and model checkpoints to be released upon publication
arXiv ID: 2609.26549 / 要約の誤りについて