arXiv論文メモ
新着一覧
cs.CV · 査読状況未確認

Mambaと注意機構で単眼画像からの奥行き推定を改善

CMAMBADEPTH: Self-supervised Monocular Depth Estimation with Channel Mamba and Hybrid Attention

Xuezhi Xiang, Jiayao Liu, Heqi Xiang, Yuqi Hu, Yiming Chen, Shanjun Zhang

この論文をやさしく読む

ひとことで言うと

1枚のカメラ画像から奥行きを推定する際、細かさの異なる画像特徴の情報交換をMambaで改善する方法です。

何に役立つ?

カメラ1台で周囲の3次元構造を推定する技術の改善に役立ちます。異なるデータセットへのゼロショット適用も評価しています。

この研究の面白いところ

スケール間の融合をエンコーダとデコーダで別の方向のMambaに任せ、局所と大域の空間情報は2種類の注意処理で補います。

どこまで分かった?

報告された性能はKITTI、DDAD、NYUv2での評価です。7.2%はNYUv2でのRA-Depthに対する改善で、7.2ポイントの正解率向上ではありません。処理速度や実機運用結果は要旨にありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

正確な単眼奥行き推定は、カメラ1台による場面理解を可能にする中核技術である。しかし、既存の自己教師あり単眼奥行き推定では、スケール間の情報交換が非効率であることや、局所と大域の空間モデル化の両立が難しいことが、一般に制約となっている。本論文では、チャネル方向の選択的な状態伝播によって、効率的な多尺度特徴融合と細かな文脈モデル化を行う自己教師あり枠組みCMambaDepthを提案する。 具体的には、双方向Channel Mamba(Bi-CMamba)が異なるスケールのエンコーダ特徴を整合させ、順序付けられたスケール群の間で双方向の情報交換を可能にする。単方向Channel Mamba(Uni-CMamba)はデコーダ特徴を段階的に集約し、群選択機構によって細かなスケール群を保持して後続の融合へ渡す。さらに、ハイブリッド注意モジュール(HAM)を導入し、大きなカーネルによる局所文脈とManhattan自己注意を組み合わせて相補的な空間モデル化を行う。 実験では、本手法が高い競争力を持つ性能を示した。具体的にはKITTIで絶対相対誤差(AbsRel)0.094、二乗平均平方根誤差(RMSE)4.156を、DDADでAbsRel 0.140を達成した。NYUv2を用いたゼロショットのデータセット間汎化テストではAbsRel 0.232となり、基準手法RA-Depthを7.2%上回った。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-21(UTC)
最新改訂
2026-09-21 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Accurate monocular depth estimation serves as a core enabler for single camera scene understanding. However, existing self-supervised monocular depth estimation methods generally suffer from the bottleneck of inefficient cross-scale information interaction and difficulty in balancing local and global spatial modeling. In this paper, we propose CMambaDepth, a self-supervised framework that achieves efficient multi-scale feature fusion and fine-grained contextual modeling via channel-wise selective state propagation. Specifically, Bidirectional Channel Mamba (Bi-CMamba) aligns encoder features across scales and enables bidirectional information exchange among ordered scale groups. Unidirectional Channel Mamba (Uni-CMamba) progressively aggregates decoder features and retains fine-grained scale groups through a group selection mechanism for subsequent fusion. Furthermore, a Hybrid Attention Module (HAM) is introduced to combine large-kernel local context and Manhattan self-attention for complementary spatial modeling. Experimental results demonstrate that our method achieves highly competitive performance. Specifically, our model achieves an AbsRel of 0.094 and an RMSE of 4.156 on KITTI, and an AbsRel of 0.140 on DDAD. In the zero-shot cross-dataset generalization test on NYUv2, it attains an AbsRel of 0.232, outperforming the baseline RA-Depth by 7.2%.

arXiv ID: 2609.24494 / 要約の誤りについて