arXiv論文メモ
新着一覧
cs.CV / cs.RO · 査読状況未確認

正解形状のない実際の大腸内視鏡映像から3次元を復元

Colon3R: Cross-Domain 3D Reconstruction from Monocular Colonoscopic Video

Zhihao Xing, Yingyu Wang, Liang Zhao, Shoudong Huang

この論文をやさしく読む

ひとことで言うと

模型やシミュレーションで学んだ形状推定を、正解の3次元形状が付いていない実際の大腸内視鏡映像へ適応させる方法です。

何に役立つ?

内視鏡映像から臓器内の形状やカメラ位置を把握する技術の改善に役立ちます。ロボット内視鏡への利用が動機ですが、診療成績の改善を測った研究ではありません。

この研究の面白いところ

実映像のすべてを同じように教師信号へ使わず、系列・視点ペア・画素の段階ごとに信頼できる部分を選びます。適応前に学んだ幾何学を保つ工夫も組み合わせています。

どこまで分かった?

生体内映像で述べられる比較は定性的なものです。要旨には各評価指標の具体値はなく、コードは採択後の公開予定です。すでに採択済みという意味ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

単眼の大腸内視鏡映像からの3次元復元は、手術用ロボットによる大腸内視鏡検査に重要である。しかし、乏しいテクスチャ、鏡面反射、視野の重なりの少なさ、組織の非剛体運動により、依然として難しい。従来の多視点3次元復元法は安定した対応点と近似的な剛性に依存するが、大腸内視鏡ではこれらがしばしば成立しない。既存の内視鏡向け手法は領域固有の教師信号に頼ることが多い一方、幾何学基盤モデルを臨床の大腸内視鏡へ適応させるための、生体内でのラベル付きデータは十分にない。 事前学習済みVGGTに基づく領域横断型の半教師あり枠組みColon3Rを提案する。対象領域の幾何学的注釈を必要とせず、ラベル付きファントムおよびシミュレーションデータから、相互に結びついたカメラ、深度、点マップの幾何学を、ラベルなしの生体内大腸内視鏡へ転移する。ファントムとシミュレーションだけから学ぶソース領域のみの微調整とは異なり、Colon3Rは教師モデルから得た視点間の教師信号を通して、ラベルなしの生体内映像を直接活用する。提案する階層的な準剛体信頼度により、系列、方向付きペア、画素の各レベルで信頼できる教師信号を選ぶ。同時に、ソース領域の情報を保持する適応により、対象領域への適応中も、学習済みの結合した幾何学を保つ。 広範な実験で、深度、点マップ、カメラ姿勢の推定において、最先端手法を上回る総合性能を示す。実際の生体内大腸内視鏡映像による定性的比較でも、臨床領域への分布変化の下で、競合手法より大幅に完全性が高く、幾何学的に整合する復元を示す。コードは論文採択後に公開する予定である。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-21(UTC)
最新改訂
2026-09-21 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Monocular colonoscopic 3D reconstruction is important for surgical robotic colonoscopy, but remains challenging due to weak texture, specular reflections, limited view overlap, and non-rigid tissue motion. Conventional multi-view 3D reconstruction methods rely on stable correspondences and approximate rigidity, which are often violated in colonoscopy. Existing endoscopic methods often rely on domain-specific supervision, whereas there are not enough in-vivo labeled data available to adapt geometry foundation models to clinical colonoscopy. We present Colon3R, a cross-domain semi-supervised framework built on pretrained VGGT that transfers coupled camera, depth, and pointmap geometry from labeled phantom and simulated data to unlabeled in-vivo colonoscopy without requiring target-domain geometric annotations. Unlike source-only fine-tuning, which learns only from phantom and simulated data, Colon3R directly exploits unlabeled in-vivo video through teacher-derived cross-view supervision. Our proposed hierarchical quasi-rigid reliability selects reliable supervision at the sequence, directed-pair, and pixel levels, while source-preserving adaptation retains the learned coupled geometry during target-domain adaptation. Extensive experiments demonstrate that our method achieves superior overall performance over state-of-the-art approaches in depth, pointmap, and camera pose estimation. Qualitative comparisons on real in-vivo colonoscopy further show substantially more complete and geometrically consistent reconstructions than competing methods under clinical domain shift. The code will be public available after the paper is accepted.

arXiv ID: 2609.23961 / 要約の誤りについて