単眼動画から手術器具の位置と動きを復元
Surgical Kinematics from Monocular Video with Learned Articulated Motion Constraints
この論文をやさしく読む
ひとことで言うと
手術ロボットの単眼動画から、器具の位置、向き、開き角などの動きを復元する方法。
何に役立つ?
考えられる用途は、運動センサーの記録がない手術動画から器具の動きを評価すること。
この研究の面白いところ
画像特徴、器具のマスク、深度推定を組み合わせ、2802エピソードで従来法より経路長誤差と動作分割精度を改善した。
どこまで分かった?
数値はOpen-Hベンチマークでの比較。異なる手術環境や器具での性能は要旨から分からない。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
ロボット手術の客観的な評価には器具の運動情報が使われるが、動画しかない場合はそれを復元する必要がある。本研究は、単眼動画から器具の位置、向き、鉗子の開き角を推定する運動学的復元ネットワークを導入する。画像表現は、固定したDINOv3の特徴を全体的な注意で集約したものと、追加学習したSAM 3.1のマスクから器具の目印の周辺を局所的に集約したものを組み合わせる。 共通のTransformer符号器と時間方向の畳み込みを持つ出力部が、この画像表現をマスクの形状、単眼深度、アームごとの多層回帰ネットワークによる視覚的な状態推定と統合する。位置の枝では、移動距離を保つため、変位の大きさと方向を別々に予測する。さらに、予測した状態の観測値と動きの増分に軌跡を合わせるため、微分可能な重み付き最小二乗法を使う。四元数による向きの観測を、予測した回転の累積に対して表現し、向きに関する目的関数を二次形式にする。 Open-Hの2802エピソードで復元を評価した。主なOpen-HベンチマークでLiveMAEと比べると、経路長の平均絶対誤差は0.45センチメートルから0.34センチメートルに減り、動作の分割に関する時間方向の平均適合率は44.54%から54.44%に上がった。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-23(UTC)
- 最新改訂
- 2026-09-23 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-23 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Objective assessment of robotic surgery uses instrument kinematics, which must be reconstructed when only video is available. We introduce a kinematic reconstruction network for estimating instrument position, orientation and jaw angle from monocular video. Our visual representation combines global attention pooling of frozen DINOv3 features with local pooling at instrument landmarks from fine-tuned SAM 3.1 masks. Our shared Transformer encoder and temporal convolutional heads integrate this representation with mask geometry, monocular depth and visual state estimates from arm-specific multilayer regression networks. Our position branch predicts displacement magnitude and direction separately to preserve traveled distance. We fit trajectories to predicted state observations and motion increments by differentiable weighted least squares, expressing quaternion observations relative to cumulative predicted rotations to obtain a quadratic orientation objective. We evaluate reconstruction across 2,802 Open-H episodes. Compared with LiveMAE on the main Open-H benchmark, our method reduces path-length mean absolute error from 0.45 to 0.34\,cm and increases temporal mean average precision for motion segmentation from 44.54\% to 54.44\%.
arXiv ID: 2609.27227 / 要約の誤りについて