arXiv論文メモ
新着一覧
cs.HC · 査読状況未確認

手術動画の関係を数値化する場面グラフ

SurgGraph: Quantitative Laparoscopic Video Understanding via Geometry-Grounded Scene Graphs

Jingying Wang, Rosiana Natalie, Marquise D Singleterry, Filippos Bellos, Brian George, Gurjit Sandhu, Jason J Corso, Anhong Guo, Vitaliy Popov, Xu Wang

この論文をやさしく読む

ひとことで言うと

手術動画の中で、何が何に接しているか、遮っているか、器具がどう動くかを数値付きの関係として表す方法。

何に役立つ?

手術動画から学習用の事例を探し、説明やフィードバックを作る用途が考えられる。要旨では概念実証アプリと医学生・研修医による学習評価が報告されている。

この研究の面白いところ

関係を単に有無で表すだけでなく、時間とともにどの程度生じるかを数値化し、境界的な事例の検索にも使っている。

どこまで分かった?

教育評価の参加者は医学生17人と研修医2人である。要旨には患者の治療成績や、より大きな集団での効果は示されていない。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

手術動画は、解剖、器具の使用法、手技を研修者に教えるための主要な資料だが、大規模に学習へ利用するには手術場面を理解するシステムが必要である。既存手法には、視覚言語モデルでは細かな専門的推論が不足し、特定課題向けモデルは汎化しにくく、従来の場面グラフは臨床的に意味のある細部を欠くという問題がある。 本論文は、手術動画から定量的な場面グラフを生成する、追加学習を要しない処理系SurgGraphを提案する。セグメンテーションマスクと深度マップを入力とし、付着、遮蔽、分離、器具の動作といった臨床的に意味のある関係を、〈主語、動詞、目的語、値〉という組で表す。数値は、その関係が時間とともにどの程度生じているかを定量化する。技術評価では、最先端の手術分野の視覚言語モデルを比較対象として、より精密な場面理解を示した。 さらに、意味のある事例や境界的な事例を検索し、視覚的な説明とフィードバックを生成する概念実証の学習アプリSurgGraphQAを構築した。医学生17人と研修医2人を対象とする研究では、有意な学習効果の向上が見られ、教育面での価値が示された。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-22(UTC)
最新改訂
2026-09-22 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Surgical videos are a primary resource for teaching trainees anatomy, tool usage, and procedural skills. Yet learning from them at scale requires systems that understand surgical scenes. Existing approaches fall short: vision-language models lack fine-grained domain reasoning, task-specific models do not generalize, and prior scene graphs omit clinically meaningful detail. We present SurgGraph, a training-free pipeline that generates quantitative scene graphs from surgical videos. Operating on segmentation masks and depth maps, SurgGraph encodes each clinically meaningful relation (attachment, occlusion, separation, tool actions) as a <subject, verb, object, value> tuple whose numeric value quantifies the relation's extent over time. Technical evaluations show more precise scene understanding than state-of-the-art surgical VLM baselines. We then build SurgGraphQA, a proof-of-concept learning application that retrieves meaningful and boundary-case exemplars and generates visual explanations and feedback. A study with 17 medical students and 2 resident surgeons shows significant learning gains, demonstrating its educational value.

arXiv ID: 2609.25651 / 要約の誤りについて