学習済み動画モデルを固定し、未知の訓練者の手術技能を評価
Video Based Assessment of Surgical Skills Using Frozen Pretrained Video Foundation Models
この論文をやさしく読む
ひとことで言うと
手術訓練の動画から標準化された技能スコアと合否を推定する方法です。学習済みの動画モデル自体は更新せず使います。
何に役立つ?
FLS課題の動画だけによる自動評価を比較する基準になります。未学習の訓練者にも通用するかを、参加者単位で分けた評価で確かめます。
この研究の面白いところ
大きな動画モデルの特徴抽出器を固定し、小さな畳み込みヘッドだけを学習します。フレーム単位の画像特徴と、時間的情報を含む動画特徴の差を検討します。
どこまで分かった?
縫合と型切りでR²は0.6367と0.9261、合否AUCは0.9073と0.9906です。2つの訓練課題データでの交差検証であり、実際の手術全般の技能や患者転帰を評価したものではありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
動画に基づく手術技能の自動評価は急速に進歩しているが、未知の訓練者への参加者単位の一般化を考慮した、連続値の標準化スコア予測の厳密な評価は依然として限られている。本研究では、学習済み動画基盤モデルを固定した特徴抽出器として用い、Fundamentals of Laparoscopic Surgery(FLS)のスコア回帰と合否分類を行う、動画のみを使う枠組みVBA-Net+を導入する。 縫合とパターン切断という2つのFLSデータセットを、VideoPrism、V-JEPA2、VideoMAE v2を用いて評価し、フレーム単位のSimCLRを基準手法とする。軽量な全畳み込みヘッドを、事前に抽出した埋め込み表現に対してオフラインで学習し、標準化された評価手順の中で、参加者単位で1人ずつ除外する交差検証(LOUO)により評価する。 連続スコアの予測では、最良の表現が、縫合でR²=0.6367、パターン切断でR²=0.9261を達成した。公式FLS閾値による合否分類では、受信者動作特性曲線下面積(AUC)がそれぞれ0.9073と0.9906に達した。固定した動画エンコーダーを用いる処理系は、特に縫合において、フレーム単位のSimCLR処理系を概して上回り、動画のみを用いたFLS評価のベンチマークを提供する。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-17(UTC)
- 最新改訂
- 2026-09-17 · v1
- 査読・掲載
- 掲載先の記載あり
著者による掲載先の記載:npj Digital Medicine 2026。出版社での独立確認は未実施です。
更新履歴
- v1 2026-09-17 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Automated video-based surgical skill assessment has advanced rapidly, yet rigorous evaluation of continuous standardized score prediction under participant-level generalization to unseen trainees remains limited. We introduce VBA-Net+, a video-only framework for Fundamentals of Laparoscopic Surgery (FLS) score regression and pass-fail classification using pretrained video foundation models as frozen feature extractors. We evaluate two FLS datasets, suturing and pattern cutting, using VideoPrism, V-JEPA2, and VideoMAE v2, with a frame-level SimCLR baseline. A lightweight fully convolutional head is trained on embeddings offline and evaluated using participant-level leave-one-user-out (LOUO) cross-validation within the standardized assessment protocol. For continuous score prediction, the best representation achieves $R^2$=0.6367 for suturing and 0.9261 for pattern cutting. For pass-fail classification at official FLS thresholds, area under the receiver operating characteristic curve (AUC) reaches 0.9073 and 0.9906, respectively. Frozen video-encoder pipelines generally outperformed the frame-level SimCLR pipeline, particularly for suturing, providing a benchmark for video-only FLS assessment.
著者のコメント
Accepted for publication in npj Digital Medicine
arXiv ID: 2609.19772 / 要約の誤りについて