基盤モデルで複数の不随意運動を動画から分類
Foundation-model-based multi-label phenotyping of combined hyperkinetic movement disorders
この論文をやさしく読む
ひとことで言うと
身体にマーカーを付けずに動画から動きの特徴を取り出し、同じ人に併存する複数の不随意運動を分類する方法です。
何に役立つ?
臨床評価のばらつきを減らすための補助手段として検討されています。成人で学習したモデルを、小児と別の成人集団へ転用して評価しました。
この研究の面白いところ
モデルの主要部分を固定したまま、施設ごとに患者単位の判定だけを再較正しています。点の動きだけを使う方法に対し、領域全体の動きが、臨床医の判断が一致したラベルで強みを示しました。
どこまで分かった?
評価集団は小規模で、転用時にも施設ごとの判定較正を行っています。偽陽性ゼロは臨床医の合意ラベル下での結果であり、全症状の完全検出ではありません。ミオクローヌスが主な失敗で、臨床利用前の前向き多施設検証が必要です。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
運動障害MDはしばしば併存するが、現象学的な評価と重症度評価には評価者間で大きなばらつきがある。マーカー不要の動画解析は再現性を改善し得るが、従来研究は主に単一症状を対象とし、標準化された撮影に依存し、年齢や施設をまたぐ検証と転用が不足している。 本研究では2つの基盤モデルを、重みを固定した1つのバックボーンに組み合わせた。Segment Anything Model 3(SAM 3)を用いて、マーカーなしでフレームごとに密な領域分割を行い、それを幾何・輪郭・格子の運動学的信号に要約する。さらに表形式の基盤モデルTabICLv2で、8種類の運動過多性MDの現象型を文脈内学習によって多ラベル分類する。 成人21人と対照4人の標準化された録画で学習し、小児12人と振戦優位の成人20人という2つの独立したデータセットに、モデルを変更せず転用した。評価にはCODY-SAMP尺度を用い、施設ごとに再較正したのは患者単位の判定段階だけであった。臨床医の合意ラベルを用いると、偽陽性は両データセットでゼロになった。ジストニアは完全に検出された(小児7/7、学習に使わない成人15/15)。舞踏運動も小児で全例検出された(3/3)。振戦は、振戦例の多い集団によって評価可能となった際、再較正だけで成人15人中11人を検出した。 領域ごとの効果量解析は、臨床的に整合する現象型別の信号を示し、ミオクローヌスを主な失敗例として特定した。YOLOv8の疎なキーポイントと比べると、密な表現は臨床医の許容的なラベルでは同等であった(Jaccard指標0.63対0.63)が、臨床医の合意ラベルでは顕著に頑健だった(0.93対0.76)。 この、固定した基盤モデルのバックボーンと施設ごとの軽い較正を組み合わせる方法は、標準化された動画から日常的な動画まで、年齢をまたいで、併存する運動過多性MDを転用可能で解釈可能な、保守的な多ラベル表現型として評価できる。特に、臨床医が一致して判断する確信度の高いラベルで頑健性を高める。臨床利用の前には、前向きの多施設検証が必要である。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-17(UTC)
- 最新改訂
- 2026-09-17 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-17 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Movement disorders (MDs) frequently co-occur, yet phenomenological and severity assessment shows substantial inter-rater variability. Markerless video could improve reproducibility, but prior work is largely single-symptom, depends on standardized acquisition, and lacks validation and transfer across ages and sites. We combined two foundation models into one frozen backbone: Segment Anything Model 3 (SAM 3) for dense, per-frame markerless segmentation summarized into geometric, contour and grid kinematic signals, and TabICLv2, a tabular foundation model, for in-context multi-label classification of eight hyperkinetic MD phenomenologies. Trained on standardized recordings of 21 adults and 4 controls, it transferred unchanged to two independent datasets, pediatric (n=12) and tremor-dominant adult (n=20), assessed with the CODY-SAMP scale; only the patient-level decision step was recalibrated per site. Under clinician consensus labels, false positives fell to zero in both datasets. Dystonia recovered perfectly (7/7 pediatric; 15/15 adult held-out), chorea fully in children (3/3), and tremor was recovered in adults (11/15) once a tremor-rich cohort made it evaluable, through recalibration alone. Per-region effect-size analysis gave clinically coherent, phenomenology-specific signals and identified myoclonus as the principal failure. Against YOLOv8 sparse keypoints, the dense representation matched under clinician permissive labels (Jaccard 0.63 vs 0.63) and was markedly more robust under clinician-label consensus (0.93 vs 0.76). This frozen foundation-model backbone with light per-site calibration yields transferable, interpretable, conservative multi-label phenotyping of co-occurring hyperkinetic MDs across ages and from standardized to routine video, adding robustness on high-confidence, clinician-agreed labels. Prospective multi-centre validation is required before clinical use.
著者のコメント
29 pages, 7 figures, 6 tables, 1 supplementary table. Submitted to Artificial Intelligence in Medicine. Code: https://github.com/xaviervasques/cody-sam3 ; data: https://doi.org/10.5281/zenodo.22232609
arXiv ID: 2609.22369 / 要約の誤りについて