arXiv論文メモ
新着一覧
cs.CV · 査読状況未確認

トラコーマ画像分類で視覚モデルと少数パラメータ適応を比較

Comparative Performance and Parameter-Efficient Adaptation of DINOv2 for Active Trachoma Classification

Kibrom Gebremedhin, Hadush Hailu, Bruk Gebregziabher, Yordanos Hailu

この論文をやさしく読む

ひとことで言うと

結膜写真からトラコーマの所見を分類する際、大きな視覚モデル、軽量な追加機構、学習の損失関数のどれが性能に寄与するかを比較しています。

何に役立つ?

同じ画像と手順で医療画像分類モデルを比較し、少数の追加パラメータで調整する方法を選ぶ際の参考になります。

この研究の面白いところ

ECAの追加パラメータは5つですが、予測性能の大部分は微調整されたDINOv2自体から得られます。追加機構の効果が損失関数によって変わることまで検討しています。

どこまで分かった?

1,546画像の交差検証による結果であり、臨床運用での性能や調査費用の減少を実証したものではありません。要旨はfocal+centerと交差エントロピー+centerの両方で91.66%を挙げているため、両設定を混同せず記載しています。±の意味は要旨では定義されていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

結膜写真の自動判定は、トラコーマ有病率調査の費用とばらつきを減らし得る。しかし、最新の事前学習済み視覚表現、軽量な特徴適応、学習目的関数の設計がそれぞれ持つ相対的な価値は、共通の手順の下では明らかになっていない。本研究は、公開UCSF/Lietmanコレクションの1,546画像を用い、濾胞性トラコーマ炎症(TF)と正常の二値分類を条件をそろえて評価する。画像には、瞼結膜のゼロショット領域分割、位置合わせ、切り出し、標準化を行うOPTED処理系を適用する。まず共通の分類処理系で6つの事前学習済み基盤モデルを比較し、次にDINOv2 ViT-B/14上で4種類の軽量な適応機構を評価する。 層化5分割交差検証の下で、Efficient Channel Attention(ECA)とfocal損失・center損失の組合せを用いたDINOv2は、正解率91.66 ± 0.97%、macro-F1 90.69 ± 1.10%、AUC 96.06 ± 0.71%を達成した。ECAが追加する学習可能なパラメータはわずか5つでありながら、大幅に大きい代替手法と同等の性能を示す。目的関数のアブレーションではさらに、損失関数全般にわたってECAが素のDINOv2を一貫して改善するわけではないことが分かった。ばらつきが最も小さい正解率91.66%は、交差エントロピーとcenter損失の組合せで得られた。全体として、予測性能の大部分は微調整したDINOv2表現がもたらし、ECAは極めて少ないパラメータでの改良を提供するものの、その効果は学習目的関数に依存した。得られた手順は、活動性トラコーマの画像分類に再現可能なベンチマークを提供する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-20(UTC)
最新改訂
2026-09-20 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Automated grading of conjunctival photographs could reduce the cost and variability of trachoma prevalence surveys, but the relative value of modern pretrained visual representations, lightweight feature adaptation, and training-objective design has not been established under a common protocol. This study presents a controlled evaluation for binary classification of Trachomatous Inflammation-Follicular (TF) versus Normal using 1,546 images from the public UCSF/Lietman collection. Images are processed using the OPTED pipeline for zero-shot tarsal-conjunctiva segmentation, alignment, cropping, and standardization. We first compare six pretrained backbones using a common classification pipeline and then evaluate four lightweight adaptation mechanisms on DINOv2 ViT-B/14. Under stratified five-fold cross-validation, DINOv2 with Efficient Channel Attention (ECA) and focal-plus-center loss achieved 91.66 +/- 0.97% accuracy, 90.69 +/- 1.10% macro-F1, and 96.06 +/- 0.71% AUC. ECA introduces only five learnable parameters while matching the performance of substantially larger alternatives. Objective ablation further showed that ECA did not consistently improve plain DINOv2 across loss functions; the lowest-variance 91.66% accuracy was obtained with cross-entropy plus center loss. Overall, the fine-tuned DINOv2 representation provided most of the predictive performance, while ECA offered a highly parameter-efficient refinement whose effect depended on the training objective. The resulting workflow provides a reproducible benchmark for active trachoma image classification.

著者のコメント

6 pages, 5 figures and 3 tables

arXiv ID: 2609.23832 / 要約の誤りについて