言語モデルとの接続を意識した医療画像エンコーダの事前学習
Pretraining of Medical Visual Encoders Toward Multi-modal Large Language Models
この論文をやさしく読む
ひとことで言うと
医療画像を読む部品を、文章を生成する言語モデルが使いやすい形で学習させる研究です。同時に、画像の局所的な関係が失われないようにします。
何に役立つ?
医療画像の質問応答モデルを組み立てる際に、視覚エンコーダの学習方法や別のLLMへの転用を検討する材料になります。評価対象は画像質問応答のデータセットです。
この研究の面白いところ
事前学習に使ったLLMと射影器を評価時には交換し、視覚エンコーダだけを移します。この設定により、特定の言語モデルとの組み合わせに依存する効果と、転用可能な視覚表現を分けて調べています。
どこまで分かった?
要旨には具体的な精度や改善幅が示されていません。医療データセットでの転移実験であり、診療現場での診断精度や患者への効果を実証したという記載はありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
マルチモーダル大規模言語モデル(MLLM)は、CLIPで事前学習した視覚エンコーダを再利用することが多い。しかし、これらのVision Transformer(ViT)の特徴を最終的に利用するのは、自己回帰型の大規模言語モデル(LLM)である。本研究では、この不整合を意味的インターフェースの隔たりと呼び、MedMLIPを提案する。これは、固定したLLMを用いたレポート生成を通じて視覚エンコーダを事前学習する一方、局所関係蒸留(Local Relational Distillation:LRD)によって視覚パッチ間の関係を保持し、視覚表現の崩壊を避ける枠組みである。 MedMLIPをIU-XrayとOpen-PMC-300Kで事前学習し、得られたエンコーダをVQA-RADとSLAKEで評価する。転移するのはViTだけであり、学習を導いたLLMと射影器は置き換えることで、異なるLLM間での転移可能性を評価できるようにする。このLLMをまたぐ転移実験は、より細かな視覚情報を保持しようとしつつ、自己回帰型LLMとの接続に向けて視覚エンコーダを事前学習することの価値を示す。コードと事前学習済みモデルは https://github.com/SkyCol/MedMLIP で公開されている。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-20(UTC)
- 最新改訂
- 2026-09-20 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-20 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Multimodal Large Language Models (MLLMs) commonly reuse visual encoders pretrained with CLIP, although the features of these ViTs are ultimately consumed by autoregressive LLMs. We refer to this mismatch as the semantic-interface gap and introduce MedMLIP, a framework that pretrains the visual encoder through report generation with a frozen LLM, while employing Local Relational Distillation (LRD) to preserve relationships among visual patches to avoid visual collapse. We pretrain MedMLIP on IU-Xray and Open-PMC-300K and evaluate the resulting encoders on VQA-RAD and SLAKE. Only the ViT is transferred, while the guiding LLM and projector are replaced, allowing us to assess cross-LLM transferability. Our cross-LLM transfer experiments demonstrate the value of pretraining visual encoders for their autoregressive LLM interface while trying to preserve more fine-grained visual information. Code and the pretrained model are available at https://github.com/SkyCol/MedMLIP
arXiv ID: 2609.23860 / 要約の誤りについて