arXiv論文メモ
新着一覧
cs.AI / cs.CL / cs.LG · 査読状況未確認

合成症例と評価基準に基づく報酬で医療LLMを学習

Fathom-Vaidya: Advancing Medical Reasoning with Rubric-Based Rewards

Kalash Shah, Kunal Singh, Snehan J, Shreyas Singh

この論文をやさしく読む

ひとことで言うと

診断問題を解く学習の後に、患者との複数回のやり取りを想定した学習を行い、医療向け言語モデルを改善する研究です。応答の複数の側面を評価する基準を報酬に使います。

何に役立つ?

医療対話モデルを学習・評価する方法として役立つと考えられます。ここで示されている成果はベンチマーク上のもので、患者の治療成績や実際の診療の安全性を検証した結果ではありません。

この研究の面白いところ

1つの診断へ絞り込む能力と、唯一の正解がない対話を進める能力を分け、順番に学習させています。5,300件の合成シナリオに多次元の評価基準を組み合わせています。

どこまで分かった?

要旨のMedXpertQAでの『10%超』は、相対改善かパーセントポイント差かが明示されていません。実際の患者を対象とする試験や、日常診療での有効性は要旨には示されていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

大規模言語モデル(LLM)を医療に導入するには、相補的な2つの側面で堅牢な性能が必要である。1つは診断推論であり、臨床データから患者の状態を推定して診断に至る、証拠に基づく収束的な課題である。もう1つは臨床医療推論であり、唯一の正解が存在しないこともある複数ターンの臨床的なやり取りの中で、対話し、計画し、状況に適応するための、より広範な道筋を判断する能力である。HealthBenchやMedXpertQAなどの最近のベンチマークは、両側面に根強い弱点があることを明らかにしており、複雑な診断状況での失敗と、文脈に即した患者中心の対話における限界を示している。 本研究では、合成データと評価基準に基づく強化学習を用いて、これらの側面を対象にする逐次的な学習枠組みを提案する。まず、MedBulletsに由来する問題を使い、ルールと評価基準に導かれる強化学習(RL)によって診断推論を改善する。次に臨床推論へ移り、応答を包括的に評価する多次元の評価基準をそれぞれに付けた、5,300件の合成複数ターンシナリオを生成する。この方法によりMedXpertQAで10%を超える改善が得られ、300億パラメータのモデルはHealthBench-Hardで正答率50.1%を達成し、GPT-5(thinking)を含む非公開モデルのベースラインを上回った。結果は、対象を絞った合成データセットと評価基準に基づく学習が、医療LLMの診断推論と対話的な臨床推論の両方を体系的に改善できることを示している。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-21(UTC)
最新改訂
2026-09-21 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Deploying Large Language Models (LLMs) in healthcare requires robust performance across two complementary dimensions - diagnostic reasoning: the convergent, evidence-driven task of inferring a patient's condition from clinical data to produce a diagnosis, and clinical healthcare reasoning: the broader, navigational judgment required to communicate, plan, and adapt across multi-turn clinical interactions where a single correct answer may not exist. Recent benchmarks such as HealthBench and MedXpertQA reveal persistent weaknesses in both areas, exposing failures in complex diagnostic scenarios and limitations in contextual, patient-centered dialogue. We introduce a sequential training framework that targets these facets using synthetic data and rubric-based reinforcement learning. First, we improve diagnostic reasoning using MedBullets-derived questions with rule- and rubric-guided Reinforcement Learning (RL). We then shift to clinical reasoning by generating 5.3k synthetic multi-turn scenarios, each paired with multi-dimensional rubrics to comprehensively assess the response. This approach yields over 10% improvement on MedXpertQA, and our 30B model achieves 50.1% accuracy on HealthBench-Hard, surpassing proprietary baselines including GPT-5 (thinking). Our results show that targeted synthetic datasets and rubric-based training can systematically improve both diagnostic and interactive clinical reasoning in medical LLMs.

著者のコメント

18 pages, 5 Figures, Correspondence to kunal.singh@fractal.ai

arXiv ID: 2609.24480 / 要約の誤りについて