arXiv論文メモ
新着一覧
cs.AI / cs.MA · 査読状況未確認

複数のLLM担当を使って健診結果の質問に答える

A Multi-Agent LLM Framework for Personalized Health Checkup Interpretation and Guidance

HyungJun Kim, Taehan Lee, Soojin Cheon

この論文をやさしく読む

ひとことで言うと

健診結果について複数の要望を一度に尋ねるとき、LLMを担当別に分けると回答の網羅性や有用性が上がるかを調べています。

何に役立つ?

健診記録の照会と説明を組み合わせた回答システムの設計比較に役立ちます。医療上の安全性向上を確認した研究ではありません。

この研究の面白いところ

総合評価が上がった理由を分解し、要件を漏れなく扱う点での改善と、正確性・安全性で改善が限られる点を区別しています。費用と待ち時間の増加も報告しています。

どこまで分かった?

合成記録を用いた韓国語120問の評価で、実患者の診療結果を調べたものではありません。重大な失敗は複数エージェントでも13.3%あり、安全性の差は認められませんでした。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

個人に合わせた健診結果の解釈には、経時的な記録、医学知識、生活習慣の助言、医療機関の利用案内を横断した推論が必要となる。本研究は、複数の意図を特定し、それぞれをタスク専用のエージェントへ割り当てて並列に実行し、出力を統合する、複数エージェント型の大規模言語モデル(LLM)システムを提示する。合成した健診記録を用い、2〜4個の要件を組み合わせた韓国語の複合質問120件について、単一エージェントと複数エージェントの設定で生成した回答を比較した。 複数エージェントでは、LLM判定者による重み付きスコアが1.695から1.797へ改善した(p=0.027)。追加の3つのLLM判定者でも、一貫した改善が見られた(差は+0.111〜+0.186、すべてp<0.05)。改善は有用性、一貫性、複合質問の各要件を漏れなく扱うことに由来した。一方、数値の正確性と根拠との対応が有意に改善したのは4判定者のうち1つだけで、医学的安全性には差がなく、重大な失敗の発生率も近かった(単一エージェント15.0%、複数エージェント13.3%)。2人の人間の評価者は、それぞれ66.7%と68.3%の一対比較で複数エージェントを好んだ。複数エージェントの実行は遅延を1.31倍、費用を2.02倍に増やした。探索的なサブグループ解析では、改善は個人記録の検索を含む質問に集中していた。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-10-01(UTC)
最新改訂
2026-10-01 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Personalized interpretation of health checkup results requires reasoning across longitudinal records, medical knowledge, lifestyle guidance, and healthcare navigation. We present a multi-agent large language model (LLM) system that identifies multiple intents, maps each to a task-specific agent, executes them in parallel, and synthesizes their outputs. We compared answers generated in Single Agent and Multi Agent settings on 120 Korean compound queries combining two to four requirements, using synthetic health checkup records. The Multi Agent improved the weighted LLM-judge score from 1.695 to 1.797 (p = 0.027), and three additional LLM judges showed consistent improvements ($\Delta$ = +0.111 to +0.186, all p < 0.05). The gains came from usefulness, consistency, and the handling of every requirement in compound queries, whereas numerical accuracy and grounding improved significantly under only one of the four judges and medical safety did not differ, and critical failures occurred at similar rates (Single Agent 15.0% vs. Multi Agent 13.3%). Two human evaluators preferred Multi Agent in 66.7% and 68.3% of pairwise comparisons. Multi Agent execution increased latency and cost by 1.31$\times$ and 2.02$\times$, respectively. In exploratory subgroup analyses, the improvement was concentrated in queries involving personal-record lookup.

著者のコメント

16 pages, 2 figures, 8 tables and Appendix

arXiv ID: 2610.01451 / 要約の誤りについて