電子カルテから更新可能な検索評価問題を作るBRIE
A Living Benchmark for Information Retrieval from Electronic Health Records
この論文をやさしく読む
ひとことで言うと
電子カルテの記録から情報検索用の質問と回答を継続的に作り、診療支援AIを評価する研究。
何に役立つ?
電子カルテを使うLLMの評価項目を更新し、複数の診療記録をまたぐ情報の取りこぼしを測るのに役立つ。
この研究の面白いところ
19人の医療者が生成器を検証し、九つのLLMと五つの推論方法を評価した。最先端のシステムでも重要情報の省略が見られた。
どこまで分かった?
要旨は評価用ベンチマークの研究であり、診療判断の安全性や患者への利益を実証したものではない。省略の具体的な割合は示されていない。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
大規模言語モデル(LLM)を用いる診療支援システムが電子カルテ(EHR)へ組み込まれるようになり、医療者が患者記録から情報を探してまとめる方法が変わりつつある。その安全性と有用性には厳密な評価が必要だが、既存のベンチマークは手作業で作られ、更新費用が高く、技術の進歩によってすぐ古くなる。本研究は、長期にわたるEHRの診療記録から質問と回答の組を自動生成する、拡張可能な枠組みを提示する。19人の医療者がベンチマーク生成器を検証し、継続的に維持できる電子カルテ情報検索ベンチマークBRIEを作った。九つのLLMと五つの推論方法を調べると、最先端のシステムでも臨床上重要な情報をしばしば省き、特に複数の文書と受診機会をまたいで情報をまとめる質問で問題が目立った。生成器自体が検証されているため、BRIEは固定されたベンチマークには難しい評価を支援する。例えば、医療者の推論の違いを反映した複数の回答を作って性能を頑健に評価し、問題内容を継続的に更新して評価データの漏れに備えられる。これらの結果は、拡張可能なベンチマーク生成が、技術変化の速い医療現場で導入される臨床LLMを厳密かつ新しい条件で評価する手段になることを示す。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-24(UTC)
- 最新改訂
- 2026-09-24 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-24 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Large language model (LLM)-based clinical assistants are increasingly being integrated into electronic health record (EHR) systems, transforming how clinicians retrieve and synthesize information from patient records. Their safety and utility depend on rigorous evaluation, yet existing benchmarks are manually curated, costly to update, and rapidly become obsolete with evolving technological advancements. We present a scalable framework that automatically generates question--answer pairs from longitudinal EHR notes. Nineteen clinicians validate the benchmark generator, producing the Benchmark for Retrieving Information in EHRs (BRIE), a continuously maintainable evaluation dataset. Across nine LLMs and five inference strategies, state-of-the-art systems frequently omit clinically important information, particularly for questions requiring synthesis across multiple documents and encounters. Because the generator itself is validated, BRIE supports evaluations that static benchmarks cannot, including the generation of multiple answers that reflect variation in clinician reasoning for robust performance assessment and continuously refreshing benchmark content to guard against leakage. Our results demonstrate that scalable benchmark generation enables rigorous, up-to-date evaluation of clinical LLMs as they are deployed in rapidly evolving healthcare settings.
arXiv ID: 2609.30205 / 要約の誤りについて