電子カルテから心の病気の経過を再構成するLLM枠組み
CliniCIRCA: A Modular LLM Framework for Constructing Longitudinal Mental Health Patient Journeys from Raw EHR Narratives
この論文をやさしく読む
ひとことで言うと
退院要約のあちこちに書かれた精神科患者の出来事を、LLMで日付に沿った経過記録へ組み直します。出来事ごとの時刻が付いていなくても、不確かな時間表現を扱う仕組みです。
何に役立つ?
考えられる用途は、長い診療記録から患者の経過を把握する支援と、時系列抽出モデルの学習データ作成です。本研究の評価対象は抽出・時間付与・要約で、診療成績の改善を直接検証したわけではありません。
この研究の面白いところ
52件の退院要約から15,891件の出来事を取り出し、臨床家の評価で629件の誤りを修正しています。自動生成した1,000件の時系列を学習に使う段階までつなぎ、5種類のモデルで指示学習の効果を調べています。
どこまで分かった?
臨床家が確認した基準と、自動生成を含むシルバー基準は区別されています。要旨ではモデルごとの改善量や時間推定の誤りの内訳は示されず、すべての処理で一様に向上したとは述べていません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
精神医療では、患者の経過を推論することが臨床医にとって重要な課題である。しかし、生物学的・心理的・社会的な出来事が長期にわたって進む患者の経過は、互いに分散した非構造化の文章記録に書かれていることが多く、時間の順序を復元するのは難しい。 本研究では、カレンダーを基準にし、不確かな時点を考慮して臨床記録を再構成する、多段階のLLM枠組みCliniCIRCAを提案する。著者らの知る限り、イベント単位のタイムスタンプがない非構造化の退院要約から、臨床イベントを時間的に分類する初めての枠組みである。MIMIC-IIIの精神科入院14,882件から、まず52件の退院要約によるベンチマークを作成し、CliniCIRCAで15,891件のイベントに時期タグを付けた。臨床医が評価に参加して629件の誤りを修正した後、検証済みのゴールド標識を作成した。さらに、修正済みのタイムラインを時間的に根拠付けられた要約段階に入力し、各原文を、日付ごとにまとめた時系列記録へ1.52倍に圧縮した。その後、枠組みを拡張して1,000件のシルバー標準タイムラインを生成し、訓練データとして評価した。ゼロショットおよび少数ショットのプロンプトと比べると、指示チューニングは、シルバー標準評価と臨床医検証評価の双方で、5つのオープンウェイトモデルにおけるイベント抽出、時間タグ付け、要約を概して改善した。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-17(UTC)
- 最新改訂
- 2026-09-17 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-17 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
In mental health care, reasoning over patient journeys is a key task for clinicians. Yet these journeys, encompassing a longitudinal progression of biological, psychological, and social events, are often spread across disparate unstructured text narratives, making temporal recovery challenging. We present CliniCIRCA, a multi-stage LLM framework for Calendar-anchored, Imprecision-aware Reconstruction of Clinical Annals. To our knowledge, CliniCIRCA is the first to temporally classify clinical events across unstructured discharge summaries without event-level timestamps. From 14,882 MIMIC-III mental health admissions, we first construct a benchmark of 52 discharge summaries on which CliniCIRCA produces 15,891 temporally tagged events. After correcting 629 errors based on a clinician-in-the-loop evaluation, we produce verified gold-standard labels. Finally, the corrected timelines drive a temporally grounded summarization stage that compresses each source 1.52 times into a date-grouped chronological record. We then scale the framework to generate 1,000 silver-standard timelines and evaluate them as training data. Compared with zero- and few-shot prompting, instruction tuning generally improves five open-weight models on event extraction, temporal tagging, and summarization across silver and clinician-verified evaluations.
arXiv ID: 2609.19585 / 要約の誤りについて