arXiv論文メモ
新着一覧
cs.HC / q-bio.OT · 査読状況未確認

臨床家の読み取り方をLLMに伝える難しさ

"I Know Where to Look," But Does the LLM? Charting the Gaps Between Clinical Expert Needs and Unstructured Data Abstraction Tools

Venkatesh Sivaraman, Rigney Turnham, George Bonano, Nevin Aresh, Renumathy Dhanasekaran, Margaret Guo, Sindhu Kubendran, Olivia Lin, Jonathan D Louie, Kristan Olazo, Jeanne Shen, Harish Vasudevan, Jeanette Wong, Emily Alsentzer, Jason A Fries, Anobel Odisho, John Gordan, Jean Feng, Julian C Hong

この論文をやさしく読む

ひとことで言うと

臨床家には分かる記録の読み方が、そのままLLMへの指示や評価に変換できるとは限らないと示した共同設計研究です。

何に役立つ?

臨床研究向けの情報抽出ツールで、プロンプトの書き方だけでなく、信頼性判断や評価の仕組みを設計し直す際に役立ちます。

この研究の面白いところ

研究者が実際に答えたい問いを使い、7チームとの作業から14課題中12課題に障壁があると捉えています。

どこまで分かった?

報告対象はこの共同設計と評価の参加チーム・課題です。要旨には抽出精度の具体的な比較値や診療成果への影響はありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

患者記録から構造化情報を抽出する臨床データのアブストラクションは、がんなどの疾患に関する知識を進める上で重要な役割を果たす。大規模言語モデル(LLM)による情報抽出(IE)は、この作業を加速する可能性がある。しかし、現在の枠組みがAIの専門知識を持たない臨床研究者を効果的に支援するかどうかは明らかではない。 この問題に対処するため、7つのがん研究チームと共同で、LLMに基づく対話型抽出システムLibrettoを設計し、実際の研究上の問いに答えるための支援能力を評価した。臨床家は患者記録のどこに、どのように複雑な概念の注釈を付けるべきか分かっていたが、14課題のうち12課題では、その直観をLLMで再現する上で障壁に直面した。 文脈に応じた記録の信頼性判断、感覚的に生成したプロンプトを意図どおりに調整する難しさ、柔軟性に乏しい評価戦略のため、情報抽出の作業手順を根本的に変える必要が生じた。この結果は、AIによるデータ作業ツールと臨床利用者のニーズとの隔たりを埋めるために、人間とコンピュータの相互作用(HCI)研究が取り組むべき未解決の問題を明らかにする。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-16(UTC)
最新改訂
2026-09-16 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Clinical data abstraction, the process of distilling structured information from patient records, plays a key role in advancing knowledge about diseases such as cancer. Information extraction (IE) with large language models (LLMs) could accelerate this process, but it is unclear whether current frameworks effectively support clinical researchers without AI expertise. To address this, we co-designed an interactive LLM-based abstraction system called Libretto with seven cancer research teams, then evaluated the system's ability to help them answer real-world research questions. We found that while clinicians knew where and how to annotate complex concepts in patient notes, in twelve of fourteen tasks they faced barriers to replicating those intuitions with LLMs. Contextual note reliability judgments, difficulties in steering vibe-coded prompts, and inflexible evaluation strategies necessitated fundamental changes to the IE workflow. Our results highlight open problems for HCI research to bridge the gaps between AI data work tools and clinical users' needs.

著者のコメント

Under review

arXiv ID: 2609.19318 / 要約の誤りについて