arXiv論文メモ
新着一覧
cs.AI / cs.CL · 査読状況未確認

精神科AI問診を模擬患者で評価し情報収集と推論の問題を比較

Clinician-Grounded Quality Assurance for AI-Assisted Psychiatric Intake

King Shi, Amanda Li, Jonathan Ivey, Synthia Qia Wang, Guan Gui, Hyunseo Kim, Peter Zandi, Jason Straub, Jacob Taylor, Ananya Joshi

この論文をやさしく読む

ひとことで言うと

模擬患者への精神科問診で、AIが情報を多く集めても、裏付けのない推論や安全上の懸念の掘り下げに課題があることを比較しています。

何に役立つ?

考えられる用途は、AI問診を導入する医療機関が、自分たちの臨床基準に沿って継続的に品質を確かめることです。情報収集率だけでは捉えられない評価項目を設けています。

この研究の面白いところ

LLMは情報取得で88.0%と高い一方、面接に根拠のない推論も56.8%と高く、異なる評価軸で長所と問題が同時に見えています。

どこまで分かった?

臨床家6人、25分の予備的な模擬問診評価です。実患者の診断精度や治療効果、実運用の安全性を確立した研究ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

患者がAI支援による精神科の初回問診システムを利用できるようになる前に、医療システムには、品質保証のため、これらのツールを自らの臨床基準に照らして日常的に評価する実用的な方法が必要である。臨床家によって問診の進め方が異なることから、この課題の評価は、(1)面接方法をまたぐ比較を支援し、(2)臨床家の負担を最小化し、(3)導入する医療システムにとって臨床的に重要な性能を測定しなければならない。 本研究では、自由形式のAI面接のための記憶拡張型患者シミュレータInterviewPlaygroundを中心に構築した、臨床家の視点に基づく評価プラットフォームを提示する。専門家が作成した症例シナリオとInterviewPlaygroundを使って対話可能な患者を作成し、面接用の模擬問診プラットフォームを構築し、初回問診に関連する評価方法を設計した。 6人の臨床家による25分間の評価を、GPTに基づくLLM問診担当と比較する予備研究では、LLMは患者シナリオに埋め込まれた臨床的に重要な項目をより多く取得した(88.0%対38.9%)。一方、面接に基づかない臨床的推論も多く行い(56.8%対27.8%)、見つかった安全上の懸念の特徴を詳しく捉える割合は低かった(33.3%対66.7%)。この結果は、この課題の運用時の品質保証に向けた土台となる。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-17(UTC)
最新改訂
2026-09-17 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Before patients can use AI-assisted psychiatric intake systems, health systems need practical ways to routinely evaluate these tools against their clinical standards for quality assurance. Because clinicians may use different intake styles, evaluation for this task must (1) support comparison across interviewing approaches, (2) minimize clinician burden, and (3) measure clinically relevant performance for health systems deploying these technologies. We present a clinician-grounded evaluation platform built around a memory-augmented patient simulator for open-ended AI interviewing, InterviewPlayground. We created interactive patients using InterviewPlayground with our expert-authored vignettes, constructed a simulated intake platform for the interviews, and designed evaluation modalities relevant to intake. In a pilot of 6 clinicians in a 25-minute assessment compared to a GPT-based LLM intake interviewer, the LLM recovered more of the clinically relevant items embedded in the patient vignettes (88.0% vs. 38.9%), but made more clinical inferences not based on the interview (56.8% vs. 27.8%), and characterized identified safety concerns less often (33.3% vs. 66.7%), setting the stage for deployed quality assurance for this task.

著者のコメント

7 pages, 3 figures, submitted to IAAI'27

arXiv ID: 2609.21149 / 要約の誤りについて