arXiv論文メモ
新着一覧
cs.AI / cs.MA · 査読状況未確認

誤りの記憶を役割別に使い分ける診療コード付与AI

LearnActCoder: Role-Aware Error Memory for Adaptive Clinical Coding Agents

Meysam Ghaffari, Bhaskar Sen, Nasim Sabetpour, Nina Fatehi, Animesh Agarwal, and Carlos Morato

この論文をやさしく読む

ひとことで言うと

診療記録へコードを付けるAIに、過去の誤りを整理した記憶を与え、見落としと過剰な付与を別々に改善する仕組みです。

何に役立つ?

重みを再学習せず、少量の正解付き事例から診療コーディングの振る舞いを調整する方法として役立ちます。臨床導入の実証ではなく、既存記録を使った後ろ向き評価です。

この研究の面白いところ

見落としからの教訓は候補を拾うCoderへ、誤検出の教訓は候補を審査するJudgeへ振り分けます。MIMIC-IIIの150件では構造化した記憶でCPTのF1が5.9ポイント改善し、生の例や内省文の記憶は基準に近いままでした。

どこまで分かった?

ICD-9の改善は有意ではなく、ICD-10では適合率向上と再現率低下が相殺されF1は有意に変わりません。CPT/HCPCSの絶対性能は依然低く、1,000件での安定性は臨床現場の安全性を保証するものではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

診療コード付与エージェントは、裏づけのないコード、記録済みの病態の見落とし、具体性の誤り、処置コード付与規則との不一致など、同じ種類の失敗を繰り返し経験する。そこで、小規模なラベル付きLEARNバッチで生じた誤りを、構造化された誤り知識データベース(MistakeKDB)へ変換する推論時適応の枠組みLearn-Then-Actを導入する。偽陰性から得た教訓は再現率を重視するCoderへ、偽陽性から得た教訓は適合率を重視するJudgeへ振り分ける。この枠組みを、利用可能な場合には参照表による根拠づけを行うCoder–Judge型診療コード付与パイプラインLearnActCoderとして具体化した。 対応をそろえたMIMIC-IIIの記録150件では、構造化MistakeKDBによりCPTのF1が5.9パーセントポイント改善した一方、生の事例を記憶する方式や振り返り形式の記憶は、記憶なしの基準とほぼ同水準にとどまった。ICD-9の改善は有意ではなかった。対応をそろえたMIMIC-IVコホートでは、記憶によってICD-10コード付与の適合率が高まる一方、再現率が低下し、F1は統計的に変わらなかった。同じ記憶を評価用に保持したMIMIC-IIIの記録1,000件へ適用しても、ICDの動作点は安定して維持され、規模と安定性に関する証拠が得られた。 全体として、この結果は、フィードバックに由来する構造化された誤りの記憶が、重みの更新や基礎となる作業工程の変更を行わずに、症例間で診療コード付与の振る舞いを適応させるのに有用であるという見方と整合する。ただし、CPT/HCPCSの絶対的な性能は依然として低く、評価は臨床導入ではなく、過去の記録を用いて行われている。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-17(UTC)
最新改訂
2026-09-17 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Clinical coding agents repeatedly encounter the same failure modes, including unsupported codes, missed documented conditions, specificity errors, and procedure-coding convention mismatches. We introduce Learn-Then-Act, an inference-time adaptation framework that converts errors from a small labeled LEARN batch into a structured Mistake Knowledge Database (MistakeKDB). False-negative lessons are routed to a recall-oriented Coder, while false-positive lessons are routed to a precision-oriented Judge. We instantiate the framework in LearnActCoder, a Coder-Judge clinical coding pipeline with lookup-table grounding where available. On 150 matched MIMIC-III notes, structured MistakeKDB improves CPT F1 by 5.9 percentage points, while raw-example and reflection-style memories remain near the no-memory baseline; the ICD-9 improvement is not significant. On a matched MIMIC-IV cohort, memory shifts ICD-10 coding toward higher precision at a recall cost, leaving F1 statistically unchanged. Applying the same memory to 1,000 held-out MIMIC-III notes maintains a stable ICD operating point, providing scale/stability evidence. Overall, the results are consistent with structured, feedback-derived error memory being useful for adapting clinical coding behavior across cases without weight updates or changes to the underlying workflow. Absolute CPT/HCPCS performance remains low, and the system is evaluated retrospectively rather than in clinical deployment.

arXiv ID: 2609.19721 / 要約の誤りについて