arXiv論文メモ
新着一覧
cs.CL / cs.AI · 査読状況未確認

医療記録の匿名化置換で人物関係と時系列を保つ

Consistent Relexicalization of Clinical Documents using Graph-Based Approach

Dipankar Das, Atri Mandal, Sandeep Singh, Tushar Shandhilya

この論文をやさしく読む

ひとことで言うと

医療記録の名前などを代わりの表現に置き換える際に、記録をまたぐ対応関係と時間の順序を保つ研究です。言語モデルとグラフを組み合わせています。

何に役立つ?

機微情報を置き換えた医療データでも、関係や時系列を使う分析の価値を保つことが狙いです。評価では関係・時間の整合性がともに改善しています。

この研究の面白いところ

個別に置換する代わりに、グラフで一対一対応を扱い、時間には決定論的な再配置を使います。改善幅は相対比ではなく、それぞれ30.4、45.9パーセントポイントです。

どこまで分かった?

要旨は既存のプライバシーベンチマークを損なわなかったと報告していますが、再識別リスクがゼロだとは述べていません。評価対象データやベンチマークの詳細は要旨には示されていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

再語彙化は、現実の特徴を忠実に保ったデータセットを合成しながら機微情報をしっかり隠せるため、臨床自然言語処理における重要な技術である。しかし、変換中に構造的完全性、関係の整合性、時間的一貫性を保つことは依然として大きな課題である。既存手法はしばしば個々のエンティティを独立に置換するため、長期にわたる記録間に臨床的な不整合が生じる。このことは、再語彙化されたデータセットの後続の科学分析での価値を低下させる。この限界に対処するため、大規模言語モデルとグラフの力を組み合わせるG-RELIC(整合性を改善したグラフに基づく文脈的再語彙化)を導入する。G-RELICは、元のエンティティと代替エンティティの一対一対応を最適化する、グラフに基づく写像機構を実装する。また、時間的一貫性を保つための決定論的な時間再配置アルゴリズムを導入する。多様な実世界の臨床データセットでの実証評価は、G-RELICが最先端のベースラインを大幅に上回ることを裏付ける。臨床データセットで認められたプライバシーベンチマークを損なうことなく、関係の整合性を62.1%から92.5%へ30.4パーセントポイント改善し、時間的整合性を46%から91.9%へ45.9パーセントポイント改善する。これにより、再識別リスクを最小化しながら、再語彙化されたデータセットの分析上の有用性を最大化する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-18(UTC)
最新改訂
2026-09-18 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Relexicalization is a pivotal technique in clinical NLP, as it facilitates robust masking of sensitive information while synthesizing datasets that retain high-fidelity, real-world characteristics. However, preserving structural integrity, relational coherence, and temporal consistency during transformation remains a significant challenge. Existing approaches frequently rely on independent entity replacement, which results in clinical inconsistencies across longitudinal records. This reduces the value of such relexicalized datasets for downstream scientific analysis. To address these limitations, we introduce G-RELIC (Graph Based Contextual Relexicalization with Improved Consistency) which combines the power of LLMs with graphs. G-RELIC implements a graph-based mapping mechanism which optimizes for one-to-one correspondence between original and surrogate entities. It also introduces a deterministic temporal repositioning algorithm to preserve temporal consistency. Empirical evaluations on diverse, real-world clinical datasets validate that G-RELIC significantly outperforms state-of-the-art baselines. G-RELIC yields a 30.4 percentage point improvement in relational integrity (62.1% to 92.5%) and 45.9 percentage point improvement in temporal coherence (46% to 91.9%) without compromising on the recognized privacy benchmarks for clinical datasets. This maximizes the analytical utility of relexicalized datasets while minimizing re-identification risk.

著者のコメント

Accepted for presentation at the Sixth International Conference on AI ML Systems (AIMLSystems 2026), Lake Como, Italy, October 6-9, 2026

arXiv ID: 2609.21387 / 要約の誤りについて