arXiv論文メモ
新着一覧
cs.CL / cs.AI · 査読状況未確認

医療LLMの量子化で回答を支える根拠を保つ

When Quantization Preserves Accuracy but Not Evidence: Explanation-Aware Post-Training Quantization for Medical LLMs

Yeji Kim, Mi-Young Kim, Randy Goebel

この論文をやさしく読む

ひとことで言うと

モデルを小さくする量子化で、答えは変わらなくても、その答えを説明する根拠が弱くなる問題を扱っています。元のモデルが示した根拠も残すように量子化を調整します。

何に役立つ?

医療問題に回答するモデルを軽量化するとき、正解率だけでは見落とす説明の変化を評価する方法になります。考えられる用途は、理由説明を利用者が確認するシステムの圧縮・比較です。

この研究の面白いところ

正解を増やすことと、元のモデルの回答根拠を保つことを明確に分けています。理由説明の文章を似せるだけでなく、根拠に応じた回答挙動も最適化の対象にします。

どこまで分かった?

評価は4モデルと3つの多肢選択式質問応答データセット、W4A4KV4設定で行われています。完全精度モデルへの忠実性を保つことが目的であり、元の説明の医学的正しさや実診療での安全性を保証する結果ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

学習後量子化(PTQ)は大規模言語モデルの効率的な導入を可能にする。PTQの手法は通常、汎用的な再構成指標、パープレキシティ、回答正解率を用いて最適化・評価される。しかし、説明が重要な分野では、ユーザーが予測を信頼できるか判断するために生成された理由説明も読むことから、最終回答だけを保つのでは不十分な場合がある。 本研究では、選んだ回答を裏付ける証拠を理由説明が提供すべき医療分野の多肢選択式質問応答で、この問題を調べる。変換に基づくPTQに対して、説明を考慮する目的関数を提案する。この手法では、完全精度の教師モデルの理由説明から忠実性に関するキャッシュをオフラインで作り、最適化中に利用することで、回答を支える根拠トークンと、その根拠を条件とした回答挙動を維持する。 W4A4KV4量子化の下でOSTQuantに本手法を組み込み、医療向けおよび指示調整済みの70億~80億パラメータのLLMを4モデル、MedExQA、MedExpQA、ChallengeClinicalQAで評価した。同じ較正条件のOSTQuantベースラインは課題の正解率を保つものの、回答を裏付ける理由説明を大幅に弱めることがある。目的は正解ラベルに対する正解率を高めることではなく、完全精度モデルの回答を支える挙動を維持することである。提案手法は、完全精度モデルの回答挙動と、理由説明から回答への支持関係をよりよく保つ。 これらの結果は、説明が重要な状況のPTQでは、回答正解率だけでなく、回答を裏付ける根拠の保持も評価すべきことを示唆する。コードと評価スクリプトは https://github.com/dut0817/EAQuant で公開されている。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-21(UTC)
最新改訂
2026-09-21 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Post-training quantization (PTQ) enables efficient deployment of large language models, and PTQ methods are usually optimized and evaluated with generic reconstruction, perplexity, or answer accuracy. But in explanation-critical domains, preserving only the final answer may be insufficient, since users may also inspect generated rationales to judge whether a prediction is trustworthy. We study this issue in medical multiple-choice question answering, where rationales should provide evidence that supports the selected answer. We propose an explanation-aware objective for transformation-based PTQ. Our method builds an offline faithfulness cache from full-precision teacher rationales and uses it during optimization to preserve answer-supporting evidence tokens and evidence-conditioned answer behavior. We instantiate it on OSTQuant under W4A4KV4 quantization and evaluate four 7B--8B medical and instruction-tuned LLMs on MedExQA, MedExpQA, and ChallengeClinicalQA. While a same-calibration OSTQuant baseline preserves task accuracy, it can substantially weaken answer-supporting rationales. Our objective is to preserve the full-precision model's answer-supporting behavior rather than improve gold-label accuracy, and our method better preserves the full-precision model's answer behavior and rationale-to-answer support. These results suggest that PTQ for explanation-critical settings should evaluate preservation of answer-supporting evidence, not only answer accuracy. Code and evaluation scripts are available at https://github.com/dut0817/EAQuant.

arXiv ID: 2609.24799 / 要約の誤りについて