システム指示や追加学習で以前の振る舞いを変えられるか監査
Alignment Inertia: Auditing the Durability of Training Data Influence Through Policy Override Resistance
この論文をやさしく読む
ひとことで言うと
モデルへの新しい指示や追加学習が、以前に身に付いた振る舞いを変えられるか測る研究です。
何に役立つ?
モデル運用者が方針変更の効き方を事前に監査する際の指標になる。
この研究の面白いところ
一部の条件ではLoRA微調整後に以前の振る舞いへの慣性がかえって強まった。
どこまで分かった?
評価はLlamaとMistral、医療上の誤情報とヘイトスピーチの条件であり、すべてのモデルや方針に一般化するものではない。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
プラットフォーム運営者は、モデルの振る舞いを制御するためシステム指示や追加学習をますます使っている。しかし、以前の学習から引き継いだ振る舞いを、これらの介入でどれほど確実に上書きできるかは不明である。著者らは、運営者の介入が以前の振る舞いを変えることに成功または失敗する場面を測るため、上書き成功率(OSR)とアラインメント慣性を提案する。LlamaとMistralを対象に、医療上の誤情報とヘイトスピーチの領域で、ゼロショットの指示とLoRAによる微調整を評価した。アラインメント慣性は両モデルに見られたが、その大きさはモデル、分野、方針を変える方向によって異なった。特に、Mistralでヘイトスピーチを制限する条件では、LoRAにより慣性が46.5ポイント増えた。つまり、追加学習が以前の振る舞いを上書きするどころか強める場合がある。また、慣性が適応の弱い信号と関係するかをTRAKで調べた。8条件中7条件でTRAKのROC曲線下面積は0.85以上で、慣性の予測ではモデルの確信度、TF-IDF類似度、埋め込み類似度を上回った。結果は、以前の学習が後続のモデル運用方針をどこで制約するかを、運営者が監査する方法を与える。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-23(UTC)
- 最新改訂
- 2026-09-23 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-23 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Platform operators increasingly rely on system prompts and fine-tuning to govern model behavior, yet it remains unclear how reliably these interventions override behavior inherited from prior training. We propose Override Success Rate (OSR) and alignment inertia to measure when operator interventions succeed or fail to change prior behavior. We evaluate zero-shot prompting and LoRA fine-tuning across Llama and Mistral in medical misinformation and hate speech. Alignment inertia persists across both models but varies by model, domain, and policy direction. Notably, in Mistral's restrictive hate-speech condition, LoRA increased inertia by 46.5 percentage points, showing that fine-tuning can reinforce rather than override prior behavior. We also use TRAK to test whether inertia is associated with weaker adaptation signals. TRAK achieves AUC of at least 0.85 in 7 of 8 conditions and outperforms model confidence, TF-IDF similarity, and embedding similarity as a predictor of inertia. These results provide an operator-facing audit of where prior training constrains downstream model governance.
arXiv ID: 2609.27333 / 要約の誤りについて