arXiv論文メモ
新着一覧
cs.AI / cs.CL / cs.CR / cs.LG · 掲載先の記載あり

LLMの潜在状態から有害性を検出する

Safety Beyond the Interface: Detecting Harm via Latent States in Large Language Models

Alizishaan Khatri, Chiquita Prabhu, Omkar Neogi

この論文をやさしく読む

ひとことで言うと

LLMの外側に大きな検査モデルを置く代わりに、内部活性から有害な入力を検出する軽量分類器を学習します。内部状態が安全性判断の手がかりを持つかを調べる研究です。

何に役立つ?

遅延や計算資源が厳しい場面で、有害プロンプト検出の負担を抑える設計に役立つ可能性があります。対象モデルの内部へアクセスできる状況を利用します。

この研究の面白いところ

LLaMA-3.1-8Bの活性を使い、1,260万パラメータのMLPプローブを学習します。三つのデータセットでF1が99%、83%、84%と異なる結果を報告し、大きな外部モデルと比較します。

どこまで分かった?

検証したのは有害入力の分類で、生成内容やエージェント行動全体の安全性を保証するものではありません。評価は一つの基盤モデルからの活性に基づき、他モデルへの転用結果は要旨にありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

自律システムが大規模言語モデル(LLM)に依存する一方、安全性基盤は遅延と計算コストを増やす。外部ガードレールはモデル内部を見られず、保証に空白がある。本研究では、モデル自身が有害性を認識しているかを調べるため、LLaMA-3.1-8Bの活性化値を取り出し、1,260万パラメータの軽量MLPプローブを学習して有害プロンプトを検出した。 WildJailbreak、Beavertails、AEGIS 2.0でのF1はそれぞれ99%、83%、84%で、1,000倍大きいガードモデルに競争力を持ちながら遅延と計算コストを削減した。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-16(UTC)
最新改訂
2026-09-16 · v1
査読・掲載
掲載先の記載あり

著者による掲載先の記載:IEEE DSN-W 2026, pp. 48-52。出版社での独立確認は未実施です。

arXivで読むPDFDOI

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Autonomous systems increasingly rely on Large Language Models (LLMs) yet the safety infrastructure surrounding these models introduces latency and compute overhead. This limits utility in resource-constrained, time-critical deployments. Existing external guardrail models remain blind to the model's internal workings, creating a fundamental assurance gap. We ask: does the model already know when the content is harmful? We extract activations from LLaMA-3.1-8B and train lightweight MLP classifier probes (12.6M parameters) to detect harmful prompts. Evaluated on WildJailbreak, Beavertails, and AEGIS 2.0, our probes achieve F1 scores of 99%, 83%, and 84%, respectively competitive with 1000x larger guard models while cutting latency and compute costs.

arXiv ID: 2609.19472 / 要約の誤りについて