arXiv論文メモ
新着一覧
cs.LG / cs.CL / cs.CR · 査読状況未確認

安全なAI回答の平均ベクトルだけで危険を測れるか

A Safe Prototype Is Not a Safety Direction: Reference Dependence and Prompt Confounds in Response-Safety Embeddings

Sahil Kadadekar

この論文をやさしく読む

ひとことで言うと

安全な回答の平均に似ているほど安全だと判定する方法を検証し、安全例の平均だけでは安全・危険の方向を決められないと示しています。

何に役立つ?

AIの回答を埋め込みで安全評価する際に、比較の基準や評価データの作り方を検討する材料になります。危険例を含む参照を設けた評価と、プロンプト由来の偏りを統制する重要性を示しています。

この研究の面白いところ

同じ埋め込みでも、安全例だけの平均と、安全例から危険例を差し引いた参照とで性能が変わります。参照がラベルなしの場合や危険例が少ない場合も比較して、何が方向の識別に効くかを調べています。

どこまで分かった?

対象は固定された4エンコーダーと記載のコーパス上の正例重心方式です。BeaverTailsで安定した改善が出ない結果も含まれます。著者は一クラス手法全般や安全性ガード全般への否定ではないと明示しています。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

既知の安全な回答の平均埋め込みとのコサイン類似度によって、回答の安全性を評価できるだろうか。最近のスリーパーエージェント検出器は、まさにこのスコアを提案している。しかし、補正しない正例の重心を用いる規則では識別が定まらない。正例の観測は、エンコーダーの原点に対して安全クラスの位置を定めるが、安全な回答と危険な回答を分ける方向までは決めないためである。 われわれは、プロンプトを統制し、人間がラベル付けした2つのコーパスと、補助的な審査者ラベル付きのソース対照データ1つで、この規則を検証する。固定した4つのエンコーダーと、プロンプト単位でグループ化した分割を用いる。人間のラベル付きコーパスでは、安全な回答のプロトタイプのROC-AUCは0.457〜0.545で、2つの評価条件では偶然水準を有意に下回り、1つでは上回った。一方、安全例から危険例を差し引く明示的な参照を用いると、同じ埋め込み上で0.588〜0.738に達する。審査者ラベル付き対照データでは、プロトタイプの順位付けは反転して0.358〜0.405となり、参照を用いた方法は0.754〜0.793に達した。 検証データで危険な回答を安全と誤判定する率が5%となるよう調整した閾値では、参照を用いた方法は、PKU-SafeRLHFでより多くの安全な回答を受け入れた。エンコーダー間の範囲は0.153〜0.263で、プロトタイプでは0.039〜0.061だった。Aegisでも0.189〜0.291対0.004〜0.045となったが、BeaverTailsでは安定した改善は得られなかった。完全にラベルなしの別途確保した参照データでも、参照を用いた順位付けの一部から大部分を回復できるが、プールのうち危険な回答が5%しかない場合は回復が大幅に小さくなる。一方、ラベル付きの危険な回答80〜634件で、その大部分を回復できる。プロンプトのみを用いるアブレーションは、プロンプトとラベルの構成が、統制されていない評価をかさ上げし得ることを示す。 これは補正しない正例重心に関する範囲を限定した結果であり、すべての一クラス手法や、安全性に特化したガードについての結果ではない。クラス平均は位置であって、必ずしも安全性の方向ではない。危険例を十分に含む明示された参照が、方向を識別する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-10-01(UTC)
最新改訂
2026-10-01 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Can response safety be scored by cosine similarity to the mean embedding of known-safe responses? A recent sleeper-agent detector proposes exactly this score, yet the raw positive-centroid rule is not identified: positive observations locate the safe class relative to an encoder origin, but do not determine which direction separates safe from unsafe responses. We audit the rule on two prompt-controlled, human-labeled corpora and one auxiliary jury-labeled source control, using four frozen encoders and prompt-grouped splits. On the human-labeled corpora the safe prototype reaches ROC-AUC 0.457-0.545, with two cells significantly below chance and one above, while an explicit safe-minus-unsafe reference reaches 0.588-0.738 on the same embeddings; on the jury control the prototype is inverted (0.358-0.405) and the reference reaches 0.754-0.793. At validation-calibrated 5% false-safe thresholds, the reference accepts more safe responses on PKU-SafeRLHF (0.153-0.263 versus 0.039-0.061 across encoders) and Aegis (0.189-0.291 versus 0.004-0.045), but not reliably on BeaverTails. A fully unlabeled held-out reference recovers part to most of the referenced ranking, much less when only 5% of the pool is unsafe, whereas 80-634 labeled unsafe responses recover most of it. Prompt-only ablations show that prompt-label composition can inflate uncontrolled evaluations. This is a bounded result about a raw positive centroid, not all one-class methods or safety-specialized guards. A class mean is a location, not necessarily a safety direction; a declared reference with enough unsafe mass identifies orientation.

著者のコメント

Accepted at the NeurIPS 2026 Workshop on Foundations of Language Model Security (FLMSec). 15 pages, 3 figures, 11 tables. Code, results, and a verifier are in the ancillary files

arXiv ID: 2610.01801 / 要約の誤りについて