紛らわしい問いで言語モデルの安全上の警戒力を育てる
Beyond Routine Compliance: Cunning Data Cultivates Safety Vigilance in Large Language Models
この論文をやさしく読む
ひとことで言うと
危険な依頼の例だけでなく、前提がおかしい問いを見抜く練習をさせると、隠れた有害な意図にも対処しやすくなるかを調べています。
何に役立つ?
考えられる用途は、従来の安全性学習に追加する訓練データの設計です。既存の安全対策を補完する方法として評価されています。
この研究の面白いところ
直接的には安全性と関係しない推論の罠を使う点が特徴です。報告された平均攻撃成功率は2.35パーセントポイント低下しています。
どこまで分かった?
効果は評価した9通りのモデルとベンチマークの組合せに基づき、攻撃成功率はゼロではありません。推論過程の分析は機序を示唆するもので、理論的な移転にも条件があります。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
安全性のアラインメントは、大規模言語モデル(LLM)に有害な要求を見分け、危険な指示を拒否することを教える。しかし、有害な意図が一見無害な文脈に隠されると、調整済みのモデルも失敗し得る。堅牢な安全性には、安全の境界に関する知識に加えて、警戒力が必要である。これは、表面的な意味の下にある不自然な前提、誤解を誘う推論、潜在的な危険を検出する能力を指す。モデルは行動する前に、要求の意図と仮定を吟味しなければならない。 この能力を育てるため、必ずしも安全性とは直接関係しないが、誤解を招く前提、通常と異なる推論、微妙な不整合を含む「巧妙な問い」を導入する。こうした推論の罠を見抜く学習が、安全性の重要な場面にも移転すると仮定する。実験では、Cunning学習が分布外のジェイルブレイク攻撃への頑健性を高め、その後の安全性微調整も強化した。 さらに、既存の最先端の安全性アラインメント処理にCunningを加えると、評価した設定全体で新たな最高性能を得た。基盤モデルとベンチマークの9通りの組合せにわたる平均攻撃成功率(ASR)は、17.40%から15.05%に下がった。同条件の安全性微調整後に推論過程を分析すると、有害な計画が始まる前に安全判断が応答を統御しやすくなることが示唆された。さらに、条件付きの理論解析により、巧妙なデータから学んだ不変性が安全性に関係する入力へ移転する条件を特徴付ける。これらの結果は、巧妙なデータがモデルの警戒力を強め、従来の安全性アラインメントを補完し得ると示唆する。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-16(UTC)
- 最新改訂
- 2026-09-16 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-16 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Safety alignment teaches large language models (LLMs) to recognize harmful requests and reject risky instructions. Yet aligned models can fail when harmful intent is concealed within seemingly benign contexts. Robust safety therefore requires both knowledge of safety boundaries and \textbf{vigilance}: the ability to detect unusual premises, misleading reasoning, and latent risks beneath surface-level semantics. Vigilance requires models to scrutinize a request's underlying intent and assumptions before acting. To cultivate this capability, we introduce \textbf{cunning questions}, which are not necessarily safety-related but contain misleading premises, atypical reasoning, or subtle inconsistencies. We hypothesize that learning to look beyond such reasoning traps can transfer to safety-critical scenarios. Experiments show that Cunning training improves robustness to out-of-distribution jailbreak attacks and strengthens subsequent safety fine-tuning. Furthermore, augmenting an existing state-of-the-art safety alignment pipeline with Cunning establishes a new state of the art across our evaluated settings, reducing mean ASR across nine backbone--benchmark combinations from 17.40\% to 15.05\%. Trace analysis after matched safety fine-tuning suggests that safety judgments are more likely to govern responses before harmful planning begins. A conditional theoretical analysis further characterizes when invariance learned from cunning data can transfer to safety-related inputs. These findings suggest that cunning data can strengthen model vigilance and complement conventional safety alignment.
著者のコメント
18 pages
arXiv ID: 2609.18515 / 要約の誤りについて