arXiv論文メモ
新着一覧
cs.CR / cs.CL · 査読状況未確認

LLMの脱獄対策を組み合わせて公平に比較する

CASCADE Against Jailbreaks: Combination Across Stages with Controlled Attack-Defense Evaluation

Jiale Luo, Eric Han

この論文をやさしく読む

ひとことで言うと

LLMの安全対策を単独ではなく組み合わせて調べ、どこにどの対策を入れるかを比較する研究です。攻撃側の試行回数などもそろえて評価します。

何に役立つ?

考えられる用途は、LLMサービスの防御構成を選ぶ際に、安全性と通常の利用への影響を比較することです。異なる評価条件の成績をそのまま比較しないための枠組みにもなります。

この研究の面白いところ

19種類の攻撃と15種類の防御を対象に、同じ段階の組み合わせと異なる段階をまたぐ組み合わせを扱っています。一つの万能な防御を探すのではなく、組み合わせの効果を調べています。

どこまで分かった?

脅威モデルは直接的・ブラックボックス・単一ターンの攻撃です。複数ターンや別種の攻撃にも同じ結論が当てはまるとは要旨から判断できず、具体的な安全性や有用性の数値は記載されていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

大規模言語モデル(LLM)への脱獄攻撃に対する防御は、入力の変更や出力の監視など、処理パイプラインのさまざまな段階で働く。しかし、各段階でどの防御を配置し、それらをどう組み合わせるべきかは明らかではない。従来の実証研究は、攻撃成功率の定義や実験設定が一致せず分断され、防御を主に単独で評価してきた。 ここでは、直接的なブラックボックスの単一ターン攻撃という一貫した脅威モデルの下で、処理段階の内部と段階をまたいだ防御の組み合わせを調べる、私たちの知る限り初めての体系的研究を示す。私たちの意思決定の枠組みは、根拠ある攻撃成功率の定式化、管理されたクエリ予算、明示的な公平性のルールによって、評価を標準化する。 19種類の攻撃と15種類の防御を通じて、常に最良となる単独の防御はない一方、適切に選んだ組み合わせは、有用性の低下を最小限に抑えながら高い安全性を達成することが分かった。これにより、多層防御パイプラインに対する実践的な推奨を導く。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-18(UTC)
最新改訂
2026-09-18 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Defenses against jailbreak attacks on Large Language Models (LLMs) operate at different pipeline stages, such as input modification or output guard, but it remains unclear which defenses to deploy at each stage and how to combine them. Prior empirical studies, fragmented by inconsistent attack-success-rate definitions and experimental settings, have evaluated defenses largely in isolation. Here we present the first systematic study, to our knowledge, of defense combinations both within and across pipeline stages, under a consistent threat model of direct, black-box, single-turn attacks. Our decision framework standardizes evaluation through a principled attack-success-rate formulation with controlled query budgets, together with explicit fairness rules. Across 19 attacks and 15 defenses, we find that no single defense is universally best, but well-chosen combinations achieve substantial safety with minimal utility degradation, yielding practical recommendations for layered defense pipelines.

著者のコメント

Accepted to Findings of EMNLP 2026

arXiv ID: 2609.21793 / 要約の誤りについて