音声言語モデルの内部信号で脱獄を防ぐ
AEGIS: Audio Endogenous Guarding via Internal Signals Against Large Audio-Language Model Jailbreaks
この論文をやさしく読む
ひとことで言うと
音声AIが危険を内部では認識していても拒否しない場合に、中間層の信号から安全機能を起動します。
何に役立つ?
音声言語モデルの安全対策回避を防ぐ設計で、内部表現に基づく選択的な介入の評価材料になります。
この研究の面白いところ
失敗原因を「危険を認識できない」と決めつけず、中間層と後段を分けて調べました。6モデル・3ベンチマークで危険な応答率が平均17.9%から0.4%になりました。
どこまで分かった?
評価は記載された6モデルと3ベンチマークの範囲です。無害入力の誤拒否はわずかに増えたと述べていますが、具体的な値は要旨にありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
大規模音声言語モデル(LALM)は、言語モデルが音声を処理し理解できるようにする一方、さまざまな音声による安全対策の回避にもさらす。本研究は、回避が成功するのは有害な意図を認識できないためか、それとも認識した後に失敗するためかを問う。層ごとの内部表現を調べると後者であると分かった。中間層の表現からは危険に関する情報を読み取れるのに、内部の危険信号が後段の処理で拒否へつながらない。著者らは、この食い違いを危険認識と拒否の間の隔たりと呼ぶ。 この結果に基づき、中間層の危険判定ゲートが必要に応じて後段の安全用アダプターを起動する、検出してから介入する防御法AEGISを提案する。6種類のLALMと、性質の異なる三つの音声による安全対策回避のベンチマークでは、平均の危険な応答率を17.9%から0.4%へ下げ、無害な入力を誤って拒否する割合の増加はわずかだった。結果は、内部で選択的に介入することが、LALMの拒否動作をより頑健にする有効な方法であると示す。コードは公開されている。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-24(UTC)
- 最新改訂
- 2026-09-24 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-24 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Large audio-language models (LALMs) expand language models to process and interpret audio, but also expose them to heterogeneous audio jailbreaks. We ask whether successful jailbreaks reflect failures to recognize harmful intent or failures occurring after such recognition. Layer-wise probing reveals the latter: risk-related information remains decodable from intermediate representations, yet the internal risk signal fails to translate into refusal in later-layer processing. We identify this discrepancy as the risk-to-refusal gap. Building on this finding, we propose AEGIS, a detect-then-intervene defense whose mid-layer risk gate selectively activates downstream safety adapters. Across six LALMs and three heterogeneous audio jailbreak benchmarks, AEGIS reduces the average unsafe rate from 17.9% to 0.4%, while causing only a marginal increase in over-refusal on benign inputs. These results establish selective internal intervention as an effective path toward more robust refusal in LALMs. The code is available at https://github.com/azzzzliao/aegis-audio-defense.
著者のコメント
Submitted to ICASSP 2027. 5 pages, 2 figures, 3 tables
arXiv ID: 2609.29287 / 要約の誤りについて