同時に聞き話す音声対話モデルを聞こえない攻撃から守る
Psychoacoustically Aligned Latent Smoothing for Adversarial Robustness of Full-Duplex Speech-to-Speech Dialogue Models
この論文をやさしく読む
ひとことで言うと
人に聞こえにくい音の細工で音声対話モデルを誤作動させる攻撃と、その防御法を調べています。
何に役立つ?
常時音声を受ける対話システムの安全性を評価し、攻撃成功率を下げる設計に役立つと考えられる。
この研究の面白いところ
攻撃音を心理音響上の聞こえにくさで制限し、防御側もその制限に合わせて潜在表現に雑音を加える。
どこまで分かった?
要旨の攻撃成功率と防御効果はMoshi型エージェントでの試験に基づく。保証半径は潜在空間での下限であり、すべての音声攻撃への完全な防御は示していない。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
音声から音声へ直接対話するモデルは、聞くことと話すことを同時に行うため、常時開いている音声入力経路が敵対的な操作にさらされる。著者らは、全二重の対話エージェントへの知覚しにくい攻撃を、元の音声の心理音響的なマスキング閾値より下に収まる加法的摂動の最適化として定式化する。攻撃目的は、狙った意味への応答誘導、応答の抑制、方針の回避の3つである。防御を施さないMoshi型エージェントに対して、内部情報を使うホワイトボックス攻撃は最大91.7%の試行で成功した。次に、心理音響特性に合わせた潜在表現の平滑化PALSを提案する。残差ベクトル量子化された潜在表現の境界で、局所的なコードブック共分散に従って形を変えた異方性ガウス雑音を加える。入力側の雑音は、攻撃者も制約されるマスキング閾値に合わせ、カルバック・ライブラーの一貫性目的で学習する。推論時の追加コストなしで適用したPALSは、応答誘導の成功率を8.3%、無応答を11.2%、方針回避を9.1%まで下げ、通常入力での品質低下は2.3%以内に抑えた。モンテカルロ平滑化を用いる変種では、潜在空間の楕円体半径として最大0.616を保証した。この保証下限を実測上の頑健性は大きく上回った。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-23(UTC)
- 最新改訂
- 2026-09-23 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-23 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
End-to-end speech-to-speech dialogue models listen and speak simultaneously, so a continuously open acoustic channel is exposed to adversarial manipulation. We formalize imperceptible attacks on full-duplex agents as optimization over additive perturbations confined beneath the psychoacoustic masking threshold of the carrier speech, under three goals: targeted semantic hijacking, response suppression, and policy jailbreaking. Against an undefended Moshi-style agent, white-box attacks succeed in up to 91.7% of trials. We then introduce psychoacoustically aligned latent smoothing (PALS), which injects anisotropic Gaussian noise shaped by local codebook covariance at the residual-vector-quantized latent interface, with input noise shaped by the masking threshold constraining the attacker and trained by a Kullback--Leibler consistency objective. Deployed with no inference-time cost, PALS reduces hijack to 8.3%, mute to 11.2%, and jailbreak to 9.1% at clean quality within 2.3%. A Monte Carlo-smoothed variant certifies an ellipsoidal latent radius up to 0.616, a guaranteed floor that the empirical robustness far exceeds.
著者のコメント
Accepted to IEEE SLT 2026
arXiv ID: 2609.27378 / 要約の誤りについて