arXiv論文メモ
新着一覧
cs.SD / cs.CR · 査読状況未確認

音声強調処理がAI音声の電子透かしを消す危険性

The Vulnerability of Neural Audio Watermarks under Speech Enhancement

Xincong Zhong, Shengyao Wang, Lingfeng Yao, Yihang Bao, Jinze Yu, Miao Pan, Jiang Liu

この論文をやさしく読む

ひとことで言うと

AI生成音声につけた目に見えない識別情報が、音声の雑音を取り除く処理で消えるかを実験で調べています。

何に役立つ?

音声透かしの頑健性を評価する際、一般的な信号のひずみだけでなく音声強調も試す必要があると示します。

この研究の面白いところ

ガウス雑音と音声強調を組み合わせ、識別型と生成型の処理を6種類の透かしで比較しています。

どこまで分かった?

要旨は透かし除去の傾向を報告していますが、個々の透かしの成功率や音声品質への影響の数値は示していません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

AIが生成した音声を追跡できるようにするため、商用の音声生成システムではニューラル音声透かしの導入が進んでいる。しかし、その頑健性は主に従来の信号のひずみに対して研究されてきた。透かしは音声信号に加えた知覚できない雑音と見なせるため、雑音除去モデルである音声強調(SE)によって消されるのではないかという疑問が生じる。 本研究では、ガウス雑音とSEモデルを連結した、内部を知らなくても実行できる透かし除去手法を検討する。識別型と生成型の両方のSE方式を扱い、AudioSeal、WavMark、SilentCipher、Timbre、Perth、AlignMarkの6種類のニューラル透かしを対象とする。実験結果では、この方法は透かし除去において既存のニューラル音声再合成法を大きく上回った。特に、雑音を減らしながら音声の調波成分を再構成する生成型SEは、透かしを強く損なうことが分かった。これらの知見は、SEが現在の音声透かし手法に深刻な脅威となることを示し、透かし設計時にSEを考慮した頑健性評価を行う必要性を指摘する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-24(UTC)
最新改訂
2026-09-24 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Neural audio watermarks are increasingly deployed in commercial speech generation systems to make AI-generated speech traceable, yet their robustness has been studied mainly under conventional signal distortions. Since a watermark can be regarded as imperceptible noise added to the speech signal, a natural question is whether speech enhancement (SE), as a denoising model, can remove it. In this paper, we cascade Gaussian noise with SE models as a black-box watermark removal attack, covering both discriminative and generative SE paradigms, against six neural watermarks: AudioSeal, WavMark, SilentCipher, Timbre, Perth, and AlignMark. Experimental results show that the proposed attack significantly outperforms existing neural re-synthesis methods in watermark removal. In particular, we find that generative SE, which reconstructs the harmonic regions of speech while denoising, is highly destructive to watermarks. These findings show that SE poses a serious threat to current audio watermarking methods, and we call for SE-aware robustness evaluation in watermark design.

arXiv ID: 2609.29040 / 要約の誤りについて