arXiv論文メモ
新着一覧
cs.SD · 査読状況未確認

音声コーデックによる再合成後も残る電子透かし

NeuMark: Neural Codec Resynthesis-Robust Audio Watermarking in the Codec Latent Space

Annan Wu, Wen-Chin Huang, Tomoki Toda

この論文をやさしく読む

ひとことで言うと

音声生成の出所を示す16ビットの透かしを、再合成で消えにくいコーデック内部の表現に埋め込む研究。

何に役立つ?

生成音声が圧縮・再合成されても透かしを検出・復元する設計の参考になる。

この研究の面白いところ

波形ではなく音響トークンの複数の量子化層へメッセージを分散する。

どこまで分かった?

要旨は頑健性の改善を述べるが、検出率や復元率の具体的数値は示していない。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

生成した音声の出所を追跡するには、音声への電子透かしがますます重要である。従来は波形、声質の特徴、潜在表現などに透かしを埋め込み、通常のデジタル信号処理による改変に耐える方法が提案されてきた。一方、最近のニューラルコーデックは別の脅威となる。量子化された音響表現を通じて音声を再合成するため、コーデックが保つ構造に沿っていない透かしの痕跡を消してしまい得る。本論文は、この再合成に対応するため、SpeechTokenizerの音響トークンへ透かしの痕跡を埋め込む、コーデックの潜在空間を使った枠組みNeuMarkを提案する。クロスアテンションを使って残差ベクトル量子化(RVQ)の複数層に16ビットのメッセージを注入し、コーデックに沿った潜在構造へ透かしを分散する。実験では、透かしの検出とメッセージの復元の両方に対応しながら、ニューラルコーデックによる再合成後の頑健性を大きく改善した。また、再構成された音声を基準にした透かしの目立たなさと、元の音声を基準にした頑健性とのトレードオフを分析する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-22(UTC)
最新改訂
2026-09-22 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Audio watermarking is increasingly important for tracing generated speech. Several audio watermarking methods have been proposed to embed the watermark in various domains, such as waveform, timbre feature, or latent representations, for making the embedded watermark robust against traditional digital signal processing (DSP) attacks. On the other hand, modern neural codecs introduce a different threat from DSP attacks: they resynthesize speech through quantized acoustic representations and can remove the embedded watermark evi- dence that is not aligned with codec-preserved structure. In this paper, we propose NeuMark, a codec-latent audio watermarking framework that embeds watermark evidence into SpeechTok- enizer acoustic tokens to address this resynthesis threat. NeuMark uses cross-attention to inject a 16-bit message across residual vector quantization (RVQ) layers, distributing the watermark over codec-aligned latent structure. Experimental results show that NeuMark substantially improves robustness under neural- codec resynthesis while supporting both watermark detection and message recovery. We also analyze the trade-off between reconstruction-referenced transparency and original-referenced robustness.

arXiv ID: 2609.25719 / 要約の誤りについて