音声コーデックによる再合成に耐える潜在表現の透かし
Latent Audio Watermarking for Robustness to Neural Codec Resynthesis
この論文をやさしく読む
ひとことで言うと
音声をニューラルコーデックで作り直しても検出できる透かしを、波形ではなくコーデック内部の連続値の表現に埋め込む研究。
何に役立つ?
音声が圧縮・再合成される経路で透かしを残す方法の設計に役立つ可能性がある。要旨が示すのは透かしの検出と音質の比較であり、すべての音声処理経路での保証ではない。
この研究の面白いところ
コーデック再合成を学習に含めなくても頑健性が生じ、学習した変化は同じ大きさのランダムな変化より再処理後に残りやすかった。チャンネルへの配分が時間構造より重要という観察も報告している。
どこまで分かった?
検証は固定した学習済みEnCodecを中心とする限定的な構成で行われた。DACへの転用や多くの波形変形での検出は報告されるが、あらゆる未知のコーデックへの耐性までは示していない。音質低下の多くは媒体のEnCodec再構成にも由来する。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
既存の音声波形に埋め込む透かしは、従来型の多くの変形には耐えるが、ニューラル音声コーデックで再合成すると性能が大きく落ちる場合がある。本研究では、学習済みEnCodecを固定した限定的な構成を用い、連続値のニューラルコーデック潜在表現が透かしの埋め込み先としてより適しているかを調べる。検証のため、フィードフォワード型の埋め込み器で複数ビットの情報を加算的な潜在表現の変化に変換し、変更していないコーデックのデコーダーで復号する。AudioSealおよびWavMarkと比較して、提案した潜在表現への透かしは、EnCodecによる繰り返しの再合成や低ビットレートでの再合成に対して性能がより緩やかに低下し、学習時に用いていないDACにも適用でき、ほとんどの波形変形でも高い検出性能を維持した。コーデックによる再合成を対象とする学習を行わなくても、EnCodecに対する大きな頑健性が現れた。このことは、この性質が潜在表現を使う定式化自体に備わっており、コーデックを考慮した学習によってさらに強まることを示す。学習された変化は、同じノルムを持つランダムな対照の変化よりも、コーデックを通して再処理した後に強く残った。その残り方は、時間方向の構造よりも、チャンネルごとの割り当てに強く依存していた。最終的な知覚品質は、固定したEnCodecで再構成した音声の品質に近いままだった。したがって、観測された品質低下の多くは、透かしではなく、透かしの媒体となるコーデック自体に由来することが示唆される。全体として、連続値のニューラルコーデック潜在表現は、ニューラルコーデックによる再合成に耐える音声透かしの埋め込み先として有望である。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-22(UTC)
- 最新改訂
- 2026-09-22 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-22 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Existing waveform-domain audio watermarks are robust to many conventional distortions but can degrade substantially under neural codec resynthesis. We investigate whether continuous neural codec latents provide a more suitable embedding space using a restricted formulation built around frozen pretrained EnCodec. To test this, a feedforward embedder maps a multi-bit payload to an additive latent perturbation decoded through the unchanged codec decoder. Compared with AudioSeal and WavMark, our latent watermark formulation degrades more gradually under repeated and low-bitrate EnCodec resynthesis, transfers to unseen DAC, and retains high detection under most waveform distortions. Substantial EnCodec robustness emerges even without codec-resynthesis supervision, indicating that this behavior is inherent to our latent formulation and is further strengthened by codec-aware training. Learned perturbations are also preserved more strongly through codec cycling than equal-norm random controls, with preservation depending more on channel-specific allocation than temporal structure. End-to-end perceptual quality remains close to that of the frozen EnCodec reconstruction, indicating that much of the observed degradation originates from the codec carrier itself. Overall, these results show that continuous neural codec latents provide a promising embedding space for watermarks that remain robust to neural codec resynthesis.
arXiv ID: 2609.25830 / 要約の誤りについて