音声合成モデルの由来を出力だけから照合するTTS-Guard
TTS-Guard: Black-Box Ownership Verification of Text-to-Speech Models via Adaptive Adversarial Speaker-Pair Fingerprints
この論文をやさしく読む
ひとことで言うと
音声合成モデルに特徴的な反応を引き出す話者の組み合わせを使い、内部を見られないモデルが元のモデルに由来するかを調べる方法です。
何に役立つ?
独自の音声合成モデルが複製や変更を経て使われていないか、技術的に照合する用途が考えられます。照合スコアは権利関係そのものを確定するものとは区別されます。
この研究の面白いところ
単に特徴を残すだけでなく、音声処理やモデルの微調整などを想定したシャドーモデルを使って、消えにくい特徴を作ろうとしています。
どこまで分かった?
評価は5つのTTSシステムと記載された変更・攻撃手法が対象です。平均成功率96.4%には偽陽性率5.8%という条件が伴い、誤判定がないことや未知の変更に常に耐えることを示してはいません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
ゼロショット音声合成(TTS)モデルの急速な成熟によって、高品質な音声クローンが広く利用できるようになり、独自の音声モデルが無断で複製、微調整、転売されることへの懸念が強まっている。しかし、TTSの所有者検証はなお十分に解決されていない。音声は連続波形であり、加えた摂動は通常の信号処理で容易に失われるうえ、人の聴覚では、視覚よりも知覚上許容される変更がはるかに小さいためである。 本研究では、敵対的な話者対フィンガープリントに基づく、TTSモデルのブラックボックス所有者検証の枠組みTTS-Guardを提案する。TTS-Guardは、(i)モデル構造に依存せず目立ちにくくするため、2種類の埋め込み空間で鍵となる話者対を選び、(ii)微調整、枝刈り、量子化、蒸留を網羅するシャドーモデルの適応的カリキュラムによって摂動を最適化し、(iii)ブラックボックスへの問い合わせを集約して、較正された検証信頼度スコアを算出する。 主要な5つのTTSシステムにおいて、明瞭さと自然さを保ちつつ、偽陽性率5.8%で平均フィンガープリント成功率96.4%を達成した。このフィンガープリントは、10種類の音声への攻撃、6種類のモデル変更、および2つの最先端の敵対的摂動除去手法に対しても有効性を維持する。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-20(UTC)
- 最新改訂
- 2026-09-20 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-20 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
The rapid maturation of zero-shot Text-to-Speech (TTS) models has turned high-quality voice cloning into a widely available capability, raising acute concerns over unauthorised replication, fine-tuning and resale of proprietary speech models. Yet ownership verification for TTS remains largely open: speech is a continuous waveform whose perturbations are easily destroyed by routine signal processing, and the human auditory system imposes a much tighter perceptual budget than vision. We present \textbf{TTS-Guard}, a black-box ownership verification framework for TTS models built on \emph{adversarial speaker-pair fingerprints}. TTS-Guard(i) selects key speaker pairs in a \emph{dual} embedding space for architecture-agnostic stealth;(ii) optimises a perturbation through an \emph{adaptive curriculum} of shadow models covering fine-tuning, pruning, quantisation and distillation; and (iii) aggregates black-box queries into a calibrated \emph{Verification Confidence Score}. On five mainstream TTS systems, TTS-Guard reaches an average Fingerprint Success Rate of $96.4\%$ at a False Positive Rate of $5.8\%$, while preserving intelligibility and naturalness. The fingerprint remains effective against ten audio attacks, six model modifications, and two state-of-the-art adversarial purifiers.
arXiv ID: 2609.23729 / 要約の誤りについて