声の再識別も防ぐ音声合成モデルの話者情報忘却
Forget who you Forgot: Speaker Unlearning to Prevent Re-Identification in Zero-Shot Text-to-Speech
この論文をやさしく読む
ひとことで言うと
特定の話者の声だけを音声合成モデルに再現させにくくし、他の話者の合成能力を残す方法です。
何に役立つ?
無断の音声複製を抑えるために、話者単位の拒否設定を音声合成モデルへ反映する研究に役立つと考えられる。
この研究の面白いところ
声の類似度だけでなく、150人の候補から元の話者を当てられるかも測り、再識別率が73.5%から0.5%へ下がった。
どこまで分かった?
報告された数値はCosyVoice2と要旨に示された評価設定での結果である。ほかの音声合成モデルや攻撃方法での結果は要旨からは分からない。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
近年のゼロショット音声合成(ZS-TTS)は、わずか数秒の参照音声から話者の声を高い忠実度で再現でき、無断の声の複製やなりすましへの懸念を生んでいる。話者の識別情報を忘却させる方法は、ほかの話者の音声合成能力を保ちながら、拒否を選んだ話者についてだけこの能力を抑える手段として現れた。ただし、従来法は話者との類似度を下げられても、再識別を防ごうとすると音声品質が大きく低下することが多い。この観察に基づき、固定した音声合成の基本モデルに、学習した話者ゲートと話者に依存しない活性化の方向付けを組み合わせる、軽量な忘却手法GUARDを提案する。方向付けベクトルをグループ相対報酬最適化で調整し、忘却対象話者の出力を集団レベルの別人との類似度へ移しつつ、聞き取りやすさと音声の自然さを保つ。 CosyVoice2での評価では、忘却対象話者との類似度は0.541から0.103に下がり、150人の話者一覧からの再識別正答率は73.5%から0.5%に下がった。一方、保持対象話者の声の再現能力は維持された。この結果は、類似度の低下だけでは話者の識別情報の忘却成功を十分に表せない可能性を示し、再識別を補完的な評価指標として重視する。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-23(UTC)
- 最新改訂
- 2026-09-23 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-23 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Recent zero-shot text-to-speech (ZS-TTS) systems can reproduce a speaker's voice with high fidelity from only a few seconds of reference speech, raising concerns over unauthorized voice cloning and impersonation. Speaker identity unlearning has recently emerged as an approach to selectively suppress this capability for speakers who opt out while preserving synthesis capability for other speakers. Although existing approaches reduce speaker similarity, preventing re-identification often faces severe degradation of speech quality. Motivated by this observation, we propose GUARD, a lightweight speaker identity unlearning framework that combines a learned speaker gate with speaker-agnostic activation steering on a frozen TTS backbone. The steering vectors are optimized using group-relative reward optimization to shift outputs from forget speakers toward population-level impostor similarity while preserving intelligibility and speech naturalness. On CosyVoice2, GUARD reduces forget-speaker similarity from 0.541 to 0.103 and re-identification accuracy in a 150-speaker gallery from 73.5% to 0.5%, while preserving retain-speaker reproduction. The results demonstrate that similarity reduction alone may not fully characterize successful speaker identity unlearning and highlight re-identification as a complementary criterion for its evaluation.
arXiv ID: 2609.27399 / 要約の誤りについて