言語をまたぐ音声複製でアクセントを抑えつつ話者らしさを保つ手法
Accent Analogy Guidance: More Speaker Similarity at Equal Accent in Cross-Lingual Voice Cloning
この論文をやさしく読む
ひとことで言うと
別の言語で声を再現する際、話者らしさを残しながら参照音声のアクセントの混入を減らす方法を調べています。
何に役立つ?
多言語の吹き替えや音声合成で、話者の声と目標言語のアクセントの両立を評価する際に役立つと考えられます。実証は4つの公開TTSモデルと記載の評価条件に限られます。
この研究の面白いところ
同じ合成音声を2言語で生成して差を取ることで、モデル内部の予測だけからアクセント成分を推定し、追加学習なしで生成に反映します。
どこまで分かった?
全モデルで改善したわけではなく、X-Voiceでは効果がありませんでした。要旨には4モデル、3テストセット、12人の聴取者などの評価条件が示されています。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
言語をまたぐゼロショット音声合成では、参照音声のアクセントが目標の発話に混入する。そこで、学習を要しないサンプリング項であるアクセント類推ガイダンス(AAG)を提案する。モデル自身が同じ合成音声を2言語で生成した予測からアクセントの方向を推定して差し引く。これにより声の特徴は相殺され、アクセントの成分だけが残る。実際の吹き替えデータで、アクセントを判定するブラインド評価のLLMを使うと、参照音声とテキストの間でclassifier-free guidanceの重みを変える方法とその派生法は、話者同一性とアクセントのほぼ同じトレードオフ曲線上に並ぶ。本研究では、同じアクセント評価でその曲線を上回る話者類似度(ΔSIM)によって手法を評価する。4つの公開TTSモデルにわたり、AAGはこの曲線を上回った。OmniVoiceでは3つのテストセットでΔSIMが+0.11〜+0.27となった。話者類似度0.29のとき、5段階のアクセント評価は3.51〜4.28で、重み変更法では話者類似度を0.02に保つにとどまった。MaskGCTとCosyVoice 2でも各モデルの曲線を上回り、F5-TTSではどの重み変更設定よりも自然な目標言語のアクセントになった。LLMを使わない言語識別指標と12人の聴取者による評価も一致した。前提条件の試験とモデル自身のトレードオフ曲線の到達範囲から、AAGが有効かどうかと改善幅のおおよそを事前に見積もれ、改善しない唯一のモデルであるX-Voiceも予測できた。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-24(UTC)
- 最新改訂
- 2026-09-24 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-24 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
In cross-lingual zero-shot text-to-speech, the accent of the reference leaks into the target speech. We propose accent analogy guidance (AAG), a training-free sampler term that subtracts an accent direction estimated from the model's own predictions for one synthetic voice rendered in both languages, so the voice cancels and only the accent remains. By a blind LLM accent judge on real dubbing data, reweighting classifier-free guidance between reference and text, and its variants, stay near one identity-accent trade-off curve; we score a method by its speaker similarity above that curve at equal accent ($\Delta$SIM). Across four open TTS models AAG lies above the curve: on OmniVoice $\Delta$SIM is +0.11 to +0.27 on three test sets (accent 3.51 to 4.28 on a 1-5 scale at speaker similarity 0.29, where reweighting keeps 0.02); MaskGCT and CosyVoice 2 also lie above their curves, and on F5-TTS it is more native than any reweighting setting. An LLM-free language-ID measure and a twelve-listener panel agree. A premise test and the reach of a model's own curve indicate in advance whether and roughly how much AAG can gain, predicting the one model where it gains nothing (X-Voice).
著者のコメント
5 pages, 1 figure, 2 tables. Submitted to ICASSP 2027. Listening samples: https://yoomee-cho.github.io/accent-analogy-guidance/
arXiv ID: 2609.29123 / 要約の誤りについて