arXiv論文メモ
新着一覧
eess.AS / cs.LG · 査読状況未確認

音声合成の無条件埋め込みを学習可能にする

Learnable Classifier-Free Guidance Null Embeddings for Enhanced Controllable Speech Synthesis

Biel Tura Vecino, Yoach Lacombe, Julian Weber, Zbigniew Łatka, Haitong Zhang, Logan Hart, Eren Gölge

この論文をやさしく読む

ひとことで言うと

音声合成で使う固定の空ベクトルを学習可能にして、声や文章への従い方を調整する。

何に役立つ?

音声合成の話者類似性や表現力と、生成の安定性の兼ね合いを調整する際に役立つ。

この研究の面白いところ

客観評価と主観評価の両方で、学習可能な埋め込みが固定式より良い結果だった。

どこまで分かった?

要旨には具体的な評価値や利用した音声データの範囲は示されていない。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

分類器を使わないガイダンスは、条件付き予測と無条件予測を補間して生成品質や条件への忠実さを高めるため、テキスト音声合成で広く使われている。無条件の状態を表す際には、固定した空のベクトルを用いることが多い。本研究はこれを、意味のある無条件の状態を表すよう最適化した、学習可能な無条件埋め込みで置き換えることを提案する。客観的・主観的な評価では、学習可能な空埋め込みは、話者の類似性、音声の安定性、表現力の各面で固定した埋め込みを一貫して上回り、ガイダンスの強さを大きくしたときの頑健性も高かった。さらに、音声合成で条件として使う情報の種類ごとに別々の無条件埋め込みを学習すると、話者とテキストのガイダンスを細かく制御でき、生成音声の類似性と品質、安定性と表現力の間の兼ね合いが分かることを示す。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-21(UTC)
最新改訂
2026-09-21 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Classifier-free Guidance (CFG) is widely adopted in text-to-speech (TTS) systems to enhance generation quality and conditioning fidelity by interpolating between conditioned and unconditioned predictions. A common unconditional technique is to use an empty representation, in the form of a fixed null vector. In this work, we propose replacing this representation with a learnable unconditional embedding, optimized to represent a meaningful unconditional state. Objective and subjective evaluations demonstrate that learnable null embeddings consistently outperform fixed null embeddings across speaker similarity, speech stability, and expressiveness, while exhibiting greater robustness to larger guidance scales. We further show that learning a distinct unconditional embedding for each of the TTS conditioning modalities allows fine-grained control over speaker and text guidance, showcasing the trade-off between similarity and quality, and stability and expressiveness in the generated speech.

著者のコメント

Accepted paper at Interspeech 2026

arXiv ID: 2609.25411 / 要約の誤りについて