arXiv論文メモ
新着一覧
eess.AS / cs.SD · 査読状況未確認

音声表現と生成モデルを同時に学ぶテキスト音声生成

UNITE-AUDIO: Joint Learning of Continuous Tokenization and Latent Flow Matching for Text-to-Audio Generation

Runwu Shi, Kai Li, Yujin Wang, Dong Yang, Jiahui Li, Jiang Wang, Chang Zeng, Benjamin Yen, Ashizawa Takeshi, Chunxiang Jin, Kazuhiro Nakadai

この論文をやさしく読む

ひとことで言うと

文章から音声を作る際、音声の内部表現と生成モデルを別々ではなく同時に学ぶ方法。

何に役立つ?

小型の音声生成モデルで表現学習と生成品質を両立する設計の検討に役立つ。

この研究の面白いところ

生成の目的に合わせて潜在表現そのものを変え、構成要素を除く比較で共同学習の効果を調べた。

どこまで分かった?

要旨は競争力のある性能を述べるが、具体的な評価値やすべての条件での優位性は示していない。

v2のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

テキストから音声を生成する技術は、自然言語の説明を忠実に反映した現実的な音声を合成することを目指す。多くの方法は二段階の潜在表現を使い、まず音声トークナイザーを再構成のために最適化して固定し、次にその潜在空間で生成モデルを学習する。しかし再構成向けに作られた表現が生成にも最適とは限らないため、表現と生成を同時に学ぶ動機がある。本研究は、著者らの知る限り初めて、連続的な音声表現と潜在空間のフローマッチングを同時に学ぶUnite-Audioを導入する。再構成と自己教師ありの生成予測を結び付けることで、潜在空間を固定した中間表現とせず、生成の目的がその形を直接決めるようにした。さらに、テキストを条件とした生成を改善するため、Flow-GRPOによる事後学習を使う。実験では小型の潜在フロー模型で競争力のある性能を示し、構成要素を取り除く比較で、音声表現と生成モデルを同時に学ぶ利点を確認した。音声の例も公開している。

v2の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-23(UTC)
最新改訂
2026-09-24 · v2
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Text-to-audio (TTA) generation aims to synthesize realistic audio that faithfully reflects natural-language descriptions. Most TTA systems adopt a two-stage latent paradigm: an audio tokenizer is optimized for reconstruction and then frozen, after which a generative model is trained in the resulting latent space. However, reconstruction-oriented representations may be suboptimal for generation, motivating joint representation and generative learning. To this end, we introduce Unite-Audio, to our knowledge, is the first to jointly learn continuous audio representations and latent flow matching for TTA. By coupling reconstruction with self-supervised generative prediction, Unite-Audio allows the generative objective to directly shape the latent space rather than treating it as a fixed intermediate representation. We further employ Flow-GRPO post-training to improve text-conditioned generation. Experiments show competitive TTA performance with a compact latent flow model, while ablation studies confirm the benefit of jointly learning the audio representation and generative model. Audio samples are available at https://runwushi.github.io/Unite-Audio.

arXiv ID: 2609.28206 / 要約の誤りについて