arXiv論文メモ
新着一覧
eess.AS · 査読状況未確認

一段階の文章音声生成モデルを分布のずれで追加学習するDriftAudio

DriftAudio: Marginal Drifting for Distributional Post-Training of One-Step Text-to-Audio Generators

Xingyu Chen, Fei Ma, Sipei Zhao

この論文をやさしく読む

ひとことで言うと

一段階で文章から音声を作るモデルを、音声全体の分布を合わせる追加学習で改善した。

何に役立つ?

生成速度を維持しながら文章音声生成の品質を高める手法として役立つ可能性がある。

この研究の面白いところ

文章ごとの実音声が少ない問題を、条件ごとでなく音声の周辺分布を調整することで避けた。

どこまで分かった?

AudioCapsと二つの出発モデルでの結果である。FdAudioでは一部指標にトレードオフもあった。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

最近の一段階で文章から音声を作るモデルは、推論時の費用を大きく減らしたが、生成される音声の分布には追加学習による改善の余地がある。本研究は、既存の一段階音声生成器へDriftingを適用する、分布に基づく追加学習法DriftAudioを提案する。自由形式の文章を条件とする場合、特定の条件に対応する本物の音声は通常一つか少数しかないため、条件ごとにDriftingを適用することは難しい。そこでDriftAudioは、文章を条件とする生成を維持しつつ、周辺的な音声分布にDriftingを行う。 固定した音声特徴空間で、本物の音声から再標本化したデータ、生成音声を蓄える更新型の保管庫、現在の生成音声のバッチを使って、ずれを表す場を推定する。得られた場は勾配を切り離した学習目標として生成器だけを更新するために使われ、元の一段階の推論手順は維持される。AudioCapsでは、MeanAudioから始めるとFADとFDをそれぞれ33.9%と17.6%下げ、KLとCLAPも改善した。FdAudioから始めた場合もFAD、FD、KLをさらに下げたが、ISとCLAPにはトレードオフがあった。この結果は、一段階の文章音声生成に対する、周辺分布に基づく追加学習の有効性を示す。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-23(UTC)
最新改訂
2026-09-23 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Recent one-step text-to-audio (TTA) models substantially reduce inference cost, yet their generated distributions can still be improved through post-training. We propose DriftAudio, a distributional post-training method that adapts Drifting to pretrained one-step TTA generators. Applying Drifting condition-wise is challenging under free-form text conditioning, where only one or a few real samples are typically available for a particular condition. DriftAudio instead performs Drifting on the marginal audio distribution while retaining text-conditioned generation. The drifting field is estimated in a frozen audio feature space using resampled real samples, a rolling bank of generated samples, and the current batch of generated samples. The resulting Drifting field provides a detached training target for updating only the generator, keeping the original one-step inference procedure. On AudioCaps, starting from MeanAudio, DriftAudio reduces FAD and FD by 33.9% and 17.6%, respectively, while also improving KL and CLAP. Starting from FdAudio, it further reduces FAD, FD, and KL, with trade-offs in IS and CLAP. These results demonstrate the effectiveness of marginal distributional post-training for one-step TTA generation.

著者のコメント

Submitted to IEEE ICASSP 2027

arXiv ID: 2609.27598 / 要約の誤りについて