arXiv論文メモ
新着一覧
cs.SD · 査読状況未確認

少資源言語の音声合成を合成音から実音声へ段階適応

From Reliable Text to Real Voices: Trust-Aware Progressive Adaptation for Low-Resource TTS

Jiayi Lu, Yizhong Geng, Jinghan Yang, Tianhan Jiang, Boxun An, Yingming Gao, Ya Li

この論文をやさしく読む

ひとことで言うと

文字起こしが少ない言語で、合成音声を先に、実際の録音を後に使って音声合成モデルを適応させた。

何に役立つ?

少資源言語の音声合成で、誤りのある自動文字起こしを使いつつ発話内容の正確さを高める学習手順の参考になる。

この研究の面白いところ

二つの音声認識器の一致を疑似ラベルの信頼度として使い、合成音声で文章との対応を学んだ後に実音声で声の特徴を戻す。

どこまで分かった?

評価は要旨にあるビルマ語・ラオ語と指定モデルでの実験。手作業の文字起こしが不要になるとは述べていない。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

データの少ない言語での音声合成(TTS)の適応は、対応する文章と音声の組が少なく、手作業の文字起こしに費用がかかることで制限される。声が固定された既存のTTSシステムは比較的正確な発音を提供できるが、その合成音声は話者の多様性が乏しく、抑揚が平板になり得る。実際の録音は自然な抑揚と多様な声を持つ一方、自動音声認識(ASR)で付けた疑似ラベルには文字起こしの誤りがあり得る。本研究は、教師データを与える順序が内容の正確さと話者の類似度に影響することを見いだし、信頼度を考慮した段階的な適応を提案する。合成音声から実音声へ適応する際、まず文章と音声の対応を確立し、次に実音声によって参照話者の声を制御する能力を回復する。固定した二つのASRシステムの文字起こしが一致する程度を疑似ラベルの信頼度の代用として重み付けし、誤った教師情報の影響を抑える。ビルマ語とラオ語のFireRedTTS3、およびビルマ語のOmniVoiceを使った実験では、高い自然さと競争力のある話者類似度を保ちつつ、内容の正確さが改善した。合成音声と実音声を組み合わせる際に教師情報の順序と疑似ラベルの信頼性を同時に考慮すれば、手作業の文字起こしを減らして、少資源言語でのゼロショット音声クローンを実現する実践的な道筋となる。音声デモは著者の公開ページで利用できる。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-22(UTC)
最新改訂
2026-09-22 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Low-resource text-to-speech (TTS) adaptation is constrained by scarce paired data and costly manual transcription. Existing fixed-voice TTS systems can provide relatively accurate pronunciation, but their synthetic speech offers limited speaker diversity and may exhibit flat prosody. Real recordings provide natural prosody and diverse voices, yet their automatic speech recognition (ASR) pseudo-labels may contain transcription errors. We find that supervision order affects content accuracy and speaker similarity. We propose trust-aware progressive adaptation: synthetic-to-real adaptation first establishes text-speech correspondences, then restores reference-speaker control using real speech. Transcript-agreement weighting uses agreement between two fixed ASR systems as a proxy for pseudo-label reliability to limit noisy supervision. Experiments with FireRedTTS3 on Burmese and Lao and OmniVoice on Burmese show improved content accuracy with high naturalness and competitive speaker similarity. Jointly considering supervision order and pseudo-label reliability when combining synthetic and real speech offers a practical path to zero-shot voice cloning in low-resource languages with less manual transcription. Audio demos are available at https://insiderx-pro.github.io/S2R-Adaptation-TTS/

著者のコメント

5 pages, 2 figures, 3 tables. Jiayi Lu and Yizhong Geng contributed equally. Corresponding author: Ya Li

arXiv ID: 2609.25951 / 要約の誤りについて