配信向け音声合成の韻律を項目ごとに独立評価する
Multi-Dimensional Prosody Judgment For Live Streaming Speech Synthesis
この論文をやさしく読む
ひとことで言うと
表情豊かな合成音声の感情、抑揚、強さを、全体の好みに引きずられず別々に評価するモデルです。
何に役立つ?
大量の音声候補の選択や音声合成の学習フィードバックで、細かな韻律の好みを低コストで評価することを狙います。
この研究の面白いところ
総合判定を各項目へコピーするような評価の偏りを見つけ、総合ラベルの除去、不確かな項目のマスク、理由の区間ごとの強化学習で分離を図ります。
どこまで分かった?
85.29%は信頼度の高い事例で8候補から選んだ音声が人の上位3位に入る割合です。LPJの10標本評価とGeminiの単回評価は回数が異なり、D-LPJの独立判定の結果とも区別が必要です。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
ライブ配信向け音声合成(TTS)の評価には、感情、抑揚、エネルギーなど、細かく表現力の高い韻律を評価する必要があるが、従来の平均オピニオン評点(MOS)予測器では捉えきれない。Geminiのような独自提供の大規模言語モデル(LLM)はこれらを評価できるものの、大量の推論や強化学習へのフィードバックに利用するには費用が高すぎる。 そこでまず、GeminiからQwen3-Omniへ蒸留した、費用効率のよいペア比較評価器Live-ProsodyJudge(LPJ)を導入する。しかし、標準的な多次元評価には「判定の結合」という重大な欠点があることを見いだした。評価器が各項目の評点を安易に総合的な好みにそろえ、多次元の豊かな評価基準を単一の選好ビットへ縮約してしまう。 これを解決するため、Decoupled-Live-ProsodyJudge(D-LPJ)をさらに提案する。D-LPJは総合判定への盲従を防ぐために総合判定の学習目標を除き、教師あり微調整(SFT)では不確かなペア・評価項目をマスクする。さらに、正規化したアドバンテージを対応する判断根拠のテキスト区間だけに適用する、新しい区間局所型GRPO戦略を導入する。 入念に整備した人手注釈付きテストセットで評価したところ、提示順を均衡させた10サンプルのLPJは、Geminiの1回の呼び出しより高い正解率の点推定値を達成した。一方、D-LPJは項目間の結合を解消した独立の判定を生成することに成功した。さらに、8個のTTS候補から最良のものを選ぶトーナメントでは、LPJが選んだ発話が、確信度の高い事例の85.29%で人間の評価の上位3位以内に入り、TTSの細かな選好最適化に有効であることを示した。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-17(UTC)
- 最新改訂
- 2026-09-17 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-17 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Evaluating live streaming speech synthesis (TTS) requires assessing fine-grained, highly expressive prosody such as emotion, intonation, and energy which traditional MOS predictors fail to capture. While proprietary Large Language Models (LLMs) like Gemini can evaluate these aspects, they are too costly for massive inference and reinforcement learning feedback. To address this, we first introduce Live-ProsodyJudge (LPJ), a cost-effective pairwise evaluator distilled from Gemini into Qwen3-Omni. However, we identify a critical flaw in standard multi-dimensional evaluation: verdict coupling. The judge tends to lazily align all individual dimension scores with its overall preference, collapsing a rich multi-dimensional rubric into a single preference bit. To resolve this, we further propose Decoupled-Live-ProsodyJudge (D-LPJ). D-LPJ eliminates the overall verdict target to prevent blind following, masks uncertain pair-dimensions during Supervised Fine-Tuning(SFT), and introduces a novel span-local GRPO strategy that applies normalized advantages strictly to their corresponding rationale spans. Evaluated on highly curated human-annotated test sets, 10 sample balanced-order LPJ achieves higher point accuracy than a single Gemini call, while D-LPJ successfully produces independent,decoupled dimension judgments. Furthermore, in a Best-of-8 TTS candidate selection tournament, the LPJ-selected utterance falls within the human top-3 in 85.29% of high-confidence cases, demonstrating its efficacy for fine-grained TTS preference optimization.
arXiv ID: 2609.20124 / 要約の誤りについて