複数の合成音声から学習例を選びアクセント変換を改善
Multi-sample Synthetic Supervision for Accent Conversion
この論文をやさしく読む
ひとことで言うと
アクセントを変える音声モデルの学習で、合成音声を1つだけ使わず、複数候補からアクセントと元の話者・内容の保持を見て選ぶ方法です。
何に役立つ?
同じ発話を異なるアクセントで録音したデータが少ない場合に、合成データの品質を選別して学習に使うことが考えられます。
この研究の面白いところ
アクセントの正しさだけで候補を選ばず、元の音声の特徴が残るかも考慮します。アクセント分類精度と聴取評価は改善する一方、単語誤り率の小幅な悪化も報告しています。
どこまで分かった?
評価は6つの目標アクセントで行われています。要旨には各アクセントの名称や聴取評価の参加者数はありません。単語誤り率は比較法より0.29ポイント増えており、すべての指標が改善したわけではありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
アクセント変換(AC)では、話者の同一性と言語的内容を保ちながらアクセントを変える必要があるが、対応する並列録音は少ない。音声合成は代わりの教師データを提供するものの、生成された目標音声には、アクセントの実現度と元音声の特徴の保持にばらつきがある。本研究では、複数サンプルによる合成教師データの枠組みを提案する。元音声とアクセントの各条件に対する候補波形について、これらの性質を共同で評価し、変換の目標を構築する。 選択した候補に対応する離散音声コードは、言語的内容、韻律、話し方を表し、アクセントを条件とする自己回帰的な適応学習の目標となる。学習例ごとに生成した目標を1つだけ使う場合と比べ、本手法は目標アクセントの分類精度を2.49ポイント改善する。話者類似度はほぼ変わらず、単語誤り率は0.29ポイント増える。6つの目標アクセント全体では、単語誤り率(WER)7.81%を達成し、評価したシステムの中で平均聴取評価が最も高くなる。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-10-01(UTC)
- 最新改訂
- 2026-10-01 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-10-01 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Accent conversion (AC) requires changing accent while preserving speaker identity and linguistic content, yet parallel recordings are scarce. Speech synthesis provides an alternative source of supervision, but generated targets vary in accent realization and source preservation. We propose a multi-sample synthetic supervision framework that constructs conversion targets by jointly assessing these properties across candidate waveforms for each source--accent condition. Selected candidates provide associated discrete speech codes, representing linguistic content, prosody, and speaking style, as targets for accent-conditioned autoregressive adaptation. Compared with using one generated target per training example, our method improves target-accent classification accuracy by 2.49 percentage points, while speaker similarity remains nearly unchanged, and word error rate increases by 0.29 percentage points. Across six target accents, our method achieves 7.81% WER and the highest mean listening ratings among evaluated systems.
arXiv ID: 2610.01961 / 要約の誤りについて