arXiv論文メモ
新着一覧
cs.CL / cs.AI · 査読状況未確認

略語などの投稿文を発音へ変換する多言語ベンチマーク

Phonemizing User-Generated Text: A Benchmark, Taxonomy, and Compositional Approach

MinJu Jeon, Younghan Park, Han Sung Park, Jong-Hwan Kim, Dong-Jin Kim, Hoyeon Lee

この論文をやさしく読む

ひとことで言うと

略語や非標準的なつづりを含む投稿文を音声合成用の発音へ変える方法を評価する研究。

何に役立つ?

考えられる用途は、利用者が書いた文章を読み上げる多言語音声合成の評価と改善。

この研究の面白いところ

英語・ベトナム語・韓国語のベンチマークを作り、標準形を明示して推定すると発音誤りが減ると示した。

どこまで分かった?

報告された最大66.8ポイントは標準形と非標準形の性能差。言語ごとの詳細な改善幅は要旨にない。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

音声合成システムは、pplやimoのような利用者が書いた文章を扱うことが増えている。こうした表記の発音は、見た目の文字列だけでなく、標準的な形を推定して決める必要がある。本研究は、英語、ベトナム語、韓国語の利用者生成文について、文字から発音への変換(G2P)を評価する最初のベンチマークUGTPhonと、推論過程に基づいて誤りを細かく診断する分類体系を導入する。 既存のG2Pモデルと先端的な大規模言語モデルには、標準形と非標準形の間で系統的な性能差があり、音素誤り率の差は最大66.8ポイントに達した。比較の基準として、完全一致による参照と段階的な復号を通じて標準形の根拠を取り入れる、単純な合成的G2P法を提案する。 同じByT5およびQwen2.5-0.5Bの基幹モデルで比べると、標準形を明示的に推定する方法は、非標準形のG2P誤りを一貫して減らした。5億パラメータ版は、はるかに大きな少数例提示の先端モデルとも競争力のある成績を示し、利用者生成文の発音変換で標準形の推定を明示する利点が分かった。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-23(UTC)
最新改訂
2026-09-23 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Text-to-speech systems increasingly process user-generated text (UGT) such as ppl and imo, whose pronunciation must be inferred from the canonical rather than surface form. We introduce UGTPhon, the first grapheme-to-phoneme (G2P) benchmark for UGT in English, Vietnamese, and Korean, together with an inference-grounded taxonomy for fine-grained diagnosis. Existing G2P models and frontier LLMs exhibit a systematic canonical-to-non-canonical performance gap, reaching up to 66.8 PER points. As a benchmark baseline, we propose a simple compositional G2P approach that incorporates canonical-form evidence through exact-match lookup and staged decoding. Across matched ByT5 and Qwen2.5-0.5B backbones, explicit canonical-form modeling consistently reduces non-canonical G2P errors. The 0.5B variant also performs competitively with much larger few-shot frontier LLMs, highlighting the benefit of explicitly modeling canonical-form inference for UGT phonemization.

著者のコメント

Accepted in EMNLP 2026 Findings

arXiv ID: 2609.27205 / 要約の誤りについて