arXiv論文メモ
新着一覧
eess.AS · 査読状況未確認

中国語の音声合成用テキストを逐次正規化するStreamTN

StreamTN: A Low-Latency Streaming Chinese Text Normalization Model for Streaming TTS in Dialogue Systems

Wenhao Li, Jinrui Liang, Haoyu Zhang, Jingbin Hu, Xiaming Ren, Hanke Xie, Huakang Chen, Chengyou Wang, Dake Guo, Linhan Ma, Su Feng, Houdun Liu, Yunxiang Chen, Lei Xie

この論文をやさしく読む

ひとことで言うと

言語モデルが文章を出力している途中から、音声合成が読み上げられる形へ中国語テキストを変換する専用モデルです。

何に役立つ?

文章が完成するのを待たずに読み上げ処理へ進めたい音声対話システムで、待ち時間を減らす用途が考えられます。

この研究の面白いところ

対話の中核モデルを正規化専用に変えるのではなく、小型の別モデルで入力と出力を並列に流す構成です。

どこまで分かった?

対象は中国語のテキスト正規化です。精度と遅延の改善を報告していますが、具体的な値や評価機器は要旨にありません。幻覚が少ないという比較であり、完全に生じないという保証ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

音声合成(TTS)は、大規模言語モデル(LLM)を中心とする音声対話システム(SDS)で、音声応答を提供する不可欠なモジュールである。正確な音声合成のため、LLMが生成する応答はテキスト正規化(TN)モジュールを通してTTSが読める形式へ変換する必要があり、リアルタイムのSDSでは厳しい低遅延要件が課される。既存のTNは主としてルールに基づき、手作業の設計に依存し、未知のパターンへの汎化が弱い。LLM自身にプロンプトの工夫でTNを行わせることもできるが、非ストリーミング処理に伴う最初のトークンまでの高い遅延、幻覚のリスク、中核のLLMをTNだけに微調整した際の知的能力や推論能力の低下という主要な制約がある。 これらに対処するため、軽量なLLMに基づく中国語のストリーミングTNモデルStreamTNを提案する。Qwen3-0.6Bを基盤とし、入力トークンと出力トークンを2つの並列の流れで処理する二系統のストリーミング構成を採用することで、複雑なプロンプトなしに低遅延のリアルタイム推論を可能にする。さらに、タスク専用の微調整により、ルールベースのシステムや汎用LLMより優れたTN性能と少ない幻覚を得る。また、多様なテキスト場面を含むTNベンチマークを導入し、音声対話システムにおける音声生成のための包括的な評価基準を提供する。実験によって、精度と推論遅延におけるStreamTNの有効性を示す。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-21(UTC)
最新改訂
2026-09-21 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Text-to-Speech (TTS) is an essential module that provides spoken responses in a spoken dialogue system (SDS) centered on a large language model (LLM). To ensure accurate TTS synthesis, responses generated by an LLM must be converted into TTS-readable formats via a Text Normalization (TN) module, imposing strict low-latency requirements in real-time SDS scenarios. Existing TN solutions are largely rule-based, rely on manual engineering, and generalize poorly to unseen patterns. Although an LLM itself can perform TN through prompt engineering, it faces key limitations: high first-token latency due to non-streaming processing, hallucination risks, and degraded intelligence or reasoning when the core LLM module is fine-tuned solely for TN. To address these challenges, we propose StreamTN, a lightweight LLM-based Chinese streaming TN model. Built on Qwen3-0.6B, StreamTN employs a dual-track streaming framework in which input tokens and output tokens are processed on two parallel tracks, enabling low-latency real-time inference without complex prompting. Moreover, task-specific fine-tuning yields superior TN performance and fewer hallucinations than rule-based systems and general-purpose LLMs. We also introduce a TN benchmark that spans diverse text scenarios, providing a comprehensive evaluation standard for speech generation in spoken dialogue systems. Experiments demonstrate the effectiveness of StreamTN in accuracy and inference latency.

著者のコメント

7 pages, 2 figures, Accepted by IEEE SLT2026

arXiv ID: 2609.24267 / 要約の誤りについて