arXiv論文メモ
新着一覧
eess.AS / cs.AI / cs.SD / eess.SP · 査読状況未確認

小さな音声合成モデルで音の細部を保つ

GrainSpeech: Less Context, More Detail for Compact Speech Synthesis

Zitao Liang, Chang Gao

この論文をやさしく読む

ひとことで言うと

小型音声合成では、参照する文脈をむやみに広げるより、音の細かな変化を学習しやすくする設計が有効だった。

何に役立つ?

メモリや計算能力が限られる機器での音響モデル設計に役立つ。MCUで測定されたのはメルスペクトログラム生成の速度である。

この研究の面白いところ

画像用の細部復元の方法をそのまま使うと品質が下がる点を確かめ、時間・周波数の軸を持つ音声表現に合わせて作り直している。

どこまで分かった?

品質比較は要旨ではUTMOSという評価指標による。17.9倍という速度を、波形生成も含む音声合成全体の速度や人による聴取評価と読み替えることはできない。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

小型の音響モデルには、品質とモデル容量の厳しいトレードオフがある。本研究では、この領域における二つの要因、エンコーダの文脈範囲とメルスペクトログラムへの教師信号を調べる。受容野の大きさを変える調査から、自己注意の範囲を15音素より広げても、ピッチ、エネルギー、長さの予測に一貫した改善は得られないことが分かった。この知見に基づき、受容野を固定した畳み込みエンコーダを導入し、それぞれの予測誤差を36.0%、17.3%、3.4%低減する。 さらに、画像分野の勾配分散に基づく教師信号をそのまま転用すると、細かな変動は回復する一方、予測される品質が悪化することを示す。このため、軸ごとの勾配、重なりを持つ局所統計、対数領域での分散一致を用いた、メルスペクトログラム専用の定式化を採用する。GrainSpeechのパラメータ数はわずか264.8Kで、マイクロコントローラ(MCU)上で実時間の17.9倍の速度によるメル生成を実現する。また、はるかに大きいモデルの1.5%未満のパラメータ数で、それらに匹敵するUTMOSスコアを達成する。ソースコードとデモは https://github.com/lab-emi/GrainSpeech で公開している。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-16(UTC)
最新改訂
2026-09-16 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Compact acoustic models face a challenging quality-capacity trade-off. We investigate two factors in this regime: encoder context and Mel-spectrogram supervision. A receptive-field-scaling study shows that expanding self-attention beyond 15 phonemes provides no consistent gains in pitch, energy, or duration prediction. Guided by this finding, we introduce a fixed-receptive-field convolutional encoder that reduces the respective prediction errors by 36.0%, 17.3%, and 3.4%. We further show that directly transferring image-domain gradient-variance supervision restores fine-scale variation but degrades predicted quality, motivating a Mel-specific formulation with axis-specific gradients, overlapping local statistics, and log-domain variance matching. GrainSpeech contains only 264.8K parameters and achieves 17.9x real-time Mel generation on a microcontroller (MCU), while attaining UTMOS scores comparable to substantially larger models with less than 1.5% of their parameters. Source code and demos are available at https://github.com/lab-emi/GrainSpeech.

arXiv ID: 2609.18856 / 要約の誤りについて