arXiv論文メモ
新着一覧
cs.CL · 査読状況未確認

長文読み上げ向けベンガル語音声データセットを公開

BanglaKontho: Closing the Long-Form Gap in Bangla Text-to-Speech

Mizbaul Haque Maruf

この論文をやさしく読む

ひとことで言うと

長い文章を自然に読み上げるベンガル語音声合成のため、20時間の音声データを整備した研究です。

何に役立つ?

ベンガル語の音声合成モデルを学習・比較するためのデータと前処理方法として利用できます。利用条件はCC BY-NC 4.0です。

この研究の面白いところ

短い音声中心の既存資源に対し、オーディオブックから一人の話者による長文の語りを収録し、数字や日付の正規化器も公開しています。

どこまで分かった?

性能比較は要旨にある二つのコーパスで学習した同一構造のモデルによるものです。ほかの話者や用途での成績は示されていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

ベンガル語は世界で七番目に話者が多い言語だが、ニューラル音声合成に使える資源がまだ乏しい。公開されているベンガル語音声コーパスの多くは音声認識用に集められた短い読み上げ発話で、長文の抑揚や一人の話者による一貫した語りを十分に扱えていない。そこで、専門家によるオーディオブックの録音から作成した、話者一人による20時間のベンガル語音声合成コーパスBanglaKonthoを提示する。24キロヘルツの音声から分割した7050発話と、確認済みの書き起こしを含む。また、バングラデシュ式の数字の桁区切り、通貨と日付の表現、ダンダ句読点、Unicode正規化を扱う再利用可能なベンガル語テキスト正規化器と、前処理の全工程も公開する。初めから学習したMB-iSTFT-VITSの基準モデルは、単語誤り率9.5%、自然さの平均主観評価値4.46を達成した。同じ構造を12時間のIndicTTS-Bnコーパスで再学習した場合は、それぞれ16.0%と3.16だった。コーパスはCC BY-NC 4.0の条件で公開する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-24(UTC)
最新改訂
2026-09-24 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Bangla, the seventh most spoken language in the world, remains under-resourced for neural text-to-speech. Public Bangla speech corpora are dominated by short read-prompt utterances collected for speech recognition, leaving long-form prosody and consistent single-speaker narration uncovered. We present BanglaKontho, a single-speaker Bangla TTS corpus of 20 hours derived from professional audiobook recordings: 7,050 segmented utterances with verified transcripts at 24 kHz. We also release a reusable Bangla text normalizer covering Bangladeshi-style digit grouping, currency and date expressions, Danda punctuation and Unicode normalization, together with the full preprocessing pipeline. An MB-iSTFT-VITS baseline trained from scratch reaches 9.5% WER and 4.46 naturalness MOS, against 16.0% and 3.16 for the same architecture retrained on the 12-hour IndicTTS-Bn corpus. The corpus is released openly under CC BY-NC 4.0.

arXiv ID: 2609.29146 / 要約の誤りについて