arXiv論文メモ
新着一覧
eess.AS · 査読状況未確認

自然な発話の区切りを保つペルシア語音声データ作成

PersianVox: A Prosody-Aware Approach for Speech Dataset Generation from In-the-Wild Data

Saeedreza Zouashkiani, Soheil Khalesi, Saman Soleimani Roudi, Sajjad Amini, and Shahrokh Ghaemmaghami

この論文をやさしく読む

ひとことで言うと

ウェブ音声を自然な発話のまとまりで切り出し、二つの認識モデルの一致を使ってペルシア語データを整える方法です。

何に役立つ?

学習用音声が少ないペルシア語で、音声合成や音声品質評価の研究に使える大規模な資源を提供します。

この研究の面白いところ

長い文脈を保つ分割と、正解の書き起こしを必要としない誤認識の選別を組み合わせています。

どこまで分かった?

2,400時間のデータ作成を報告していますが、要旨には書き起こし誤り率や音声合成の改善幅はありません。最大規模・初の比較という位置づけは著者らの記述です。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

低資源言語では、大規模で高忠実度の音声データセットが不足し、ゼロショット音声合成の発展が妨げられている。従来のアライメントに基づく方法は、入手が難しい逐語的な書き起こしを必要とする。一方、自然なウェブ上の音声を利用する標準的な処理は、単一モデルの自動音声認識と無音に基づく分割に頼ることが多く、書き起こしの誤りや韻律の途中切断を引き起こす。 ペルシア語におけるこれらの課題に対処するため、本論文は、ラベルのないウェブデータから高品質な音声コーパスを作る完全自動パイプラインPersianVoxを導入する。提案手法は、音響的な発話ターン検出を利用し、言語的なまとまりを保持するとともに、長い文脈のモデル化に適した発話長へ調整する、新しい韻律考慮型の分割戦略を組み込む。さらに、異なる二つのモデル構造を利用する二重モデルの一致機構によって、正解データなしで信頼性の低い書き起こしを除外する。 この処理により、2,400時間の複数話者データセットが得られる。これは現時点でペルシア語に利用できる最大のオープンソース音声資源である。加えて、ペルシア語の音声品質評価手法について初の比較ベンチマークを提供し、今後の研究を支えるため、人手で注釈を付けた部分集合を公開する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-16(UTC)
最新改訂
2026-09-16 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Advancement of zero-shot text-to-speech synthesis is currently hindered for low-resource languages by the scarcity of large-scale, high-fidelity speech datasets. Traditional alignment-based methods require rare verbatim transcripts, while standard in-the-wild pipelines often rely on single-model automatic speech recognition and silence-based segmentation, leading to transcription errors and truncated prosody. To address these challenges for the Persian language, this paper introduces PersianVox, a fully automated pipeline designed to generate high-quality speech corpora from unlabeled web data. Our approach integrates a novel prosody-aware segmentation strategy that utilizes acoustic turn-detection to preserve linguistic completeness and optimize utterance duration for long-context modeling. Furthermore, we employ a dual-model agreement mechanism, leveraging two distinct model architectures to filter unreliable transcriptions without ground truth. This pipeline yields a 2,400-hour multi-speaker dataset, the largest open-source speech resource available for Persian to date. Additionally, we provide the first comparative benchmark of speech quality assessment methods for Persian, releasing a human-annotated subset to facilitate future research.

著者のコメント

4 pages, 3 figures, 5 tables

arXiv ID: 2609.19324 / 要約の誤りについて