arXiv論文メモ
新着一覧
cs.CL · 査読状況未確認

ベンガル語の発話終了を検出するデータセットとモデル

BanglaTurn: A Benchmark and Whisper-Based Model for End-of-Turn Detection in Bangla Speech

Mizbaul Haque Maruf

この論文をやさしく読む

ひとことで言うと

ベンガル語の会話で話者が発話を終えたかを判定するための音声データとWhisperベースのモデルです。

何に役立つ?

ベンガル語の音声対話システムで、応答を始めるタイミングを判定する研究の参考になります。実用環境での運用結果は報告されていません。

この研究の面白いところ

すべて人が確認した35,374件のラベルを用い、比較モデルより偽陰性を大幅に減らしています。

どこまで分かった?

テスト集合は学習に使わなかったポッドキャストから作られています。偽陰性の改善と引き換えに偽陽性は増えており、別種の会話への汎化は要旨から分かりません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

本論文は、ベンガル語の会話音声における発話ターンの終了を検出するためのコーパスBanglaTurnと、それを使って学習したモデルを紹介する。コーパスには、ポッドキャスト音声から切り出した3~15秒の標本が35,374件含まれる。発話者の分離と大規模言語モデルによる処理を組み合わせてターン状態のラベルを付け、すべてのラベルを人手の注釈者が確認した。モデルはWhisperエンコーダに、タスク専用の分類ヘッドを組み合わせる。 学習には使わなかったポッドキャストから得た、クラスの比率を揃えたテスト集合では、正解率は84.33%(95%信頼区間80.3~88.1%)で、比較対象のSmart-Turn v3は69.28%だった。偽陰性率は51.57%から7.55%に下がったが、その代わり偽陽性率が上がった。エンコーダのどの層を微調整するか、多尺度プーリング、INT8量子化のそれぞれの寄与も報告する。CPU上での端から端までの遅延は165~191ミリ秒に収まった。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-24(UTC)
最新改訂
2026-09-24 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

This paper presents BanglaTurn, a corpus for end-of-turn detection in Bangla conversational speech, and a model trained on it. The corpus holds 35,374 samples of 3 to 15 s of podcast speech, labelled for turn state by combining speaker diarization with an LLM pass, with every label then checked by a human annotator. The model pairs a Whisper encoder with task-specific classification heads. On a class-balanced test set drawn from a held-out podcast, it reaches 84.33% accuracy (95% CI 80.3 to 88.1) against 69.28% for the Smart-Turn v3 baseline, and lowers the false negative rate from 51.57% to 7.55% at the cost of a higher false positive rate. We report what encoder layer fine-tuning, multi-scale pooling and INT8 quantization each contribute, and latency stays within 165 to 191 ms end to end on CPU.

arXiv ID: 2609.29371 / 要約の誤りについて