arXiv論文メモ
新着一覧
eess.AS / cs.CL / cs.SD · 査読状況未確認

笑い声なども書き起こす音声認識のデータ調整

Long-Tail Rebalancing for Non-Verbal Vocalization-Aware ASR: A Track 1 System for the NVVSpeech Challenge

Shangyue Jia, Jingru Ma, Yangzhuo Li, Daoping Luo, Bowen Tian, Hanchen Lu, Wenze Ren, Yunxiang Chen, Houdun Liu, Su Feng, Lei Xie, Liumeng Xue

この論文をやさしく読む

ひとことで言うと

発話の文字だけでなく、笑い声など16種類の非言語的な声も書き起こす音声認識手法を評価した。

何に役立つ?

非言語的発声が少ない学習データで、ラベル統一と標本の選び方を設計する参考になる。大会では公式得点63.86で4位だった。

この研究の面白いところ

データセット間でラベルをそろえた後、頻度の平方根による選択と分類を一様に選ぶ追加学習を組み合わせた。

どこまで分かった?

結果はNVVSpeech ChallengeのTrack 1と固定したローカル検証分割での評価。ほかの発声分類や言語への一般化は要旨からは分からない。

v2のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

言葉にならない発声には重要な非言語情報が含まれるが、従来の自動音声認識では省かれがちである。ISCSLPのNVVSpeech Challengeでは、限られ、かつ大きく偏った教師データの下で、語としての発話と16種類の非言語的発声を同時に書き起こす必要がある。著者らは、データセット間のラベルを統一し、2段階で標本を選ぶ、非言語的発声に対応した音声認識の手順を示す。出典ごとに異なるラベルを公式の分類へ写し、信頼できる対応付けができない標本を除外する。まず各分類の頻度の平方根に基づいて標本を選び、出現数の長い裾を緩和する。その後、分類を一様に選ぶ追加学習を行う。固定したローカルの検証分割では、平方根に基づく選択が試した1段階の設定の中で最良だった。最終的な2段階のシステムは公式得点63.86を得て、Track 1で4位になった。

v2の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-20(UTC)
最新改訂
2026-09-23 · v2
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Non-verbal vocalizations (NVVs) carry important paralinguistic information but are often omitted by conventional automatic speech recognition (ASR) systems. The ISCSLP NVVSpeech Challenge requires joint transcription of lexical content and 16 NVV categories under limited and highly imbalanced supervision. We present a data-centric NVV-aware ASR pipeline based on cross-dataset label harmonization and a two-stage sampling schedule. We map heterogeneous source labels to the official taxonomy and exclude samples without a reliable mapping. Our schedule first uses square-root category sampling to moderate the long-tailed distribution and then applies uniform-category fine-tuning. On a fixed local validation split, square-root category sampling performs best among the tested single-stage settings. The final two-stage system obtains an official score of 63.86 and ranks fourth in Track 1.

著者のコメント

Accepted by ISCSLP 2026, NVVSpeech Challenge Track 1

arXiv ID: 2609.23462 / 要約の誤りについて