音声認識の珍しい単語を音素の時間的な比較で補正
PTC-Bias: Phoneme-Level Temporal Competition for Bias Retrieval and Post-Decoding Correction in Speech LLMs
この論文をやさしく読む
ひとことで言うと
音声認識で聞き間違えやすい珍しい単語を、発音と時間位置を使って選び直す方法。
何に役立つ?
人名や専門用語などの候補語を音声認識で扱う際、候補一覧が大きくても追加の言語モデル計算を抑えられる。
この研究の面白いところ
認識前後の二段階で同じ音素確率を使い、候補語だけを選択的に補正して候補外の語の誤りをほぼ増やさない。
どこまで分かった?
報告された改善はLibriSpeech、二つのSpeechLLM、最大2,000語の候補一覧での結果である。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
文脈に基づくバイアス付けは音声大規模言語モデル(SpeechLLM)が珍しい単語を認識する助けになるが、多数の候補語を効率よく利用するのは難しい。そこで、音素の時間的な競合に基づく二段階の枠組みPTC-Biasを提案する。入力を先に処理する段階では、PTC Retrievalが音声フレームに同期して音素を復号し、候補となる発音を時間方向に比較して、少数の優先候補語と対応する音声区間を作る。SpeechLLMの復号後には、PTC Correctionが、その区間で抽出候補と転記文の一致しない部分をもう一度局所的に比較する。必要な箇所だけ補正するため、正しい転記を保ちながら、発音が近い単語や単語の区切りに関する誤りを減らせる。二段階は同じ音素の事後確率を共有し、SpeechLLMを追加で順方向計算する必要がない。 LibriSpeechでの実験では、二つのSpeechLLMと最大2,000語の候補一覧にわたり、一貫した改善が得られた。Prompt-SLAM-ASR-7Bと2,000語の候補を使った場合、CTC-Filterに比べ、test-cleanとtest-otherで対象候補語の単語誤り率(B-WER)をそれぞれ相対的に23.4%、23.9%下げた。一方、候補外の語の単語誤り率(U-WER)はほぼ変わらなかった。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-23(UTC)
- 最新改訂
- 2026-09-23 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-23 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Contextual biasing improves rare-word recognition in speech large language models (SpeechLLMs), but efficiently exploiting large bias lists remains challenging. We propose PTC-Bias, a two-stage framework based on phoneme-level temporal competition. At the prefill stage, PTC Retrieval performs frame-synchronous phoneme decoding and temporal competition among candidate pronunciations, producing a compact bias-word shortlist and corresponding speech intervals. After SpeechLLM decoding, PTC Correction conducts a second local competition between the retrieved candidates and mismatched transcript spans within these intervals. Selective correction reduces near-homophone and word-segmentation errors while preserving correct transcriptions. Both stages share the same phoneme posteriors and require no additional SpeechLLM forward pass. Experiments on LibriSpeech show consistent gains across two SpeechLLMs and bias lists of up to 2000 words. With Prompt-SLAM-ASR-7B and 2000 bias words, PTC-Bias reduces B-WER by 23.4%/23.9% relative to CTC-Filter on test-clean/test-other, while keeping U-WER nearly unchanged.
著者のコメント
5 pages, 3 figures, 3 tables, under-review
arXiv ID: 2609.28727 / 要約の誤りについて