arXiv論文メモ
新着一覧
eess.AS · 査読状況未確認

過去の音声と応答文を生かす会話音声認識

Multimodal Conversational Context for LLM-Based ASR: Data Construction, Training, and Benchmark

Longhao Li, Jian Tang, Yuxiang Kong, Jie Chen, Binbin Zhang, Lei Xie, Xiangang Li

この論文をやさしく読む

ひとことで言うと

音声認識で過去の文字起こしだけでなく、会話の音声自体も参照し、名前などを聞き分ける方法です。

何に役立つ?

過去の発音や話者の情報を生かし、会話中の固有表現の認識を改善するために役立ちます。誤った履歴や無関係な履歴への対処も評価します。

この研究の面白いところ

混同しやすい表現を含む対話データを構成し、ユーザーの過去音声とアシスタントの応答文を交互に学習させます。5場面の専用ベンチマークを用意します。

どこまで分かった?

Qwen3-OmniとStep-Audio-2-miniの双方でマルチモーダル履歴が最良の全体的な固有表現再現率を示したと報告しています。要旨には改善幅の数値はなく、方言などの追加評価も対象範囲内の結果です。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

会話の文脈は、自動音声認識(ASR)に発話ターンをまたぐ意味的・音響的な手掛かりを与える。しかし、過去の文字起こしに頼ると、認識誤りが伝播し、発音や話者の情報が失われるおそれがある。シナリオを制御したデータ作成工程、拡張可能なマルチモーダル文脈学習、体系的な評価を統合する、LLMベースのASR向けマルチモーダル会話文脈の枠組みを提案する。 エンティティとそれに混同しやすい表現を中心に対話を作成し、過去のユーザー音声とアシスタントのテキスト応答を交互に組み込んで、教師あり微調整を行う。また、5つのシナリオにわたって文脈理解とエンティティの誤り訂正を評価するMM-ContextASR Benchを導入する。Qwen3-OmniとStep-Audio-2-miniを使った実験は、無関係な履歴や誤った履歴の処理に限界があることを明らかにするとともに、提案するデータ作成と学習が文脈利用を改善することを示す。両モデルで、マルチモーダル文脈が総合的なエンティティ再現率で最も高い値を達成した。 アクセント、方言、対象話者のASRに関する追加実験でも、過去の音声の価値を示す。ベンチマークのデータと評価コードはhttps://github.com/llh666521/MM-ContextASRで公開されている。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-17(UTC)
最新改訂
2026-09-17 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Conversational context provides semantic and acoustic cues across turns for automatic speech recognition (ASR), but relying on historical transcripts can propagate recognition errors and discard pronunciation and speaker information. We present a multimodal conversational-context framework for LLM-based ASR that integrates a scenario-controlled data pipeline, scalable multimodal context training, and systematic evaluation. We construct dialogues around entities and their confusable forms and interleave historical user speech with assistant text responses for supervised fine-tuning. We also introduce MM-ContextASR Bench, which evaluates contextual understanding and entity error correction across five scenarios. Experiments with Qwen3-Omni and Step-Audio-2-mini reveal limitations in handling irrelevant and erroneous history and show that our data construction and training improve context utilization, with multimodal context achieving the highest overall entity recall on both models. Further experiments on accent, dialect, and target-speaker ASR demonstrate the value of historical speech. The benchmark data and evaluation code are publicly available at https://github.com/llh666521/MM-ContextASR.

著者のコメント

Technical report

arXiv ID: 2609.19765 / 要約の誤りについて