arXiv論文メモ
新着一覧
cs.SD · 査読状況未確認

話者の時間情報と記憶を使う複数人の音声認識

STAM-ASR: Speaker-Temporal Anchoring with Memory for Multi-Speaker ASR

Victor Tolulope Olufemi, Syeda Faiza Ahmed Sara, Shammur Absar Chowdhury

この論文をやさしく読む

ひとことで言うと

会話の中で誰がいつ話したかを追跡し、発話をまたぐ記憶も使って複数人の音声を文字にする方法です。

何に役立つ?

会議など、発話の重なりや話者の再登場がある音声の書き起こしに役立つと考えられます。

この研究の面白いところ

外部の話者分離を使わず、音声言語モデルの中間特徴から話者情報を学び、固定サイズの記憶で会話の文脈を保持します。

どこまで分かった?

要旨は話者追跡が残る重要課題としています。数値的な改善幅は要旨には記されていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

自然な会話では話者が交代し、発話が重なり、同じ話者が後から再び話すため、音声認識と話者の特定がともに難しい。本研究は、事前学習済みの音声言語モデルを複数話者の音声認識へ拡張する軽量な枠組みSTAM-ASRを提案する。外部の話者分離システムに頼らず、音声言語モデルの中間特徴から、話者の活動と話者を考慮した表現を直接学習する。それによって、音声を明示的に分離せず、誰がいつ話したかという手掛かりを用いてモデルの意味表現を調整する。 さらに、固定サイズの話者ごとの記憶と会話の記憶を維持し、発話をまたぐ補完的な文脈を保持する。AMI、ICSI、LibriCSS、NOTSOFAR-1を用い、近接マイク、遠距離マイク、発話の重なり、分野をまたぐ条件で評価した。報告された結果では、話者と時間による条件付けと記憶がそれぞれ補完的に役立った。一方、正解の話者活動情報と予測した情報を用いた場合の差から、頑健な話者追跡がなお重要な課題であることが分かった。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-24(UTC)
最新改訂
2026-09-24 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Natural conversations make both speech recognition and speaker attribution challenging for ASR, as speakers take turns, overlap, and reappear over time. We propose STAM-ASR, Speaker-Temporal Anchoring with Memory, a lightweight framework that extends an already pretrained AudioLLM for multi-speaker ASR. Without relying on an external diarization system, STAM-ASR learns speaker activity and speaker-aware representations directly from intermediate AudioLLM features. Hence providing explicit who and when cues to modulate the AudioLLM's semantic representation without explicit speech separation. STAM-ASR further maintains fixed-size speaker and conversational memories to carry complementary context across turns. We evaluate STAM-ASR on AMI, ICSI, LibriCSS, and NOTSOFAR-1 across close-talk, far-field, overlapping, and cross-domain conditions. Our reported results shows that speaker-temporal conditioning and memory provide complementary benefits, while the gap between reference and predicted speaker activity identifies robust speaker tracking as a key remaining challenge.

arXiv ID: 2609.29805 / 要約の誤りについて