一つの音声モデルで口の動きや文字から対象話者を抽出
Exploring a Single Autoregressive LLM for Unified Target Speech Extraction across Synchronous and Asynchronous Cues
この論文をやさしく読む
ひとことで言うと
複数人の声から目標の声を取り出す際、口の動き、身振り、見本の音声、文字を一つのモデルで手掛かりにする方法。
何に役立つ?
映像が途中で欠けても対象話者の音声を追い続けたい処理や、手掛かりの種類が異なる音声抽出に役立つ可能性がある。
この研究の面白いところ
モデルが出した過去の音声トークンを次の抽出の手掛かりに再利用し、2秒の正常映像の後に映像を消しても指定のスコアを保った。
どこまで分かった?
数値はVoxCeleb2とLRS3の記載条件での評価結果。すべての雑音や映像欠損条件に同じ性能が当てはまるとは要旨から分からない。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
目標話者の音声抽出では通常、手掛かりの種類ごとに別の抽出器を学習する。また、映像を手掛かりに使う方法は、映像フレームが壊れても頑健に動くために、同様の破損を含む学習を必要とすることが多い。本研究は、一つの自己回帰型大規模言語モデルを基盤とするTSE-Omniが、時間的に同期した手掛かりである唇の動きや発話時の身振りと、非同期の手掛かりである事前登録音声や文字の両方を利用できることを示す。 TSE-Omniは次トークン予測で動作する。各段階で、過去の自分の出力から目標音声の意味トークンを予測する。著者らはこれを自己登録と呼ぶ。非同期の音声・文字、または短い映像の冒頭部分という登録用の手掛かりで初期化し、連続的な目標話者の音声文脈を形成する。この仕組みにより、映像が正常なら同期した視覚情報を使い、映像フレームが欠けたときは過去のトークン履歴で補う。 正常な映像では、TSE-Omniは強い識別型・生成型の比較法に匹敵し、VoxCeleb2でSpeechBERTScore 0.81、LRS3のゼロショット条件で0.89を示し、DNSMOSはより高かった。同じVoxCeleb2のテスト集合で、最初の2秒だけ正常な映像を与え、その後の映像フレームをすべて除いてもSpeechBERTScoreは0.81のままだった。重なりが少ない発話や複数話者の干渉がある場合にも使用可能で、ストリーミング推論にも対応する。プロジェクトページはhttps://alexwxwu.github.io/tseomni-main/である。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-24(UTC)
- 最新改訂
- 2026-09-24 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-24 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Target speech extraction (TSE) typically trains a separate extractor per cue, and visual-cue systems often need corruption-matched training to remain robust under visual frame corruption. We show that one autoregressive LLM backbone, TSE-Omni, can serve both temporally synchronous cues (lip movements, co-speech gestures) and asynchronous cues (enrollment audio, text). TSE-Omni is driven by next-token prediction: each step predicts target speech semantic tokens from its own past outputs, which we term self-enrollment, forming a continuous target-speech context initialized by the enrollment cue (asynchronous audio or text, or a short visual prefix). This enables audio-visual compensation: the model uses synchronized visuals when intact and its token history when visual frames are missing. Under clean visuals, TSE-Omni matches strong discriminative and generative baselines (SpeechBERTScore 0.81 on VoxCeleb2 and 0.89 on LRS3 zero-shot) with higher DNSMOS. On the same VoxCeleb2 test set, after a 2 s clean visual start, removing the remaining visual frames leaves SpeechBERTScore at 0.81. It remains usable under sparse overlap and multi-speaker interference, and supports streaming inference. Project page: https://alexwxwu.github.io/tseomni-main/.
arXiv ID: 2609.29238 / 要約の誤りについて