顔・口元・音声を統合した話者検出
ROAM-ASD: Robust Open-World Active Speaker Detection with Flexible Multimodal Fusion
この論文をやさしく読む
ひとことで言うと
動画の顔・口元と音声を組み合わせ、誰が話しているかを検出する方法を5つのデータセットで評価した。
何に役立つ?
映像や音声の一部が欠ける場面での話者検出方法の検討に役立つ。特定の実運用環境での性能を示すものではない。
この研究の面白いところ
すべての入力を共同の自己注意で処理し、モダリティを一部落とす学習を加え、5つのベンチマークで従来手法を上回った。
どこまで分かった?
要旨には5つのベンチマークでの平均適合率が示されるが、実環境での遅延や計算費用の数値は記載されていない。
v2のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
話している人物の検出には、画面に見える顔と音声を確実に結びつける必要がある。しかし既存のシステムは、難しい領域のデータや観測が欠けた状況で性能が落ちやすい。本研究は、音声、顔全体、口元の細かい表現を同時に扱う頑健な音声・映像の枠組みROAM-ASDを提案する。統一された共同自己注意の仕組みが、モダリティに依存しない問い合わせ用トークンとともに全入力の流れを処理し、利用できる入力の間で直接情報をやり取りできるようにする。入力の種類を学習中に一部落とす方法で、観測が使えない場合の頑健性も高める。 ROAM-ASDは5つの話者検出ベンチマークで最高水準の性能を達成した。平均適合率はWASDで98.8%、UniTalkで87.9%、AVAで96.5%、ASWで99.3%、Talkiesで98.2%であり、従来の最良システムよりそれぞれ5.1、4.7、0.9、1.0、2.1ポイント高かった。学習していない別データセットへのゼロショットの一般化も大きく改善し、観測が欠けても頑健だった。
v2の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-22(UTC)
- 最新改訂
- 2026-09-24 · v2
- 査読・掲載
- 査読状況未確認
更新履歴
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Active speaker detection (ASD) requires reliable association between visible faces and acoustic speech, yet existing systems often degrade under challenging domains or incomplete observations. We introduce ROAM-ASD, a robust audiovisual framework that jointly models audio, full-face, and fine-grained mouth representations. A unified joint self-attention mechanism processes all input streams together with modality-agnostic query tokens, enabling direct interaction among available modality inputs. Modality dropout further improves robustness when input streams are unavailable. ROAM-ASD achieves state-of-the-art performance across five ASD benchmarks: 98.8% mAP on WASD, 87.9% on UniTalk, 96.5% on AVA, 99.3% on ASW, and 98.2% on Talkies, improving over previous best systems by 5.1, 4.7, 0.9, 1.0, and 2.1 mAP points, respectively. ROAM-ASD also substantially improves zero-shot cross-dataset generalization and remains robust to missing observations.
著者のコメント
Submitted to IEEE ICASSP 2027
arXiv ID: 2609.26648 / 要約の誤りについて