必要な音だけを自発的に知らせる音声言語モデル
I'll Keep an Ear Out: Teaching AudioLLMs Proactive Audio Assistance
この論文をやさしく読む
ひとことで言うと
「この音がしたら知らせて」という一度の指示から、音を聞き続け、必要なときだけ通知するAIの研究です。同じ音で何度も通知しないことも学習対象にしています。
何に役立つ?
考えられる用途は、ろう者・難聴者の周囲の音への気づきを支援するウェアラブル機器です。報告された検証は音声データセットとストリーミング評価で、利用者の日常生活での効果検証ではありません。
この研究の面白いところ
音を認識するだけでなく、通知するか黙るかをモデルの出力トークンで明示的に扱っています。開始検出、継続中の関連性、無関係な音、重複通知を一体として評価しています。
どこまで分かった?
99.6%のF1と重複除去再現率100%はESC-50の結果です。平均遅延は3.5秒と報告されており、あらゆる場面で即時通知や完全な検出を保証するものではありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
音声大規模言語モデル(AudioLLM)は受け身に動作し、質問されたときだけ応答する。本研究では、単一の自然言語による意図の指定に基づいて、AudioLLMが音声ストリームを監視し、いつユーザーへ知らせるかを自律的に判断する、能動的な音声支援を導入する。動機となるのは、ろう者・難聴者向けのウェアラブル用途である。 モデルに依存しない方式としてInterrupt and Silent Modeling(ISM)を提案する。これは二つの特殊トークン<interrupt>と<silent>を通じて、能動的な判断をLLMの復号過程へ組み込む。音の開始検出、関連性が続く間の通知発動、無関係な音への通知抑制、重複除去という四つの状態を扱う。 Qwen2-Audio-7Bに適用すると、ISMはESC-50で通知判断のF1スコア99.6%と、重複除去の再現率100%を達成する。雑音の多いEpic-Soundsの台所音声では、分野固有の学習を行わずに最も高い通知F1を達成し、通知しすぎることも抑制しすぎることもなく、高い開始検出性能を保つ唯一の手法となる。ストリーミング評価では、平均遅延3.5秒でリアルタイム動作が可能であることを確認する。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-18(UTC)
- 最新改訂
- 2026-09-18 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-18 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Audio large language models (AudioLLMs) operate reactively, responding only when queried. We introduce proactive audio assistance, where an AudioLLM monitors an audio stream and autonomously decides when to alert the user from a single natural-language intent, motivated by wearable applications for Deaf and Hard of Hearing users. We propose Interrupt and Silent Modeling (ISM), a model-agnostic paradigm that embeds proactive decisions into LLM decoding via two special tokens: \texttt{<interrupt>} and \texttt{<silent>}, capturing four states: onset detection, sustained-relevance triggering, irrelevance suppression, and de-duplication. Applied to Qwen2-Audio-7B, ISM achieves 99.6\% interrupt F1 and perfect de-duplication recall on ESC-50. On noisy Epic-Sounds kitchen audio, ISM achieves the highest interrupt F1 without domain-specific training, the only method maintaining strong onset detection without over-triggering or over-suppression. Streaming evaluation confirms real-time viability with 3.5-second average latency.
著者のコメント
Accepted at Interspeech 2026
arXiv ID: 2609.21183 / 要約の誤りについて