arXiv論文メモ
新着一覧
cs.SD · 査読状況未確認

複数の音声をまたぐ会話で出来事の時刻を答える

TEMA: Evidence-Grounded Temporal Question Answering in Multi-Turn Multi-Audio Dialogs

Kaidi Yang, Hualei Wang, Zhaohui Wang, Chenxuan Wang, Hong Liu, Xiangdong Wang

この論文をやさしく読む

ひとことで言うと

複数の録音について会話で質問された出来事の時間区間を特定し、根拠と回答を一緒に評価する方法を示した。

何に役立つ?

長い音声や複数の録音から出来事の時刻を答えるシステムを学習・評価する材料になる。

この研究の面白いところ

答えだけでなく、対象録音の範囲と関連する全時間区間を証拠として明示し、その証拠部分だけを強化学習した。

どこまで分かった?

結果は要旨に記載された二つのモデルとTEMAの評価で示されたもの。実際の業務録音での性能や改善幅の数値は要旨にない。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

複数回のやり取りと複数の音声をまたぐ時間的な質問応答では、後続の質問、録音の切り替え、過去への言及を通して、対象の出来事を追い続ける必要がある。時間の計算や比較には、該当する出来事を漏れなく見つけ、その始まりと終わりを特定しなければならない。本研究は、出来事の知覚と証拠に基づく回答を結ぶTEMAを提案する。Routeは対象となる音声の範囲を指定し、Spanは関連するすべての時間区間を条件付きの音声キャプションとして記述する。 各会話ターンに証拠と回答の教師信号を持つ40,704件の会話からなるTEMA-Dialogと、証拠と最終回答を合わせて評価するTEMA-Benchを構築した。学習は、時間的な位置特定の初期化、会話全体を使う教師あり微調整、区間の取りこぼしを先に減らすSpanだけのGRPOを組み合わせる。Qwen2.5-OmniとAF-Nextでの実験では、時間に関する質問応答が改善し、とくに出来事の位置特定と異なる音声間の比較で改善した。証拠の部分だけに強化学習を適用すると、区間の発見と回答の正確さがさらに向上した。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-24(UTC)
最新改訂
2026-09-24 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Multi-turn, multi-audio temporal question answering requires models to track target events across follow-up questions, recording switches, and historical references, recovering complete instances and their boundaries for temporal calculation and comparison. We propose TEMA, which connects event perception with evidence-based answering through Route, specifying the audio scope, and Span, describing all relevant intervals as conditional audio captions. We construct TEMA-Dialog with 40,704 dialogs and per-turn evidence and answer supervision, and TEMA-Bench for joint evaluation of evidence and final answers. Training combines temporal grounding initialization, full-dialog supervised fine-tuning, and completeness-first Span-only GRPO. Experiments on Qwen2.5-Omni and AF-Next show improved temporal question answering, particularly event localization and cross-audio comparison. Reinforcement learning applied solely to evidence further improves interval recovery and answer accuracy.

著者のコメント

5 pages, 2 figures

arXiv ID: 2609.30029 / 要約の誤りについて