arXiv論文メモ
新着一覧
cs.CV · 査読状況未確認

必要な音声と映像を選び直しながら推論するモデル

OmniSeek: Native Tool Integration for Multi-turn Audio-Visual Reasoning

Haibo Wang, Jiteng Mu, Jialu Li, Jingru Yi, Yuanjun Xiong, Jianming Zhang, Lifu Huang, Mingze Xu

この論文をやさしく読む

ひとことで言うと

長い動画と音声を一度に読むのではなく、推論に必要な時間帯を選び、映像を見るか音を聞くかを決め直すエージェントです。

何に役立つ?

長い音声・映像の中から回答に必要な情報を探すシステムの設計に役立ちます。実験では複数のベンチマークで音声・映像推論の改善が報告されています。

この研究の面白いところ

取得した情報を要約だけにせず、生の音声・映像区間として文脈へ戻します。また両方の情報に依存する成功に報酬を与え、片方だけで解く偏りを抑えます。

どこまで分かった?

要旨にはベンチマーク別の数値や追加の検索・推論にかかる時間はありません。両モダリティを使わせる目的関数の導入は、すべての回答で両方が必須になることを保証するという説明ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

私たちは、Omni Large Language Model(Omni-LLM)を、ツール使用を内部に組み込んだ能動的な複数ターンの推論エージェントへ変えるフレームワークOmniSeekを提案する。音声・映像の系列全体を1回の順伝播で受動的に処理するのではなく、OmniSeekは証拠の取得を推論過程の一部とする。見るべきか聞くべきか、どの時間窓を対象とするかを動的に決め、長い文脈の異なるモダリティから、疎だが重要な証拠を取り出す。反復的な複数ターンの手順により、取得した生の音声または映像の区間を文脈へ再び追加し、その後の推論を支援する。 この能力を初期段階から学習させるため、音声と映像の証拠を交互に含む多段階の思考連鎖の軌跡コーパスOmniTraj-170Kを合成するデータ生成エンジンを構築する。まず、これらの軌跡を教師としてモデルに複数ターンのツール使用を身に付けさせ、その後、検証可能な報酬を用いる2段階の強化学習で方策をさらに最適化する。また、推論が両方のモダリティに依存する成功軌跡へ明示的に報酬を与えるAudio-Visual Necessity目的関数を導入し、一方のモダリティだけに頼る近道を抑える。広範なベンチマークでの多数の実験から、OmniSeekがモダリティをまたぐ適応的な証拠探索を学び、音声・映像推論の性能を一貫して改善することを示す。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-10-01(UTC)
最新改訂
2026-10-01 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

We present OmniSeek, an agentic framework that transforms an Omni Large Language Model (Omni-LLM) into an active, multi-turn reasoning agent with native tool use. Rather than passively processing an entire audio-visual sequence in a single forward pass, OmniSeek makes evidence acquisition part of the reasoning process: it dynamically decides whether to look or listen, and over which temporal window, to retrieve sparse but critical evidence across different modalities within long contexts. Through an iterative multi-turn protocol, the retrieved raw audio or visual segments are appended back into the context to support subsequent reasoning. To cold-start this capability, we build a data engine that synthesizes OmniTraj-170K, a corpus of multi-hop Chain-of-Thought trajectories with interleaved audio and visual evidence. We first supervise the model on these trajectories to instill multi-turn tool-use behavior, and then further optimize the policy via a two-stage reinforcement learning with verifiable rewards. Moreover, we introduce an Audio-Visual Necessity objective that explicitly rewards successful trajectories whose reasoning depends on both modalities, discouraging single-modality shortcuts. Extensive experiments across a wide range of benchmarks demonstrate that OmniSeek learns adaptive cross-modal evidence seeking and consistently improves audio-visual reasoning performance.

arXiv ID: 2610.02181 / 要約の誤りについて