音声対話で推論・ツール操作・発話を調整するQwen-Audio 3.1
Qwen-Audio-3.1-Realtime: Towards Reliable Agentic Voice Interaction
この論文をやさしく読む
ひとことで言うと
リアルタイム音声アシスタントが、考える、ツールを使う、話すタイミングを調整する方法と、その評価を報告した研究。
何に役立つ?
考えられる用途は、依頼の途中変更や背景で聞こえる声がある環境で、音声アシスタントのタスク遂行と応答の仕方を改善すること。要旨では特定のベンチマークで成功率と背景音声への反応率を評価している。
この研究の面白いところ
言語と音声の学習、ツール操作の訓練、発話と行動の調整を分けて設計している。半二重タスクの成功率は78.4%から82.0%へ、全二重評価で背景音声への反応率は73.0%から13.0%へ変化した。
どこまで分かった?
数値結果は記載されたτ-Voiceの半二重適応とFull-Duplex-Bench v1.5での比較である。継続的タスク向けのVoice Harnessは別の試作で、前面には旧版のQwen-Audio-3.0-Realtimeを使っている。実環境での長期運用結果は要旨に示されていない。
v2のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
リアルタイムの音声アシスタントには、変化していく依頼を踏まえて推論し、操作を実行し、会話上の規則に従うことが求められる。Qwen-Audio-3.1-Realtimeは、これらをThink、Act、Speak and Coordinateという仕組みで統合する。ThinkではCore-Cocktailによる教師ありファインチューニングと、複数モダリティ・複数教師によるオンポリシー蒸留(M²-OPD)を組み合わせ、言語能力を移しつつ音声固有の能力を育てる。Actでは、自己進化する実行可能環境と複数粒度のロールアウトを用いたGroup Relative Policy Optimization(GRPO)により、ツールの利用、フィードバックの解釈、タスクの完了を学習させる。Speak and Coordinateでは、アシスタントが発話または行動するかどうか、その時機と方法を調整する。 音声推論、多言語理解、ツール利用、会話行動、全二重の対話、安全性を評価した。Qwen-Audio-3.0-Realtimeと比べ、半二重の音声テキスト変換に適応させたτ-Voiceでは、全体のタスク成功率が78.4%から82.0%に上がった。音声から音声へのFull-Duplex-Bench v1.5では、背景音声に反応する割合が73.0%から13.0%に下がった。また別のVoice Harness試作も示した。これはQwen-Audio-3.0-Realtimeを前面の対話役として使い、前面と背後の処理の協調および記憶によって、音声対話を継続的なタスクへ広げるものだ。
v2の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-21(UTC)
- 最新改訂
- 2026-09-24 · v2
- 査読・掲載
- 査読状況未確認
更新履歴
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Real-time voice assistants must reason over evolving requests, execute actions, and follow conversational rules. Qwen-Audio-3.1-Realtime brings these requirements together through Think, Act, and Speak and Coordinate. Think combines Core-Cocktail supervised fine-tuning with Multimodality and Multi-Teacher On-Policy Distillation (M$^{2}$-OPD) to transfer language capabilities and develop native audio skills. Act uses self-evolving executable environments and multi-granularity rollouts for Group Relative Policy Optimization (GRPO), teaching the model to use tools, interpret feedback, and complete tasks. Speak and Coordinate aligns whether, when, and how the assistant speaks or acts. We evaluate audio reasoning, multilingual understanding, tool use, conversational behavior, full-duplex interaction, and safety. Compared with Qwen-Audio-3.0-Realtime, 3.1 raises overall task success from 78.4% to 82.0% on our half-duplex speech-to-text adaptation of $\tau$-Voice. On speech-to-speech Full-Duplex-Bench v1.5, the response rate to background speech falls from 73.0% to 13.0%. We also present a separate Voice Harness prototype, using Qwen-Audio-3.0-Realtime as its foreground, that extends spoken interaction to persistent tasks through foreground--background coordination and memory.
著者のコメント
25 pages, technical report
arXiv ID: 2609.25176 / 要約の誤りについて