動画と文章の指示で音声を再編集する生成モデル
Spot, Separate, and Enhance: Fully Generative Approach for Audio Mixing
この論文をやさしく読む
ひとことで言うと
動画の内容と文章の指示を使って、音のバランスや不要な音、残響を調整するモデルです。
何に役立つ?
動画の音声編集を利用者の意図に沿って進める用途が考えられます。
この研究の面白いところ
音声だけでなく動画も手掛かりにし、再構成の正確さだけでなく編集の品質と操作可能性も評価しています。
どこまで分かった?
比較実験で既存手法を上回ったとされていますが、要旨には改善の具体的な数値や対象となる利用場面の詳細はありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
音声の再ミキシングと改善のために、利用者が指示できる初のマルチモーダル生成モデル、Spot, Separate, and Enhance(SSE)を提案する。SSEは動画と文章による説明の両方を手掛かりに、音声のバランスを調整し、不要な音源を除去し、残響を減らすことで動画の音声を改善する。学習と評価を支えるため、音声再ミキシングのベンチマークMuddyMixを基に作った新しいデータセットDegradedMixも提案する。また、標準的な再構成に基づく評価指標よりも再ミキシングの創造的な性質を捉えやすい、生成モデルの評価指標を採用する。広範な実験では、SSEは操作可能性と再ミキシングの品質の両方で既存の比較手法を上回った。プロジェクトページは要旨に記載されている。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-24(UTC)
- 最新改訂
- 2026-09-24 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-24 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
We introduce Spot, Separate, and Enhance (SSE), the first multimodal, user-guided generative model for audio remixing and enhancement. SSE enhances video content by rebalancing the audio, removing unwanted audio sources, and reducing reverberation, guided by both video and textual descriptions. To support its training and evaluation, we propose DegradedMix, a new dataset built on the audio remixing benchmark MuddyMix. We also adopt evaluation metrics from generative modeling, which better capture the creative nature of remixing than standard reconstruction-based metrics. SSE outperforms existing baselines in both controllability and remixing quality, as shown by extensive experiments. Project page: https://sse-ai.notion.site
著者のコメント
Submitted to ICASSP 2027. Project page https://sse-ai.notion.site
arXiv ID: 2609.29169 / 要約の誤りについて