arXiv論文メモ
新着一覧
cs.SD · 査読状況未確認

映画のステレオ音声を会話・音楽・効果音へ分離

LiteCASS: A Lightweight End-to-End Network for Real-Time Stereo Cinematic Audio Source Separation

Yuanxin Guo, Qiang Ji, Mengmei Liu, Yuhan Lv, Ningning Pan, Gongping Huang

この論文をやさしく読む

ひとことで言うと

映画のステレオ音声を会話・音楽・効果音へリアルタイムで分ける軽量モデルを評価した。

何に役立つ?

考えられる用途は資源の限られた装置での音声分離である。要旨は比較データでの成績を示すが、あらゆる映画や装置での性能は示していない。

この研究の面白いところ

会話を先に取り出し、残りを音楽と効果音に分ける二つの小型ネットワークを使い、少ない演算量で比較法中の最高の平均SI-SDRを得た。

どこまで分かった?

評価はDnR v3の空間化ステレオ拡張に基づく。実際の機器での遅延値や消費電力は要旨に記されていない。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

映画音声の音源分離は、一つのサウンドトラックを会話、音楽、効果音の別々の音声へ分ける。従来法はパラメータの多いネットワークとGPU級の装置に依存しがちで、リアルタイムや資源の限られた場面では使いにくい。また主にモノラル音声向けで、ステレオの場合は十分に調べられていない。著者らは、把握する限り初めての、リアルタイムのステレオ映画音声分離に向けた軽量な端から端までのネットワークLiteCASSを提案する。決定的な短時間Fourier変換の帯域並べ替えと、同時に学習する小型U-Netを二つ組み合わせる。一つ目が会話を取り出し、二つ目が予測された非音声成分から音楽と効果音を分ける。全成分の学習には、波形領域での複数課題のL1損失を使う。DnR v3を空間化したステレオ拡張で、LiteCASS-K8はパラメータ106万個、毎秒0.72ギガ回の積和演算だけを使い、比較した映画音声分離の基準法の中で、平均SI-SDRが最も高かった。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-20(UTC)
最新改訂
2026-09-20 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Cinematic audio source separation (CASS) decomposes a soundtrack into dialogue, music, and sound-effects (SFX) stems. Existing CASS methods, however, suffer from two critical limitations: they rely on heavily parameterized network architectures and GPU-class hardware, limiting their use in real-time and resource-constrained scenarios, and they are overwhelmingly designed for monaural signals, leaving the stereo scenario largely unexplored. We present LiteCASS, to our knowledge the first lightweight end-to-end network for real-time stereo CASS. LiteCASS combines deterministic STFT subband rearrangement with two jointly trained compact U-Nets: the first extracts dialogue, and the second separates music and SFX from the predicted non-speech component. A multi-task waveform-domain L1 loss supervises all stems. On a spatialized stereo extension of DnR v3, LiteCASS-K8 uses only 1.06M parameters and 0.72G MACs per second, while achieving the highest averaged SI-SDR among the compared CASS baselines.

著者のコメント

5 pages, 2 figures, 3 tables

arXiv ID: 2609.23453 / 要約の誤りについて