arXiv論文メモ
新着一覧
cs.CV / cs.AI · 査読状況未確認

エンコーダーだけで行う高速な音声・映像の物体領域分割

Less is More: Encoder-only Audio-Visual Segmentation

Ilpo Viertola, Vladimir Iashin, Sophie Tötterström, Esa Rahtu

この論文をやさしく読む

ひとことで言うと

動画の中で音を出している物体の領域を見つける処理を、簡素なモデルで高速化した研究です。

何に役立つ?

動画中の発音物体をリアルタイムで見つける用途や、計算資源を抑えた研究の基盤として役立つと考えられます。実測として報告されているのは、記載のモデルと評価条件での速度、学習時間、精度です。

この研究の面白いところ

画像用モデルから引き継いだ構成を見直し、エンコーダーだけの構成で最大365 FPSと同程度の精度を報告しています。

どこまで分かった?

要旨には評価データセットや計測用ハードウェアの詳細は記載されていません。最大速度と比較倍率は、評価条件を離れた普遍的な性能を意味するものではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

音声・映像の意味的領域分割(AVSS)は、動画フレーム内で音を出している物体を特定し、その領域を分割・分類することを目指す。従来のTransformerベースのAVSS手法は、主に画像の領域分割モデルの設計原則を引き継いでいる。最近の研究では、それらの画像領域分割モデルに、分割性能への寄与が小さい冗長な部品があると示された。この知見を踏まえ、エンコーダーだけで構成する音声・映像領域分割手法EASEを提案する。EASEは最大365フレーム毎秒で動作し、同程度の精度における従来の最高水準のAVSモデルより3倍速く、学習は11 GPU時間未満で終わる。さらに、異なるバックボーンと入力解像度にわたり、AVSSで最高水準の性能を達成した。結果は、AVSSをより簡素かつ高速にできることを示し、今後の研究やリアルタイム応用のための拡張可能な基盤となる。コード、モデルの重み、サンプルが公開されている。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-24(UTC)
最新改訂
2026-09-24 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Audio-Visual Semantic Segmentation (AVSS) aims to identify, segment, and classify sound-emitting objects in video frames. Previous Transformer-based AVSS approaches largely inherit design principles from image segmentation models. Recent studies show that these image segmentation models contain redundant components that contribute little to the segmentation performance. Following this insight, we propose Encoder-only Audio-Visual Segmentation (EASE). EASE runs at up to 365 FPS, 3x faster than prior State-of-the-Art (SotA) AVS models at comparable accuracy, and trains in under 11 GPU-hours. Furthermore, we achieve SotA AVSS performance across different backbones and input resolutions. Our results demonstrate that AVSS can be both simpler and faster, providing a scalable foundation for future research and real-time applications. Code, model weights, and samples are available at https://ease-avs.notion.site

著者のコメント

Submitted to ICASSP 2027. Project page https://ease-avs.notion.site

arXiv ID: 2609.29121 / 要約の誤りについて