arXiv論文メモ
新着一覧
cs.CV · 査読状況未確認

意味情報と時空間走査で動画の雨を取り除く

S3VD: Semantic-Guidance Spatio-Temporal Scanning for Video Deraining

Kui Jiang, Yiang Chen, Yan Luo, Zhaocheng Yu, Junjun Jiang, Xianming Liu

この論文をやさしく読む

ひとことで言うと

雨で見えにくくなった動画を、画像の意味と前後のフレームの関係を使って復元する手法です。

何に役立つ?

屋外動画の画質を改善する処理として利用が考えられます。実際に示されたのは雨除去ベンチマークでの復元性能で、その後の認識タスクの改善量は要旨にありません。

この研究の面白いところ

画像を1列に並べると失われがちな局所的な意味をDINOv2で補い、時間の前後の情報量を別々のゲートで調節します。

どこまで分かった?

平均0.84 dBの改善はMambaベースの比較手法に対するPSNRの値です。要旨には実行速度、使用データセットの詳細、未知の雨条件での評価は記載されていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

激しい雨は高周波の細部を損ない、動きのぼけをもたらすことで屋外動画の品質を大きく低下させ、視覚タスクの信頼性を著しく損なう。近年、状態空間モデル(SSM)、特にMambaは、線形の計算量と長距離依存関係をモデル化する能力によって、視覚タスクの効率的な代替手法として登場した。しかし、雨の動画における劣化した視覚表現に対しては、Mambaも2次元の空間的な意味のまとまりを保つことや、3次元の時空間相関をモデル化することに困難を抱える。 これらの限界を打破するため、私たちは動画からの雨除去に向けた意味情報誘導型の時空間走査フレームワークS3VDを導入する。主な新機構は、マルチスケール意味融合(MSSF)モジュールと、時空間走査融合(STSF)モジュールの2つである。前者はDINOv2から得た時間方向の意味的事前情報を統合して精密な特徴表現を導き、Mambaの1次元平坦化操作に伴う局所的な意味文脈の喪失を補うことで、極端な劣化に対する頑健性を高める。後者は時空間走査機構を導入し、分離ゲートMamba(DG-Mamba)層を考案する。この層は2つの独立したゲートによって入力クリップ内の前後の文脈情報を適応的に制御し、フレーム内およびフレーム間の相関モデル化を最適化する。 動画の雨除去ベンチマークでの実験はS3VDの優位性を示し、Mambaベースの比較手法に対してPSNRを平均0.84 dB改善する最先端の性能を達成した。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-18(UTC)
最新改訂
2026-09-18 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Heavy rainfall severely degrades outdoor videos by corrupting high-frequency details and introducing motion blur, critically undermining the reliability of visual tasks. Recently, State Space Models (SSMs), particularly Mamba, have emerged as efficient alternatives for vision tasks with their linear complexity and ability to model long-range dependencies. However, when confronted with the poor visual representations in rainy videos, Mamba still faces difficulties in preserving the integrity of 2D spatial semantics and modeling 3D spatio-temporal correlations. To break these limitations, we introduce S3VD, a Semantic-Guidance Spatio-Temporal Scanning framework for video deraining, featuring two key innovations: Multi-Scale Semantic Fusion (MSSF) Module and Spatio-Temporal Scanning Fusion (STSF) Module. The former integrates temporal semantic priors from DINOv2 to guide precise feature representation and counteract the loss of local semantic context inherent to Mamba's 1D flatten operation, enhancing robustness against extreme degradation. The latter introduces a spatio-temporal scanning mechanism and devises a Decoupled-Gating Mamba (DG-Mamba) layer, which employs two independent gates to adaptively control preceding and subsequent contextual information within the input clip, optimizing intra-frame and inter-frame correlation modeling. Experiments on video deraining benchmarks demonstrate the superiority of S3VD, achieving state-of-the-art performance with an average 0.84 dB PSNR improvement over Mamba-based baselines.

arXiv ID: 2609.21322 / 要約の誤りについて