イベントカメラで通常映像のコマ間の領域分割を補う
Event-Frame Fusion for Inter-Frame Segmentation via Event-Guided Motion
この論文をやさしく読む
ひとことで言うと
普通のカメラが次の画像を撮るまでの間を、明るさの変化を細かく記録するイベントカメラで補う方法です。
何に役立つ?
考えられる用途は、速い動きや露出の変化がある自律移動で、道路や物体の領域をより細かな時間間隔で把握することです。
この研究の面白いところ
動き推定と領域分割を二つの小さなSNNに分け、通常画像の意味情報とイベントの高い時間分解能を組み合わせています。
どこまで分かった?
最大500 Hzの領域分割頻度と、GPU上の最大200 Hzのリアルタイム実行は別の数値です。要旨には精度の具体値や、自律走行全体の安全性評価は記載されていません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
自律移動には正確かつ効率的な意味的領域分割が必要だが、既存のフレームベースの手法は、動きぼけ、まぶしさ、遅延、通常のカメラの低い時間分解能(20~30 FPS)に制約されており、フレーム間の情報が失われる。代替のセンシング方式として登場したイベントカメラは、輝度の変化を非同期に捉え、高い時間分解能、広いダイナミックレンジ、疎な出力を備える。しかし、多くの領域分割手法が密なフレームデータ向けに設計されているため、イベントベースのアルゴリズムは、精度では依然としてフレームベースのものに及ばない。 これらの制約を克服するため、通常のフレーム型カメラとイベントカメラを組み合わせるハイブリッド視覚アーキテクチャを提案する。このシステムは、相補的な二つの構成要素を統合する。一つは動き推定を行う4万2,000パラメータの小型スパイキングニューラルネットワーク(SNN)、もう一つは、フレーム間の動きを補間して領域分割結果を改善する、フレームベースの意味的領域分割用の84万パラメータの軽量なイベント駆動SNNである。 フレーム間の領域分割を予測することにより、この枠組みは推論1回当たり1.87 mJ未満のエネルギー消費で最大500 Hzの領域分割頻度を実現し、GPU上でも最大200 Hzでリアルタイムに実行できる。さらに、ぼけや露出過多の影響を受けたフレームで失われる情報を補い、困難な条件でより頑健な知覚を可能にする。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-18(UTC)
- 最新改訂
- 2026-09-18 · v1
- 査読・掲載
- 掲載先の記載あり
著者による掲載先の記載:ICONIP 2026。出版社での独立確認は未実施です。
更新履歴
- v1 2026-09-18 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Autonomous navigation requires precise and efficient semantic segmentation, yet existing frame-based approaches remain limited by motion blur, glare, latency, and the low temporal resolution (20-30 FPS) of conventional cameras, which leads to information loss between frames. Event cameras have emerged as an alternative sensing modality, capturing intensity changes asynchronously with high temporal resolution, high dynamic range, and sparse outputs. However, event-based algorithms still fall short of frame-based ones in accuracy, as most segmentation methods are designed for dense frame data. To overcome these limitations, we propose a hybrid vision architecture that combines conventional frame-based and event-based cameras. The system integrates two complementary components: (1) a compact Spiking Neural Network (SNN) with 42k parameters for motion estimation, and (2) a lightweight event-driven SNN with 0.84M parameters for frame-based semantic segmentation, which interpolates motion between frames to refine segmentation results. By predicting inter-frame segmentations, the framework achieves segmentation rates of up to 500 Hz with an energy consumption below 1.87 mJ per inference, while maintaining real-time GPU execution at frequencies up to 200 Hz. Additionally, our approach compensates for information loss in frames affected by blur or overexposure, enabling more robust perception in challenging conditions.
arXiv ID: 2609.22500 / 要約の誤りについて