arXiv論文メモ
新着一覧
physics.optics / eess.IV · 査読状況未確認

小型Transformerでレンズなし画像をリアルタイム復元

RTLViT: real-time lensless reconstruction with a lightweight vision transformer

Leyla A. Kabuli, Vasilisa Ponomarenko, Laura Waller

この論文をやさしく読む

ひとことで言うと

レンズを使わずに取得した測定データから、画像を素早く復元する小さなAIモデルです。スマートフォンやノートパソコン上での動作も報告しています。

何に役立つ?

考えられる用途は、小型機器内で撮影から画像復元までを処理するレンズレス撮像です。パラメータ数と画質の比較は、計算資源が限られた機器の再構成手法を選ぶ参考になります。

この研究の面白いところ

モデルを大きくするのではなく、109万パラメータの構造で、15倍の規模の比較対象より高い画質を得ています。異なるマスクと学習データ量でも評価している点が特徴です。

どこまで分かった?

最大3.46 dBは報告された比較での最大改善量です。要旨には機種別のフレームレートや消費電力の数値がなく、すべてのスマートフォンで同じ速度を保証するものではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

マスクを用いるレンズレス撮像装置は、簡素で小型のハードウェアで測定値を取得し、再構成アルゴリズムによって画像を復元する。このアルゴリズムは撮像システムの画質、推論速度、計算要件を左右し、多くの場合、画質と計算効率の間にトレードオフがある。符号化と再構成を携帯電話などの単一機器内で行う一体型レンズレス撮像装置へ進むには、高速で高画質かつ実用的な再構成法が必要となる。 本研究では、高画質なレンズレス再構成をリアルタイムで行う、軽量で純粋にデータ駆動型の構造Real-Time Lensless Vision Transformer(RTLViT)を提案する。学習可能なパラメータはわずか109万個でありながら、リアルタイム処理向けのベースラインと、はるかに大きな注意機構ベースの構造の双方より高画質な再構成を実現する。学習可能なパラメータが15倍ある構造に対しても、ピーク信号対雑音比で最大3.46 dBの改善を得た。学習データセットの規模を幅広く変えた場合と、レンズレットおよび拡散板という2種類のマスク設計で、高画質な再構成を維持することを示す。最後に、ノートパソコンとスマートフォン上でRTLViTによるリアルタイム再構成を実装し、将来のリアルタイム用途向け一体型レンズレス撮像装置につながる結果を示した。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-17(UTC)
最新改訂
2026-09-17 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Mask-based lensless imagers capture measurements using simple, compact hardware and recover images using a reconstruction algorithm. The reconstruction algorithm affects the image quality, inference speed, and computational requirements of the imaging system, often trading off image quality against computational efficiency. Advancing toward integrated lensless imagers, where encoding and reconstruction occur within a single device (e.g., a mobile phone), requires a fast, high-quality, and practical reconstruction method. We introduce the Real-Time Lensless Vision Transformer (RTLViT), a lightweight, purely data-driven reconstruction architecture for high-quality and real-time lensless reconstruction. With only 1.09 million learnable parameters, RTLViT provides higher-quality reconstructions than both real-time baselines and substantially larger attention-based architectures, including improvements of up to 3.46 dB in peak signal-to-noise ratio over architectures with $15 \times$ more learnable parameters. We demonstrate that RTLViT maintains high-quality reconstructions across a wide range of training dataset sizes and two different mask designs (lenslets and a diffuser). Finally, we implement real-time reconstruction with RTLViT on laptops and smartphones, supporting future integrated lensless imagers for real-time applications.

著者のコメント

9 pages, 6 figures

arXiv ID: 2609.21042 / 要約の誤りについて