arXiv論文メモ
新着一覧
cs.CV / cs.LG · 査読状況未確認

衛星画像の不要な部分を省いて画像と言語の推論を高速化

Exploiting answer-invariant redundancies in satellite imagery for efficient VLM inference on edge

Ishani Janveja, Davis Zhang, Seoyul Oh, Deepak Vasisht

この論文をやさしく読む

ひとことで言うと

衛星画像への質問に答える際、回答に影響しない画像部分を省いて推論量を減らす方法です。

何に役立つ?

衛星搭載機器など計算資源や電力が限られる環境での画像と言語の推論に役立つ可能性があります。

この研究の面白いところ

タイルの間引きとトークン数の調整を組み合わせ、報告された条件では速度と正答率の両方が改善しました。

どこまで分かった?

数値はJetson AGX Orin上のLLaVA-1.5 7Bを用いた評価です。他の機器やモデルでの結果は要旨に記載されていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

衛星に搭載した画像と言語のモデルが質問に直接答えられれば便利だが、高解像度画像をすべてタイルに分けて推論すると時間と電力がかかる。本研究は、除いても最終回答が変わらない画像タイルや視覚トークンを、回答不変のトークン冗長性(AITR)として特定する。Riftという2段階のシステムを提示し、質問に応じてタイルを間引いた後、弾力的な事前処理でトークン予算を減らす。 Jetson AGX Orin上で動くLLaVA-1.5 7Bを用いて評価した。すべてのタイルを使う推論と比べて、Riftは消費エネルギーを78%、遅延を69%減らし、正答率を45%から73%に高めた。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-24(UTC)
最新改訂
2026-09-24 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Onboard vision-language models could enable satellites to answer queries directly, but exhaustive tiled inference over high-resolution imagery is slow and energy-intensive. We identify answer-invariant token redundancy (AITR): image tiles and vision tokens that can be removed without changing the final answer. We present Rift, a two-stage system that performs query-conditioned tile pruning followed by elastic prefill to reduce token budget. We evaluate it on LLaVA-1.5 7B running on Jetson AGX Orin. Compared with exhaustive tiled inference, Rift reduces energy by 78% and latency by 69%, while increasing accuracy from 45% to 73%.

arXiv ID: 2609.29029 / 要約の誤りについて