画像証拠を選んで保持する視覚AIの作業環境
VLM-in-Sandbox: Visual Workspaces for Agentic Visual Reasoning
この論文をやさしく読む
ひとことで言うと
画像を使って何段階も考えるAIが、途中で作った画像を全部抱え込まず、台帳に保存して必要なものを選び直す仕組みです。画像を作る操作と、今どの画像を見るかの管理を分けます。
何に役立つ?
画像を加工しながら推論するエージェントで、文脈の膨張と処理負担を抑える方法として役立ちます。ローカル実験ではトークン数だけでなく応答時間の減少も確認しています。
この研究の面白いところ
保持量を制限する効果と、モデル自身が表示画像を選ぶ効果を2×2実験で分けています。改善例302件だけでなく、悪化例142件も報告しているため、変更の両面を把握できます。
どこまで分かった?
66.27%と18.6%は1,260例の対照実験に対応し、302件・142件は6,350例の別集計です。すべての例で改善したわけではありません。7ベンチマーク・4モデルの比較範囲を超える保証は示されていません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
サンドボックス化された計算機環境は、ツール、実行可能なプログラム、永続的なファイルを使った多段階推論を支える。しかし、言語モデルから視覚言語モデル(VLM)へ拡張すると、固有の状態管理の問題が生じる。視覚推論は、切り抜き、マスク、重ね合わせ画像、拡大領域、分析用描画といった中間の画像証拠を生成する。これらは参照可能なまま保つ必要があるが、マルチモーダルな文脈へ際限なく蓄積してはならない。 本研究では、管理された計算機環境でエージェント型のマルチモーダル推論を行う、追加学習不要の枠組みVLM-in-Sandboxを導入する。そのVisual Workspaceは、生成物を画像台帳へ登録し、有効な視覚文脈を上限付きで維持するとともに、モデルが選んだ証拠を明示的に取り上げ、後で確認できるようにする。これにより、サンドボックスのツールが行う視覚証拠の生成と、視覚証拠の管理を分離する。 7つのベンチマークと4つの基盤VLMにわたり、VLM-in-Sandboxは、標準VLM、追記のみのサンドボックス、提案手法の3者の中で、サンプル数で重みづけした平均正解率が最も高かった。1,260例を使いコンパイラーを揃えた2×2の実験では、モデルが表示対象を決める効果と、保持量に上限を設ける効果をさらに分離した。VLM-in-Sandboxは正解率66.27%を達成し、表示を自動で行い全件を保持する対照条件より総トークン数が18.6%少なかった。GPT-4.1-miniに投入した全6,350例では、元の追記のみの方式に対し、302例を不正解から正解へ改善し、142例が正解から不正解へ悪化した。プレフィックスキャッシュを用いたローカルのvLLM実験では、リクエストの負荷が小さくなることで、キャッシュされないトークン数、最初のトークンまでの時間、全体の遅延も減ることを確認した。これらの結果は、視覚証拠の状態を明示的に扱うことが、サンドボックス内のVLMエージェントの中心的な抽象化であることを示す。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-21(UTC)
- 最新改訂
- 2026-09-21 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-21 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Sandboxed computer environments support multi-step reasoning with tools, executable programs, and persistent files, yet their extension from language models to vision-language models (VLMs) introduces a distinct state-management problem. Visual reasoning produces intermediate image-valued evidence---crops, masks, overlays, zoomed regions, and analytic renderings---that must remain addressable without accumulating unboundedly in multimodal context. We introduce VLM-in-Sandbox, a training-free framework for agentic multimodal reasoning in controlled computer environments. Its Visual Workspace registers generated artifacts in an image ledger, maintains a bounded active visual context, and lets the model explicitly promote selected evidence for subsequent inspection. This separates visual evidence generation, performed by sandbox tools, from visual evidence management. Across seven benchmarks and four base VLMs, VLM-in-Sandbox achieves the highest sample-weighted average accuracy among Vanilla VLM, Append-only Sandbox, and the proposed method. A compiler-matched $2\times2$ study on 1,260 examples further separates model-directed visibility from bounded retention: VLM-in-Sandbox reaches 66.27% accuracy with 18.6% fewer total tokens than the automatic, retain-all control. Over all 6,350 submitted GPT-4.1-mini examples, it produces 302 rescues and 142 regressions relative to Original Append-only. A local vLLM study with prefix caching confirms that the smaller request workload also reduces uncached tokens, time to first token, and end-to-end latency. These results identify explicit visual evidence state as a central abstraction for sandboxed VLM agents.
arXiv ID: 2609.24362 / 要約の誤りについて