arXiv論文メモ
新着一覧
cs.AI / cs.CV · 査読状況未確認

過去の画像をそのまま参照して視覚課題を解く仕組み

VISTA: A Visual Harness for Reasoning in an Interactive World

Qiushi Han, Keya Hu, Linlu Qiu, Cathy Wu, Kaiming He

この論文をやさしく読む

ひとことで言うと

モデルが過去に見た画面を元の画像のまま保存し、必要なときに取り出して考え直せる仕組みです。ゲームやパズルで、その記憶の使い方が成績を改善しています。

何に役立つ?

画面の変化を追いながら長い手順を実行するエージェントの設計に役立つ可能性があります。要旨で示された実証範囲は視覚ゲームとパズルのベンチマークです。

この研究の面白いところ

モデル本体を替えるのではなく、観測の保存・検索・入力の並べ直しで能力を引き出します。同じ基盤モデルを用いた比較が、実行支援の仕組みの重要性を示しています。

どこまで分かった?

100.00はARC-AGI-3のRelative Human Action Efficiencyという指標の満点です。公開25ゲームを完了した結果であり、未知のあらゆる課題で人間を上回るという意味ではありません。追加3ベンチマークの個別数値は要旨にありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

私たちは、マルチモーダルモデルが強い推論能力を備えており、適切な実行支援の仕組みによって、多様な対話型環境で課題を解く潜在能力を引き出せることを示す。汎用マルチモーダルモデルに長い時間範囲を見渡す視覚を与える、視覚的な実行支援基盤VISTAを提案する。VISTAは視覚観測を通してモデルが環境を直接知覚できるようにし、過去の観測を元の形で保持する、情報を失わない視覚記憶を維持する。モデルは推論しながら、これらの観測を能動的に取り出し、視覚入力を再編成できる。 ARC-AGI-3では、VISTAによりClaude Opus 5.0のRelative Human Action Efficiencyスコアが40.68から満点の100.00へ改善した。モデルは公開されている25ゲームすべてを完了し、初めて参加する人間より57.4%少ない行動回数で達成した。VISTAの単純な設計により、最小限の適応で多様な視覚環境へ自然に拡張することもできる。多様な視覚ゲームとパズルを扱う追加の3ベンチマークでも、同じ基盤モデルに最小限の実行支援を組み合わせたベースラインを大幅に上回った。これらの結果は、複雑な視覚環境でマルチモーダルエージェントを発展させるための、汎用的な視覚実行支援基盤としてのVISTAの可能性を示している。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-10-01(UTC)
最新改訂
2026-10-01 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

We show that multimodal models possess strong reasoning abilities and that an appropriate harness can unlock their potential to solve tasks across diverse interactive environments. We introduce VISTA, a visual harness that gives a general-purpose multimodal model long-horizon vision. VISTA allows the model to directly perceive the environment through visual observations and maintains a lossless visual memory that preserves past observations in their original form. The model can actively retrieve these observations and reorganize its visual input as it reasons. On ARC-AGI-3, VISTA improves Claude Opus 5.0's Relative Human Action Efficiency score from 40.68 to a perfect 100.00, with the model completing all 25 public games using 57.4% fewer actions than first-time human participants. VISTA's simple design also allows it to extend naturally to diverse visual environments with minimal adaptation. Across three additional benchmarks covering a diverse range of visual games and puzzles, it substantially outperforms baselines using the same underlying model with minimal harnesses. Our results highlight VISTA's potential as a general-purpose visual harness for advancing multimodal agents in complex visual environments.

著者のコメント

Tech report. An early version of this manuscript was in a blogpost published in Aug 5, 2026: https://vista-research.github.io/

arXiv ID: 2610.02200 / 要約の誤りについて