複数画像を使うソフトウェア修正を測るベンチマーク
SWE-PolyVision: Benchmarking Cross-Image Abductive Reasoning for Repository-Level Software Engineering
この論文をやさしく読む
ひとことで言うと
複数の画像を読み合わせてコードを直せるかを、実際のリポジトリ課題で評価するベンチマーク。
何に役立つ?
画像を含む開発依頼に対するコーディングモデルの評価で、画像を見られることと修正に使えることを分けて測るのに役立つ。
この研究の面白いところ
92課題に各2つ以上の視覚入力を用意し、画像へのアクセス方法を変えて11モデルを比較した。
どこまで分かった?
画像の効果はモデルと課題に依存し、事例分析で見られた証拠統合も入力が変わると安定しない。パッチ成功だけでは推論過程を証明できない。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
現在のマルチモーダルなソフトウェア工学ベンチマークは画像を追加の文脈として与えるが、画像間に分散した証拠を統合して、リポジトリ全体に関わる検証済みの修正を行えるかは試していない。著者らは36のオープンソース組織から得た実際の92課題による実行可能なベンチマークSWE-PolyVisionを提示する。公開課題は48件、非公開の留保課題は44件で、402枚の静止画像と6本の動画を含み、各課題には少なくとも2つの視覚入力がある。各課題は修正前の固定されたリポジトリと独立した検証器を組み合わせ、対応する条件の範囲で、テキストのみ、モデルが直接画像を見る方法、ツールを介して画像を見る方法の3つのアクセス方式を評価する。11のコーディングモデルを比較すると、視覚情報へのアクセスによって解ける課題は変わるが、効果はモデルと課題の両方に依存する。直接画像を見る方式での2事例について、実行履歴と結び付けた分析は、画像と文章の相補的な手掛かりがソース箇所の特定と検証済みの修正につながりうることを示す。一方、条件を制御した介入では、この変換は入力が変わるとまだ安定しない。SWE-PolyVisionは、複数画像の証拠が利用可能であることと、それをリポジトリ修正にうまく使えることを区別し、パッチが成功しただけで明示的な推論の証拠とはみなさない。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-24(UTC)
- 最新改訂
- 2026-09-24 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-24 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Current multimodal software-engineering benchmarks expose images as additional context, but do not test whether an agent can integrate evidence distributed across images into a verified repository-level repair. We present SWE-PolyVision, an executable benchmark of 92 real tasks from 36 open-source organizations, with 48 public tasks and 44 private holdouts. The release contains 402 static images and 6 videos, with at least two visual inputs per task. Each task pairs a fixed pre-fix repository with an isolated verifier and is evaluated under the supported conditions among three access modes: Text-only, Native Vision, and Tool-mediated Vision. Across eleven coding models, visual access changes which tasks are solved, but effects depend on both model and task. Two trace-linked Native Vision cases illustrate how complementary visual and textual clues can lead to source-localized, verified repairs; controlled interventions show that this conversion is not yet stable across inputs. SWE-PolyVision thus separates the availability of multi-image evidence from its successful use in repository-level repair, without treating patch success alone as proof of explicit reasoning.
arXiv ID: 2609.29754 / 要約の誤りについて