arXiv論文メモ
新着一覧
cs.CL · 査読状況未確認

小型の視覚言語モデルを七つの観点で評価するベンチマーク

PRISM-VLM: A Multi-Axis Discriminative Benchmark for Compact Vision-Language Models

Sanghee Park, Kee-Eung Kim

この論文をやさしく読む

ひとことで言うと

小型の視覚言語モデルを一つの正答率だけで比べず、七つの観点から違いを見つける評価方法です。

何に役立つ?

小型VLMを用途に合わせて選び、正答率以外の振る舞いの差を調べる際に役立つ。

この研究の面白いところ

合計点が統計的に同程度でも観点ごとの成績は大きく異なり、特に迎合性は単一の指示に対する正答率とほぼ独立していた。

どこまで分かった?

設問は15の既存公開ベンチマークから再利用した。評価手順や注釈の公開は要旨時点では予定として述べられている。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

小型の視覚言語モデル(VLM)は、複数の情報形式を扱う応用で使われる割合が増えている。しかし、それらを比較するベンチマークには最先端の大型モデルを中心とする設計が受け継がれ、各モデルを単一の正答率にまとめてしまう。その結果、容易すぎる課題群ではモデル間の差が縮み、難しい課題群ではどのモデルも低得点帯に押し込められる。そこで、繰り返し現れる失敗の型を、課題の質、振る舞いの頑健性、能力上の制約を含む七つの観点で各設問について採点し、一つのPScoreへまとめる、多軸の識別力を持つベンチマークPRISM-VLMを導入する。設問は15の公開ベンチマークから再利用する。 過去2年間に登場した小型VLMを比較すると、設問単位の対応のあるブートストラップ法による評価で、PScoreは従来の単一軸ベンチマークよりもモデルの組を安定して区別し、それらが平均化して見落とす振る舞いの違いも明らかにした。PScoreが統計的に区別できないモデル同士でも、観点別の成績には大きな違いがあり、とりわけ迎合性は単一の指示による正答率とほぼ独立していた。著者らは評価の全手順、指示文、設問ごとの注釈を公開する予定である。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-23(UTC)
最新改訂
2026-09-23 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Compact vision-language models (VLMs) now power a growing share of multimodal applications. The benchmarks used to compare them, however, inherit a frontier-centric design: each model is reduced to a single accuracy number, narrowing the inter-model gap on saturated suites and pressing models into low-score bands on harder ones. We introduce PRISM-VLM, a multi-axis discriminative benchmark that scores every item along seven axes covering the recurring failure modes (task quality, behavioral robustness, and capability bottlenecks) and combines them into a single PScore, with items recycled from fifteen public benchmarks. Across compact VLMs from the past two years, PScore separates model pairs more reliably than prior single-axis benchmarks under an item-level paired bootstrap, and surfaces behavioral differences these benchmarks average away. Even models with statistically indistinguishable PScores diverge sharply along the per-axis profile, particularly on sycophancy, which is nearly orthogonal to single-prompt accuracy. We will release the full pipeline, prompts, and per-item annotations.

著者のコメント

Accepted to EMNLP 2026 Findings. 29 pages, 22 figures, 21 tables

arXiv ID: 2609.27395 / 要約の誤りについて