arXiv論文メモ
新着一覧
cs.CV / cs.AI / cs.LG / cs.LO · 査読状況未確認

画像内の条件を組み合わせて判断する能力を測るHob-VL

Hob-VL: A Benchmark for Visually Grounded Boolean Reasoning

Yuzhou Wang, Emile Anand, Ijay Narang

この論文をやさしく読む

ひとことで言うと

画像が見えていても、複数の条件を論理的に組み合わせて正しく答えられるかを測る評価セットです。

何に役立つ?

画像を使うAIの評価で、物体を認識する力と、条件を組み合わせる力を分けて点検するために使えます。

この研究の面白いところ

同じ意味の問いへの一貫性や、紛らわしい手がかりへの影響まで評価できるよう、質問と参照解答を構成しています。

どこまで分かった?

示された成績は8種類の思考無効・最小化設定と、思考を有効にしたGLMの設定に関するものです。すべての視覚モデルやあらゆる思考設定の性能を表す結果ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

信頼できる視覚推論には、複数の視覚的観察を組み合わせ、論理的に同値な質問に対して一貫した答えを返すことが必要である。視覚情報に基づくブール推論のベンチマークHob-VLを提案する。Hob-VLは、(1)画像内でブール規則が成り立つかを評価する課題と、(2)ブール条件の記述を満たす唯一の物体を特定する課題の二つからなる。Hob-VLには、生成された1,000場面と、多様なラベル付き写真46枚にわたる、人手で確認されたYes/Noの均衡した質問6,000件が含まれる。各質問は10個の視覚的な命題のブール結合で定義される。さらに、同じ写真を用いた物体特定の質問1,000件も含む。質問群は、誤解を誘う局所的な手がかりや入れ子状の論理演算によって推論を難しくするよう意図的に構成しており、記号形式と構造化された自然言語形式の提示を含む。思考機能を無効化または最小限にした8種類のモデル設定では、ブール判断の正解率は48.52〜50.57%で、物体特定の正解率も最大43.0%にとどまる。思考機能を有効にしたGLMの設定では改善が一様ではなく、依然として多くの誤りと不整合が残る。Hob-VLは、実行可能な参照解答と対応をそろえた評価によって、これらの失敗を明らかにする。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-10-01(UTC)
最新改訂
2026-10-01 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Reliable visual reasoning requires composing multiple visual observations and returning consistent answers to logically equivalent questions. We introduce Hob-VL, a benchmark for visually grounded Boolean reasoning. Hob-VL comprises two tasks: (1) evaluating whether a Boolean rule holds in an image, and (2) identifying the (unique) object satisfying a Boolean description. Hob-VL contains 6,000 human-verified balanced Yes/No questions, each defined by a Boolean combination of ten visual statements, across 1,000 generated scenes and 46 diverse labeled photographs, along with 1,000 object-identification questions over the same photographs. Our question families are deliberately constructed to challenge reasoning through misleading local cues and nested logical operations, and include symbolic and structured natural-language presentations. Across eight model configurations with thinking disabled or minimized, Boolean accuracy ranges from 48.52% to 50.57%, while the identification accuracy reaches at most 43.0%. A thinking-enabled GLM configuration achieves uneven gains while retaining substantial errors and inconsistencies. Hob-VL exposes these failures through executable reference answers and matched evaluations.

著者のコメント

29 pages, 6 figures, 14 tables

arXiv ID: 2610.01605 / 要約の誤りについて