arXiv論文メモ
新着一覧
cs.CV · 査読状況未確認

複数の視覚言語モデルで表の読み取り誤りを抑える

PrismAlign: Prior-Steered Multi-View VLM Alignment for Hallucination-Robust Table OCR

Guangyi Liu, Qianjun Huang, Boyu Hou

この論文をやさしく読む

ひとことで言うと

画像から表を読み取る複数のAIの結果を、表の構造や内容のルールに照らしてすり合わせる方法です。存在しない内容を生成する誤りも減らそうとします。

何に役立つ?

考えられる用途は、文書中の表を機械可読なデータへ変換する処理です。要旨では複数の文書・表認識ベンチマークで性能を比較しています。

この研究の面白いところ

行列の構造が合っているかと、各セルの文字内容が合っているかを分けて扱います。規則違反と誤読の相関を意思決定に利用します。

どこまで分かった?

最先端という記述は指定のベンチマークと評価モデルについての結果です。要旨には改善幅や処理コストの数値がなく、すべての表で誤りをなくす保証はありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

表の抽出では、構造上の誤りと意味内容の幻覚が頻繁に生じる。本研究では、多様な視覚的観点を整合させて曖昧さを解消する、複数の視覚言語モデル(VLM)による枠組みPrismAlignを提案する。表の論理に関する事前知識を取り入れて出力の妥当性を評価し、構造の整合とセル内容の整合を分離する。ベイズ意思決定戦略が、抽出誤りと計算可能な規則違反との相関を利用して、整合精度を最大化する。オープンソースおよび独自のVLMで評価した結果、PrismAlignは幻覚を減らし、OmniDocBench 1.5と、CC-OCRおよびPureDocBenchの表カテゴリで最先端の性能を達成する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-18(UTC)
最新改訂
2026-09-18 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Table extraction suffers from frequent structural errors and semantic hallucinations. We propose PrismAlign, a multi-VLM framework aligning diverse visual perspectives to resolve ambiguity. It integrates priors of table logic to assess output plausibility, decoupling structural alignment from cell content alignment. A Bayesian decision strategy maximizes alignment accuracy by exploiting the correlation between extraction errors and computable rule violations. Evaluated on open-source and custom VLMs, PrismAlign reduces hallucinations and achieves state-of-the-art performance on OmniDocBench 1.5, as well as on the table category of CC-OCR and PureDocBench.

著者のコメント

Accepted by EMNLP industry track

arXiv ID: 2609.21351 / 要約の誤りについて