複数の視覚言語モデルで表の読み取り誤りを抑える
PrismAlign: Prior-Steered Multi-View VLM Alignment for Hallucination-Robust Table OCR
この論文をやさしく読む
ひとことで言うと
画像から表を読み取る複数のAIの結果を、表の構造や内容のルールに照らしてすり合わせる方法です。存在しない内容を生成する誤りも減らそうとします。
何に役立つ?
考えられる用途は、文書中の表を機械可読なデータへ変換する処理です。要旨では複数の文書・表認識ベンチマークで性能を比較しています。
この研究の面白いところ
行列の構造が合っているかと、各セルの文字内容が合っているかを分けて扱います。規則違反と誤読の相関を意思決定に利用します。
どこまで分かった?
最先端という記述は指定のベンチマークと評価モデルについての結果です。要旨には改善幅や処理コストの数値がなく、すべての表で誤りをなくす保証はありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
表の抽出では、構造上の誤りと意味内容の幻覚が頻繁に生じる。本研究では、多様な視覚的観点を整合させて曖昧さを解消する、複数の視覚言語モデル(VLM)による枠組みPrismAlignを提案する。表の論理に関する事前知識を取り入れて出力の妥当性を評価し、構造の整合とセル内容の整合を分離する。ベイズ意思決定戦略が、抽出誤りと計算可能な規則違反との相関を利用して、整合精度を最大化する。オープンソースおよび独自のVLMで評価した結果、PrismAlignは幻覚を減らし、OmniDocBench 1.5と、CC-OCRおよびPureDocBenchの表カテゴリで最先端の性能を達成する。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-18(UTC)
- 最新改訂
- 2026-09-18 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-18 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Table extraction suffers from frequent structural errors and semantic hallucinations. We propose PrismAlign, a multi-VLM framework aligning diverse visual perspectives to resolve ambiguity. It integrates priors of table logic to assess output plausibility, decoupling structural alignment from cell content alignment. A Bayesian decision strategy maximizes alignment accuracy by exploiting the correlation between extraction errors and computable rule violations. Evaluated on open-source and custom VLMs, PrismAlign reduces hallucinations and achieves state-of-the-art performance on OmniDocBench 1.5, as well as on the table category of CC-OCR and PureDocBench.
著者のコメント
Accepted by EMNLP industry track
arXiv ID: 2609.21351 / 要約の誤りについて