文書解析の反復崩壊を検知してページ分割で修復
Collapse, Not Complexity: Failure-Conditioned Decomposition Repair for End-to-End Document Parsing
この論文をやさしく読む
ひとことで言うと
文書解析が同じ出力を延々と繰り返す失敗を検知し、ページを領域に分けて読み直すと改善するという研究です。ページの見た目の複雑さだけでは、推論モードの利用判断ができませんでした。
何に役立つ?
文書解析器が失敗したときに、単に推論量を増やすのではなく再処理の方法を選ぶための根拠になります。通常処理の記録を使って修復対象を見つけます。
この研究の面白いところ
崩壊したページは複雑そうなページとは限らず、むしろレイアウトエントロピーが低いという結果です。計算予算や推論モードを増やすより、領域分割が有効でした。
どこまで分かった?
改善値はOverallという品質指標の差で、正解率の百分率ではありません。180ページの探索と残り1,175ページの固定条件評価を区別しています。報告されたチェックポイントやベンチマーク以外での有効性は要旨から確定できません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
エンドツーエンドの文書解析器では、複雑なページ向けに任意の推論モードを備えるものが増えている。しかし、固定した一つの4Bチェックポイントを用い、エントロピーで層別化した180ページの探索用標本で調べると、複雑さは適切な判断変数ではない。推論モードはトークン数を1.54倍にしながら、平均品質をOverall指標で2.21低下させる。事前登録した入力情報だけのモデルでは、推論モードが改善をもたらすか悪化をもたらすかを予測できない。ホールドアウトのAUROCは0.47で、偶然と区別できない。利点は通常の処理がすでに崩壊したページに集中するが、それらは複雑には見えない。両モードに共通して崩壊するページは、正常なページよりレイアウトエントロピーが低いにもかかわらず、退化した反復として19倍のトークンを消費し、予算を2倍にしても直らない。モード切替で修復されることも少なく、83%は推論モードでも再発する。代わりに、通常処理の記録から崩壊を検知し、投影に基づいてページを分割し、各領域を再解析する。この修復はトークン数1.13倍でOverallを1.40改善し、95%信頼区間は[0.68,2.16]となる。三つのチェックポイントで再現し、すべてのパラメータを固定したまま、ベンチマークの残り1,175ページでも2.41の改善、信頼区間[1.64,3.46]を得る。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-20(UTC)
- 最新改訂
- 2026-09-20 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-20 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
End-to-end document parsers increasingly offer an optional reasoning mode for complex pages. On a 180-page entropy-stratified discovery sample with one frozen 4B checkpoint, complexity is the wrong decision variable. Reasoning lowers mean quality by 2.21 Overall at 1.54x tokens; a preregistered input-only model cannot predict its signed benefit (held-out AUROC 0.47, indistinguishable from chance). The benefit concentrates on pages whose ordinary pass has already collapsed, and they do not look complex: shared collapses have lower layout entropy than healthy ones yet consume 19x the tokens as degenerate repetition that doubling the budget does not cure. Switching modes rarely repairs them: 83% recur under reasoning. We instead detect collapse from the ordinary-pass trace, decompose the page by projection, and re-parse each region. Repair gains 1.40 Overall (95% CI [0.68, 2.16]) at 1.13x tokens, replicates across three checkpoints, and, with all parameters frozen, gains 2.41 (CI [1.64, 3.46]) on the remaining 1,175 benchmark pages.
著者のコメント
5 pages, 3 figures, 2 tables. Submitted to ICASSP 2027
arXiv ID: 2609.23592 / 要約の誤りについて