arXiv論文メモ
新着一覧
cs.CL / cs.CV · 査読状況未確認

似た文字誤りの例を探してデーヴァナーガリーOCRを修正

Evaluating In-Context Learning and Retrieval Strategies for Devanagari Post-OCR Correction

Abhishek Bhandari and Gaurav Harit

この論文をやさしく読む

ひとことで言うと

文章の意味が似た例より、文字の読み間違いが似た例をLLMに見せることでOCRの修正を助ける研究です。

何に役立つ?

ヒンディー語やマラーティー語の文書電子化で、専用の追加学習をせず認識誤りを直す方法の選択に役立ちます。

この研究の面白いところ

例の選び方とモデル規模を分けて比較し、小さいモデルでは例を与えてもかえって悪化する場合があると示しています。

どこまで分かった?

GPU不要なのはCharBM25による検索部分です。評価は5ニュース分野の2万文であり、小規模LLMにも安定して有効な方法という結果ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

大規模言語モデル(LLM)による文脈内学習は、追加学習なしでOCR後の誤りを修正する有望な方法だが、デーヴァナーガリー文字に対する有効性は全く調べられていない。本研究は、ヒンディー語とマラーティー語のOCR後修正について、30億〜320億パラメータのLLMを対象とする初めての体系的な評価を提示する。文脈内で提示する例の検索方法として、分野内からのランダム選択、密な意味表現に基づく検索、提案するCharBM25の三つを比較する。CharBM25はOCR入力の文字nグラムに対するBM25類似度を使い、テスト文と共通する誤りのパターンを持つ例を検索する。 5種類のニュース分野にまたがる2万文のベンチマークでは、検索方法が修正品質を決定する要因となった。文字3グラムを使うCharBM25は、分野内ランダム選択に比べ、単語誤り率(WER)をヒンディー語で絶対値2.8〜4.0パーセントポイント、マラーティー語で2.9〜3.8パーセントポイント改善する。文字3グラムは2グラムと1グラムを一貫して上回る。性能はモデル規模に強く左右され、CharBM25-5を用いたGemma-3-27Bは、ヒンディー語で55.0%、マラーティー語で33.3%のWER削減を達成した。少数例から得られる改善はモデル容量に制約される。80億パラメータ未満のモデルはOCRの基準結果を安定して改善できず、マラーティー語では最小の30億パラメータのモデルが、改善した文よりも多くの文を悪化させた。マラーティー語の修正はすべての規模でヒンディー語より難しく、形態論的な複雑さがより大きいことを反映している。 これらの知見は、CharBM25が無視できるほど小さな計算コストで密な検索に匹敵するか上回る、GPU不要の有効な検索方法であることを示す。また、120億パラメータ以上の汎用LLMと組み合わせることで、タスク専用の微調整なしに、追加学習を必要としない安定したデーヴァナーガリー文字のOCR後修正を実現できることを示す。データセットは https://huggingface.co/datasets/AbhishekBhandari/Devanagari-OCR-ICL-Benchmark にある。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-18(UTC)
最新改訂
2026-09-18 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

In-context learning using Large Language Models (LLMs) offers a compelling path to training-free post-OCR correction, yet its effectiveness for Devanagari script remains entirely unexplored. We present the first systematic evaluation of LLMs (3B-32B) for post-OCR correction in Hindi and Marathi, comparing three in-context example retrieval strategies: domain-random selection, dense semantic retrieval, and our proposed CharBM25, which retrieves examples by character n-gram BM25 similarity over OCR inputs to target shared error patterns with the test sentence. Across a 20,000-sentence benchmark spanning five news domains, retrieval strategy is the decisive factor in correction quality: CharBM25 outperforms domain-random selection by 2.8-4.0pp absolute WER on Hindi and 2.9-3.8pp on Marathi, using character trigrams, which consistently outperform bigrams and unigrams. Scale dominates performance: Gemma-3-27B achieves WER reductions of 55.0% for Hindi and 33.3% for Marathi under CharBM25-5. Few-shot gains are capacity-gated: models below 8B do not reliably improve over the OCR baseline, and on Marathi the smallest models (3B) degrade more sentences than they improve. Marathi is persistently harder to correct than Hindi across all scales, reflecting its greater morphological complexity. These findings establish CharBM25 as an effective, GPU-free retrieval strategy that matches or exceeds dense retrieval at negligible computational cost, and show that combining it with a general-purpose LLM of 12B+ parameters delivers reliable, training-free Devanagari post-OCR correction without task-specific fine-tuning. Dataset: https://huggingface.co/datasets/AbhishekBhandari/Devanagari-OCR-ICL-Benchmark

arXiv ID: 2609.21595 / 要約の誤りについて