arXiv論文メモ
新着一覧
cs.CV · 査読状況未確認

軽量な文字認識モデルを歴史資料へ適応させる

A Free Lunch? Adapting PP-OCRv6 for Historical Text Recognition

Benjamin Kiessling (ALMAnaCH)

この論文をやさしく読む

ひとことで言うと

歴史資料の文字を読む小型OCRが、大型の画像言語モデルにどこまで対抗できるかを、学習条件を変えて調べています。

何に役立つ?

ラテン文字やアラビア文字の歴史資料を、計算負荷を抑えて文字起こしする際のモデル選択に役立ちます。多様な資料による事前学習の効果を検討しています。

この研究の面白いところ

小型モデルをゼロから学習する場合と、異質な資料で事前学習して調整する場合を分けています。モデルの大きさだけでなく、学習資料の組み合わせが汎化性能を左右する点が中心です。

どこまで分かった?

PP-OCRv6はゼロからの学習では従来型を一貫して上回りません。大型モデルを上回るという結果も、微調整済みモデルと対象の歴史ラテン文字認識での比較であり、すべての資料への優位を示すものではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

大規模な視覚言語モデルは優れたスコアが報告されているものの、計算コスト、大規模な事前学習への依存、ハルシネーションのため、歴史資料の自動文字認識(ATR)での実用的な普及は限定的である。そのため、歴史資料のATRは、視覚情報に基づいて処理し、比較的少量のデータでも学習できる小型のCRNN行認識器に、現在も大きく依存している。再帰処理を用いない軽量な認識器には、大きなモデルの精度とCRNNの実用上の利点を両立する可能性があるが、歴史的な文字資料での包括的な評価は行われていない。 本研究では、強い言語モデル化を伴わない近年の小型文字認識器PP-OCRv6を歴史資料の行認識に適応させる。多言語のラテン文字系・アラビア文字系資料を対象に、汎用的な事前学習、領域特化型の学習、コーパス単位の微調整、個別写本に対する少数例での適応という条件で、従来型のCRNNと比較する。 PP-OCRv6を最初から学習した場合、ベースラインを一貫して上回るわけではないが、多様なデータによる事前学習を行うと汎化性能が大幅に改善する。さらに、Qwen3.5に基づくMedusa認識器との比較から、微調整したPP-OCRv6が、ラテン文字系の歴史的手書き文字認識(HTR)に特化した大規模視覚言語モデルを上回り得ることを示す。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-17(UTC)
最新改訂
2026-09-17 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Despite impressive reported scores, large vision-language models have seen limited practical uptake in historical automatic text recognition because of their computational cost, dependence on large-scale pretraining, and hallucination. Historical ATR therefore continues to rely largely on compact CRNN line recognizers, which are visually grounded and trainable on modest data. Lightweight recurrence-free recognizers promise the accuracy of larger models with the practical advantages of CRNNs, yet have not been comprehensively evaluated on historical writing. We adapt PP-OCRv6, a recent compact text recognizer without strong language modeling, for historical line recognition and compare it with a conventional CRNN across generalized pretraining, domain-specific training, corpus-level fine-tuning, and manuscript-specific few-shot adaptation on multilingual Latin- and Arabic-script material. While PP-OCRv6 does not consistently outperform the baseline when trained from scratch, heterogeneous pretraining produces markedly better generalization. Comparisons with the Qwen3.5-based Medusa recognizer further show that fine-tuned PP-OCRv6 can outperform a large VLM tailored towards historical Latin-script HTR.

arXiv ID: 2609.20064 / 要約の誤りについて