arXiv論文メモ
新着一覧
cs.CV · 査読状況未確認

文字体系別の専門家を使って多言語の画像内文字を読む

All-in-One Multilingual Scene Text Recognition with Script-aware Mixture-of-Experts

Xingsong Ye, Yongkun Du, Jiaxin Zhang, Zhixian Li, Chong Sun, Chen Li, Jing Lyu, Lianwen Jin, and Zhineng Chen

この論文をやさしく読む

ひとことで言うと

写真などに写った多言語の文字を、一つの認識システムで読む研究です。文字体系に応じて二つの専門家を選び、共通の専門家も使います。

何に役立つ?

考えられる用途は、多言語の看板や文書画像を扱うOCRです。既存OCRの認識部分だけの交換でも、評価課題のF1が改善しました。

この研究の面白いところ

言語ごとにモデルを増やす代わりに、文字体系単位の専門家と共通知識を組み合わせています。合成学習データと評価用ベンチマークも整備しています。

どこまで分かった?

229言語の合成データ収録が、全言語の実画像で同じ精度を保証するわけではありません。1.31%という精度差は要旨の表記を保持しており、相対改善率かポイント差かは明示されていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

多言語のシーンテキスト認識(STR)は、多くの言語で学習データが乏しく、単一のモデルで多様な文字体系を扱うことも難しいため、依然として課題が多い。既存手法は、言語ごとに認識器を配置してコストと誤りの蓄積を増やすか、計算費用が高いうえ多くの文字体系でまだ不正確な巨大な視覚言語モデル(VLM)に頼っている。本研究では、言語別の専門家より単純で、VLMより軽く、どちらよりも正確な、一体型の多言語認識器を目指す。 まず、10文字体系と229言語にまたがる大規模な合成シーンテキストデータセットTextMuSS-10Mを構築する。実データが利用できない場合にも、均衡した十分な教師データを提供する。次に、文字体系を考慮したMixture-of-Experts(MoE)構造ScriptMoEを提案する。単一の視覚エンコーダを共有し、密なデコーダを疎なMoEブロックに置き換える。このブロックでは、画像単位のルータが各画像を文字体系に対応する上位2専門家へ振り分け、共有専門家が文字体系をまたぐ知識を取り込む。 構築したTextMuSS-Bench(10文字体系、10,899画像)での広範な実験により、ScriptMoEは最高の認識精度82.06%を達成し、最も強いSTRベースラインを1.31%上回った。CC-OCRのエンドツーエンド多言語課題では、PP-OCRv5の認識器だけをScriptMoEに置き換えると、F1スコアが65.71%から80.89%へ上昇した。これは、はるかに少ないパラメータ数で、最良のVLMの80.73%をわずかに上回る。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-21(UTC)
最新改訂
2026-09-21 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Multilingual scene text recognition (STR) remains challenging due to the scarcity of training data for most languages and the difficulty of serving diverse scripts within a single model. Existing solutions either deploy one recognizer per language, inflating cost and introducing error accumulation, or rely on massive vision-language models (VLMs) that are expensive and still inaccurate on many scripts. In this work, we pursue an all-in-one multilingual recognizer that is simpler than per-language experts, lighter than VLMs, and more accurate than both. First, we construct TextMuSS-10M, a large-scale synthetic scene text dataset spanning 10 scripts and 229 languages. It provides balanced and sufficient supervision where real data is unavailable. Second, we propose ScriptMoE, a script-aware Mixture-of-Experts (MoE) architecture. It shares a single visual encoder and replaces the dense decoder with a sparse MoE block, which consists of an image-level router dispatches each image to the top-2 script-aligned experts and a shared expert absorbs cross-script knowledge. Extensive experiments on our assembled TextMuSS-Bench (10 scripts, 10,899 images) show that ScriptMoE achieves the highest accuracy of 82.06%, outperforming the strongest STR baseline by 1.31%. On the CC-OCR end-to-end multilingual task, replacing only the recognizer in PP-OCRv5 with ScriptMoE lifts F1 score from 65.71% to 80.89%, slightly surpassing the best VLM (80.73%) at a fraction of the parameter count.

著者のコメント

Code: https://github.com/YesianRohn/ScriptMoE & https://github.com/Topdu/OpenOCR

arXiv ID: 2609.24058 / 要約の誤りについて