未学習のベンガル語方言で固有表現を認識するモデル比較
Cross-Dialect NER for Bangla Regional Dialects Using Leave-One-Dialect-Out Cross-Validation and Explainable AI
この論文をやさしく読む
ひとことで言うと
ベンガル語の4つの方言で学習し、学習に含めなかった別の方言でも人名などを認識できるかを比較した研究です。
何に役立つ?
方言ごとの学習データが少ない場合に、どのモデルが他方言へ転用しやすいかを評価する材料になります。
この研究の面白いところ
未学習方言での精度比較に加え、判断の根拠も調べています。高いスコアの一方で、文脈より対象語そのものの形に依存する傾向を報告しています。
どこまで分かった?
対象はデータセットに含まれる5方言です。最良モデルでも対象方言によってF1が82.38%から97.26%まで異なり、すべての方言で同じ精度という結果ではありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
世界で7番目に話者が多いベンガル語には、大きな地域方言の多様性がある。バリサル、チッタゴン、シレット、ノアカリ、マイメンシンなどの方言は、語彙、形態、統語の特徴が異なる。これらの違いは固有表現認識(NER)に大きな課題をもたらし、標準ベンガル語や単一の地域方言で学習したモデルの汎化を制限する。 本論文は、主要5方言にわたる注釈付き17,405文、101,817トークンからなる公開データセットANCHOLIK-NERを用いて、方言をまたぐベンガル語NERの枠組みを提示する。4方言で学習し、残る未学習の1方言で評価する、1方言除外交差検証(LODOCV)を採用する。BanglaBERT、MuRIL、XLM-RoBERTa、Multilingual-E5を含む8つの事前学習済みTransformerモデルを、同一の実験条件で評価した。Multilingual-E5 Largeはすべての分割で最高のF1スコアを達成し、マイメンシンで最高97.26%、最も難しい対象方言であるチッタゴンで最低82.38%となった。 解釈性を高めるため、単語単位の予測に、モデルに依存しない局所的説明法LIMEを適用した。その結果、モデルの判断は周囲の文脈よりも、主として対象となる固有表現の単語自体の表層形に左右されることが分かった。これらの知見は、方言横断のベンガル語NERのベンチマークを確立し、資源の少ない地域方言に対するTransformerに基づく転移学習の有効性を示すとともに、現行モデルの表層形への依存を今後の課題として明らかにする。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-18(UTC)
- 最新改訂
- 2026-09-18 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-18 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Bangla, the seventh most spoken language in the world, exhibits significant regional dialectal diversity, with dialects such as Barishal, Chattogram, Sylhet, Noakhali, and Mymensingh differing in lexical, morphological, and syntactic characteristics. These variations pose substantial challenges for Named Entity Recognition (NER), limiting the generalization of models trained on Standard Bangla or a single regional dialect. This paper presents a cross-dialect Bangla NER framework using the publicly available ANCHOLIK-NER dataset, comprising 17,405 annotated sentences and 101,817 tokens across five major Bangla regional dialects. A Leave-One-Dialect-Out Cross-Validation (LODOCV) strategy is adopted, training models on four dialects and evaluating on the remaining unseen dialect. Eight pretrained transformer-based models, including BanglaBERT, MuRIL, XLM-RoBERTa, and Multilingual-E5, are evaluated under identical experimental settings. Multilingual-E5 Large achieves the highest F1-score in every fold, peaking at 97.26% on Mymensingh and reaching its lowest, 82.38%, on Chattogram, the most challenging target dialect. To improve interpretability, Local Interpretable Model-agnostic Explanations (LIME) are applied to word-level predictions, revealing that the model's decisions are driven primarily by the surface form of the target entity word itself rather than by surrounding sentence context. These findings establish a benchmark for cross-dialect Bangla NER and demonstrate the effectiveness of transformer-based transfer learning for low-resource regional dialects, while highlighting the surface-form dependence of current models as a direction for future work.
著者のコメント
Accepted for Publication in IEEE 3rd INTERNATIONAL CONFERENCE ON COMPUTING, APPLICATIONS AND SYSTEMS (COMPAS 2026)
arXiv ID: 2609.22536 / 要約の誤りについて