arXiv論文メモ
新着一覧
cs.CL · 掲載先の記載あり

クルアーンのアラビア語理解を多角的に測る評価集

QuranicMMLU: A Cognitively-Aware Benchmark for Evaluating Generative AI Solutions on Quranic Linguistic Knowledge

Rawan El Ghali, Umm Kulsoom, Anas Madkoor, Dima Faris Alsaudi, Roaa Abdelmagid, Roaa Ibrahim, Raghad Mousa, Hamza Aljaji, Abdullah Khanafer, Abdallah Alkanani, Salah Feras Alali, Rawan Khaled Mohamed, and Ehsaneddin Asgari

この論文をやさしく読む

ひとことで言うと

クルアーンのアラビア語について、発音・語形・文法・意味などを分けてAIの理解を調べる980問の評価集です。

何に役立つ?

この領域の言語モデルが何を理解し、どの形式で失敗するかを評価できます。多肢選択の得点だけで自由回答能力を判断しないための比較材料にもなります。

この研究の面白いところ

同じ問題を選択式と自由記述式で出しています。モデルの順位が似ていても、選択肢がある場合には見えない弱点が残ることを、異なる回答形式の評価で示しています。

どこまで分かった?

対象は12システムと人手確認済み980問です。84%は選択式の正解率、60%は自由回答の品質評価であり、同一指標の差としては扱えません。宗教的判断全般の正しさを保証する評価でもありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

本研究では、クルアーンのアラビア語に関して、言語的複雑さの複数の側面から生成AIを評価するベンチマークQuranicMMLUを導入する。既存のクルアーン関連ベンチマークは一般的な質問応答と意味検索を中心としており、個別の言語能力を調べたり、必要な認知的処理や節の難易度で層別化したりしていない。 音韻論、形態論、統語論、意味論、語用論の5本柱からなるクルアーンの分類体系を構築する。末端の31分類は、タジュウィードと語根・語型による形態論から、啓示の機会やスーラ間の一貫性までを扱う。各末端分類について、ブルームの認知水準と節のパープレキシティで層別化した問題を生成し、次に判定役のLLMに全項目を独立に解答・採点させ、その注釈を人手による確認へ回す。得られたデータセットは、人が確認した980問からなり、各問を自由記述式と多肢選択式の両方で提供する。 これらの項目で12システムを評価した結果、イスラム分野に特化したモデルが首位だった。しかし、すべてのシステムで、多肢選択式の正解率の方が自由記述式の回答品質より高く、それぞれ平均84%と平均60%だった。両形式の順位はよく一致し、ケンドールのτは0.73である一方、多肢選択式の採点では、選択肢を取り除いて初めて表面化する失敗が隠れてしまう。したがってQuranicMMLUは、クルアーン領域のアラビア語自然言語処理を評価するための、厳密で言語学に基づいた枠組みを提供する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-18(UTC)
最新改訂
2026-09-18 · v1
査読・掲載
掲載先の記載あり

著者による掲載先の記載:Arabic NLP 2026。出版社での独立確認は未実施です。

arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

We introduce QuranicMMLU, a benchmark for evaluating generative AI on Quranic Arabic across multiple dimensions of linguistic complexity. Existing Quranic benchmarks center on general question answering and semantic retrieval, without probing specific linguistic competencies or stratifying by cognitive demand and verse difficulty. We construct a five-pillar Quranic taxonomy spanning Phonology, Morphology, Syntax, Semantics, and Pragmatics, with 31 leaves covering phenomena from tajwīd and root-and-pattern morphology to occasions of revelation and inter-surah coherence. For each leaf we generate questions stratified by Bloom's cognitive level and verse perplexity, then have LLM as a judge to independently answer and score every item and route the annotations to manual review. The resulting dataset comprises 980 human-reviewed questions, each issued in both open-ended and multiple-choice form. We benchmark 12 systems on these items and find that the Islamic-specialized model leads, yet every system scores higher on multiple-choice accuracy (average 84%) than open-ended answer quality (average 60%): the two rankings agree closely (Kendall's {\tau}=0.73), but multiple-choice scoring hides failures that surface only once answer choices are removed. QuranicMMLU thus offers a rigorous, linguistically grounded framework for evaluating Arabic NLP in the Quranic domain.

arXiv ID: 2609.22038 / 要約の誤りについて