アラビア語の事実確認用データセットArafa
ARAFA: An LLM-Generated Arabic Fact-Checking Dataset
この論文をやさしく読む
ひとことで言うと
アラビア語の文章について、主張と証拠を照らし合わせて事実確認するための約18万組のデータを、自動生成と検証によって整備した研究。
何に役立つ?
アラビア語の事実確認モデルを訓練・評価するためのデータとして役立つ。資源の少ない他言語へ構築手順を応用することも考えられるが、他言語での成果はこの要旨では示されていない。
この研究の面白いところ
主張を生成するだけでなく、反証できる主張への変形と、支持・反証・情報不足の自動判定を組み合わせている。人手評価の一致度と、自動検証の正解率を別々に報告している。
どこまで分かった?
報告された自動検証の正解率は、人手評価した標本に基づく支持・反証の各判定についての値である。モデルのマクロF1スコア77%はこのテストデータ上の結果であり、実世界の情報環境での性能は要旨からは分からない。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
自動的な事実確認は、データセットと資源が乏しいため、アラビア語の自然言語処理で大きな課題となっている。本稿では、大規模言語モデル(LLM)を利用した自動化の枠組みで構築した、現代標準アラビア語の事実確認用大規模データセットArafaを紹介する。構築工程は3段階からなる。(1)アラビア語版Wikipediaのページから、裏付けとなる文章の証拠を伴う主張を生成する。(2)主張を変形し、反証となる証拠を伴う、判定の難しい事実に反する主張を生成する。(3)生成した主張が添付された証拠によって支持されるか、反証されるか、あるいは証拠だけでは真偽を判断する情報が足りないかを自動検証する。得られたデータセットは181,976組の主張と証拠で構成され、支持、反証、情報不足のラベルが付いている。データセットから抽出したテスト標本の人手評価では、支持された主張についてCohenのカッパ係数が0.89、反証された主張について0.94となり、評価者間で高い一致が見られた。人手評価した標本を基準にすると、自動検証の正解率は支持された主張で86%、反証された主張で88%だった。Arafaがアラビア語の自動事実確認の資源として有用であることを示すため、オープンソースのTransformer系モデル4種類をArafaでファインチューニングした。最高性能のモデルはテストデータでマクロF1スコア77%を達成した。Arafaはアラビア語の事実確認に向けた初の大規模データセットであり、提案した枠組みは、資源の少ない他の言語について同様の資源を開発するための拡張可能な方法でもある。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-22(UTC)
- 最新改訂
- 2026-09-22 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-22 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Automatic fact-checking poses a significant challenge in Arabic natural language processing due to the scarcity of datasets and resources. In this manuscript, we introduce Arafa, a new large-scale dataset for fact-checking in Modern Standard Arabic, constructed through an automated framework leveraging large language models (LLMs). The dataset was constructed through a three-step pipeline: (1) claim generation from Arabic Wikipedia pages with supporting textual evidence, (2) claim mutation to generate challenging counterfactual claims with refuting evidence, and (3) an automatic validation step to validate that the generated claims are either supported or refuted by their accompanying evidence, or if the evidence does not provide enough information to judge the validity of the claims. The resulting dataset comprises 181,976 claim-evidence pairs labeled as supported, refuted, or not enough information. Human evaluation carried out on a test sample from the dataset demonstrated strong inter-annotator agreement (kappa = 0.89) using Cohen's Kappa for supported claims and (kappa = 0.94) for refuted claims. Automatic validation based on a human-evaluated sample achieved 86% accuracy for supported claims and 88% for refuted ones. To showcase Arafa's value as a resource for automatic Arabic fact-checking, four open-source transformer-based models were fine-tuned using Arafa, with the top-performing model achieving a Macro F1-score of 77% on the test data. In addition to Arafa being the first large-scale dataset for Arabic fact-checking, our framework presents a scalable approach for developing similar resources for other low-resource languages.
arXiv ID: 2609.25833 / 要約の誤りについて