言語モデル評価の文化的偏りを二つのベンチマークで監査
Whose Facts Count? A Culturally Responsive Audit of LLM Evaluation Benchmarks
この論文をやさしく読む
ひとことで言うと
言語モデルの評価問題が、どの言語や地域の知識を事実として扱っているかを、文化的な観点から点検した研究です。
何に役立つ?
評価データを選ぶ際に、英語資料への依存や特定の話題への集中を確認するための枠組みになります。モデルの正答率だけでは分からない評価設計の偏りを扱います。
この研究の面白いところ
項目数として地域を扱っていても、1人の作問者の狭い関心がその割合を押し上げている可能性を指摘しています。
どこまで分かった?
監査対象はSimpleQAの4,326項目とArenaの600会話で、対抗ベンチマークは50項目です。提示された比率は対象標本についての結果であり、教育や公共サービスへの影響の大きさを実測した数値は要旨にありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
大規模言語モデル(LLM)のベンチマークは評価手段として機能し、世界の教育、労働、公共サービスに影響する意思決定に情報を与えている。本論文ではHood、Kirkhart、Hopsonによる文化に応答する評価(CRE)の枠組みに基づき、6次元の文化応答性(CR)評価基準を使ってOpenAIのSimpleQA(4,326項目)とLMSYS Chatbot Arena(600会話)を監査する。 SimpleQAの全質問は、証拠の基盤として英語の記録資料による検証を必要とする。ある1人の評価者のコロンビアの創設年への偏った関心が全項目の2.70%を占め、グローバルサウスを扱う範囲を見かけ上広くしている。Arenaの会話では英語のプロンプトが76.3%を占めるのに対し、国際電気通信連合(ITU)が推定する世界のインターネット利用者における英語話者の割合は25.9%である。50項目の対抗ベンチマークでは、CRの不足を表す平均得点がSimpleQAの約3分の1となった(Cohenのd=1.01)。本論文は実用的なCR評価枠組みを提案する。これらは偶発的な測定上の問題ではなく構造的な妥当性の欠陥であり、こうした評価手段が捉えるように作られていない知識伝統を持つ共同体に、直接的な影響を及ぼすものである。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-21(UTC)
- 最新改訂
- 2026-09-21 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-21 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
LLM benchmarks function as evaluation instruments, informing decisions that affect education, labor, and public services worldwide. Drawing on Hood, Kirkhart, and Hopson's culturally responsive evaluation (CRE) frameworks, this paper applies a six-dimension CR rubric to audit OpenAI's SimpleQA (N = 4,326 items) and the LMSYS Chatbot Arena (N = 600 conversations). Every SimpleQA question requires English-language archival verification as its evidentiary basis. A single rater's preoccupation with Colombian founding dates accounts for 2.70% of items, inflating the appearance of Global South coverage. English-language prompts constitute 76.3% of Arena conversations, against an International Telecommunication Union (ITU)-estimated 25.9% share of global internet users. A 50-item counter-benchmark scored a mean CR deficit nearly three times lower than SimpleQA (Cohen's d = 1.01). The paper proposes a practical CR evaluation framework. These are structural validity failures, not incidental measurement problems, with direct consequences for communities whose knowledge traditions these instruments were not built to see.
著者のコメント
36 pages, 8 figures
arXiv ID: 2609.24934 / 要約の誤りについて