arXiv論文メモ
新着一覧
cs.CL / cs.AI · 査読状況未確認

中国語の競技ディベートを言語モデルは審査できるか

Chinese Competitive Debating Dataset and Benchmark

Zongrui Yang, Haoyuan Li, Zhongsheng Wang, Zhirui Zeng, Pengqian Han, Yi Zhou, Yuting Wang, Jiamou Liu

この論文をやさしく読む

ひとことで言うと

中国語のディベートを言語モデルに評価させ、専門審査員とどの程度一致するかを調べるための資料と課題を作っています。勝敗だけでなく、途中の得点や最優秀話者も対象です。

何に役立つ?

言語モデルが、単独の文章だけでなく応答を通じた議論の展開を理解できるか比較するのに役立ちます。自動審査への利用は考えられますが、人間の審査を代替できたという結果ではありません。

この研究の面白いところ

実際に試合を開催し、各試合を3人が独立に審査しています。最終的な投票とその理由に加え、議論の段階ごとの得点も残している点が特徴です。

どこまで分かった?

示された数値は複数モデルのゼロショット評価における各指標の最高値で、同一モデルがすべてを達成したとは要旨にはありません。中国語のこの競技設定での専門家との一致を測るもので、議論の絶対的な正しさを測るものではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

ディベートの審査には、やり取りの中で議論がどのように展開するかを追う必要がある。しかし既存のデータセットで、詳細なディベート記録と、共通の評価基準の下で実際の競技中に集められた専門家の判断とを組み合わせたものは少ない。本研究では、中国語の競技ディベートに対する大規模言語モデルの理解を、試合、段階、話者の各水準で評価するためのデータセットとベンチマークを導入する。 182試合を開催し、120人の専門審査員を募集した。各試合は、事前に定めた評価基準を用いて3人の審査員が独立に審査した。不完全な記録の試合を除外した後、データセットには148試合、2,698段階、20,542の発話交換単位が含まれ、書き起こしと区切りは人手で検証されている。段階別の元の得点、試合の勝者への投票、最優秀ディベーターへの投票、審査理由を保持している。 勝者の傾向予測、段階別得点予測、最優秀ディベーター予測という3つの課題を定義する。複数の大規模言語モデルをゼロショットで評価したところ、勝者予測の最高正解率は66.2%、モデルの段階別得点と人間の平均評価とのピアソン相関係数の最高値は0.250、最優秀ディベーター予測の最高正解率は56.8%だった。このデータセットとベンチマークは、大規模言語モデルによる対話的な論証の理解と、専門審査員との一致を研究するための評価基盤を提供する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-18(UTC)
最新改訂
2026-09-18 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Debate adjudication requires tracking how arguments develop through interaction, yet existing datasets rarely combine fine-grained debate transcripts with professional judgments collected during real competitions under a shared rubric. We introduce a dataset and benchmark for evaluating large language models' understanding of competitive Chinese-language debate at the match, stage, and speaker levels. We organized 182 matches and recruited 120 professional judges, with each match independently adjudicated by three judges using a predefined rubric. After excluding matches with incomplete records, the dataset contains 148 matches, 2,698 stages, and 20,542 exchange units, with manually verified transcripts and segmentation. It preserves original stage scores, match votes, best-debater ballots, and adjudication rationales. We define three tasks: winner-tendency prediction, stage-score prediction, and best-debater prediction. Zero-shot evaluation of multiple large language models yields a highest winner-prediction accuracy of 66.2%, a highest Pearson correlation of 0.250 between model stage scores and mean human ratings, and a highest best-debater prediction accuracy of 56.8%. The dataset and benchmark provide a testbed for studying large language models' understanding of interactive argumentation and their agreement with professional judges.

著者のコメント

25 pages, 2 figures

arXiv ID: 2609.21637 / 要約の誤りについて