arXiv論文メモ
新着一覧
cs.HC · 査読状況未確認

査読でのLLM利用方針を無作為実験で比較

Use and Effects of LLMs in Peer Review: A Randomized Experiment and Survey at ICML 2026

Sunnie S. Y. Kim and Wesley Hanwen Deng and Jennifer Wortman Vaughan and Buxin Su and Weijie Su and Alekh Agarwal and Sharon Li and Martin Jaggi and Daniel G. Goldstein and Nihar B. Shah and Miroslav Dudík

この論文をやさしく読む

ひとことで言うと

査読でLLMを禁止する方針と限定的に許す方針を比較した研究です。割り当てられた方針による採否などの差はほぼありませんでしたが、方針違反の自己申告が相当数ありました。

何に役立つ?

査読ルールを設計するとき、規則の内容と実際の利用行動を分けて検討する材料になります。ルールを掲げるだけでは利用状況を説明できないことを示します。

この研究の面白いところ

無作為化による方針の比較と、匿名調査による実態の把握を組み合わせています。査読文の長さには差があり、採否や点数にはほぼ差がなかったという結果です。

どこまで分かった?

会議全体の人数が無作為化された人数ではなく、実験は一部が対象です。違反があるため、方針の割り当ての効果を、LLMを実際に使うこと自体の効果とは同一視できません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

LLMは査読のあり方を急速に変えつつあり、査読者が実際にどのように使っているか、異なる利用方針が査読結果にどう影響するかを理解することが重要になっています。本研究では、2万4000本超の論文と1万7000人の査読者が関わる主要な機械学習会議ICML 2026で、無作為化実験と事後の匿名調査によってこれらの問いを調べます。 査読者は、すべてのLLM利用を禁止する保守的な方針か、限定的な支援を認める許容的な方針に割り当てられました。無作為化はメイントラックの論文と査読者の一部で行いました。方針の割り当てが論文の最終採否、点数、査読者の確信度に与える影響はほぼゼロでしたが、許容的な方針での査読文は5.5~7%長くなりました。 事後調査の回答(N=1486)は、LLMに対する多様な態度と、相当程度の方針違反を明らかにしました。禁止方針の査読者の22.5%が、禁止にもかかわらずLLMを使ったと報告し、許容方針の査読者の36.5%が、明示的に禁じられた利用を少なくとも一つ行ったと報告しました。今後の査読方針とツール設計への示唆を論じます。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-16(UTC)
最新改訂
2026-09-16 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

LLMs are rapidly reshaping peer review, making it important to understand how reviewers use them in practice and how different LLM-use policies affect review outcomes. We investigate these questions through a randomized experiment and an anonymous post-survey at ICML 2026, a major machine learning conference involving over 24,000 papers and 17,000 reviewers. Reviewers were assigned to either a conservative policy prohibiting all LLM use or a permissive policy allowing limited assistance, with randomization among a subset of main-track papers and reviewers. Policy assignment had near-zero effects on final paper decisions, paper scores, and reviewer confidence, although reviews under the permissive policy were 5.5-7% longer. Post-survey responses (N=1,486) revealed diverse attitudes toward LLMs and substantial noncompliance: 22.5% of conservative-policy reviewers reported using an LLM despite the prohibition, and 36.5% of permissive-policy reviewers reported at least one explicitly disallowed use. We discuss implications for future peer-review policy and tool design.

arXiv ID: 2609.19420 / 要約の誤りについて