arXiv論文メモ
新着一覧
cs.CL / cs.AI / cs.HC / cs.LG · 査読状況未確認

LLMの意見が割れる文章に専門家の労力を集中

Experts Rise Where LLMs Disagree: Using Cross-Model Disagreement to Target Expert Effort in LLM Codebook Revision for Large-Scale Annotation

Zeyu He, Zhuqian Zhou, Kirk Vanacore, Rene F. Kizilcec, Ting-Hao 'Kenneth' Huang

この論文をやさしく読む

ひとことで言うと

複数のLLMが異なる判断をする文書を専門家に見てもらい、分類手引きの改訂を効率化した。

何に役立つ?

大量の文章に注釈を付ける業務で、専門家が確認すべき事例の選定に役立つ。

この研究の面白いところ

専門家が理由付きラベルを付ける方法は、専門家が改訂案を編集する方法より高い注釈精度になった。

どこまで分かった?

数千件の個別指導記録での結果であり、別分野の文書で同じ精度や所要日数になるかは要旨からは分からない。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

大量の文書に専門家の知見を反映させる文章注釈では、AIの注釈者が従う分類手引き(コードブック)を使うことが多い。しかし、頑健なコードブックの開発には何か月もかかる。大規模言語モデル(LLM)に初期のコードブックを適用させ、複数のLLMで意見が強く分かれる事例を抽出し、専門家の意見を得て修正すれば、この作業を速められる可能性がある。本研究は、LLM向けコードブックの改訂に専門家が助言する三つの方法を調べた。モデル間の不一致に基づくLLM作成の改訂案を専門家が編集する方法(コードブック検証)、不一致についての質問に答える方法、意見が割れた事例に理由を添えてラベルを付ける方法である。 数千件の個別指導セッションの記録を使った実験では、理由付きラベル付けが、専門家ラベルに対するLLMの注釈精度で最も高い64.9%を達成し、専門家が改訂したコードブックの57.8%を上回った。質問応答の最良の設定も60.5%で上回った。この研究は、LLMを使って専門家が見るべき箇所を戦略的に絞り、注釈性能を犠牲にせず、数か月かかるコードブック改訂を数日へ短縮できることを示す。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-22(UTC)
最新改訂
2026-09-22 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Large-scale text annotation brings expert insight to millions of documents, often through a codebook that AI annotators follow. Developing a robust codebook, however, takes months. Large language models (LLMs) could speed this process by applying an early codebook to the data, surfacing cases with strong LLM disagreement, and eliciting expert feedback to address them. We examined three ways experts can provide feedback for LLM codebook revision: (i) editing LLM-generated revisions driven by cross-LLM disagreement (Codebook Verifying), (ii) answering questions about LLM disagreements (Question Answering), and (iii) labeling disagreement cases with rationales (Rationale Labeling). Experiments on thousands of tutoring-session transcripts show that Rationale Labeling yielded the highest LLM-labeling accuracy (64.9%) against expert labels, outperforming the expert-revised codebook (57.8%). The best Question Answering setting also outperformed it (60.5%). Our work shows that LLMs can be used to strategically target expert attention, shortening months of codebook revision to days without sacrificing labeling performance.

arXiv ID: 2609.26926 / 要約の誤りについて