arXiv論文メモ
新着一覧
cs.AI · 査読状況未確認

低費用のAI判定と強力な評価器を確信度で使い分ける

JEV-as-a-Judge: Accept When Confident, Escalate When Unsure

Yubo Li, Yidi Miao, Ramayya Krishnan, Rema Padman

この論文をやさしく読む

ひとことで言うと

安価な評価器が自信を持つ判定はそのまま使い、迷う判定だけ強力なLLMへ回す方法を評価しています。

何に役立つ?

大量の回答を評価する際、費用と精度の折り合いをつける設計に役立ちます。難しい導出や説得的な誤答は、より強い評価器が必要な例です。

この研究の面白いところ

平均性能だけでなく、弱い評価器がどこで不確かになるかを利用します。設定を固定した段階的処理で、強い比較相手に近い精度を保ったとしています。

どこまで分かった?

99%は比較相手の正解率に対する保持率で、絶対正解率99%ではありません。0.36%の料金は一次評価器の比較値で、段階的処理全体の料金と同一ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

LLMを判定者として使う方法は、多様な課題の評価を可能にするが、大規模に使うと推論費用と確信度の信頼性が重要になる。本研究では、判定だけを出す評価器が低費用の一次評価を行い、より強力な評価が必要な場合を識別できるかを調べる。JEV-as-a-judgeを16種類の生成型および報酬モデル型評価器と比較し、条件を伏せた人間による判定も用いる。その結果、通常の選好と証拠に基づく事実性について、最も強力な比較相手である最先端LLM評価器との性能差は3パーセントポイント以内で、料金は比較相手の0.36%だった。 導出過程の確認や、巧みに書かれた誤答に惑わされない判断が必要な場合には、差が大きくなる。複数のベンチマークで、この比較相手に対するJEVの差は、確信度の低い判定に集中している。確信度の高い判定を採用し、不確かなものを上位の評価器へ回す、設定を固定した段階的処理は、費用を抑えつつ比較相手の正解率の99%を維持する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-22(UTC)
最新改訂
2026-09-22 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

LLM-as-a-judge enables evaluation across diverse tasks, but inference cost and confidence reliability become critical at scale. We study whether a decision-only judge can provide an economical first pass and identify when stronger evaluation is needed. Comparing jev-as-a-judge with sixteen generative and reward-model judges, with blinded human adjudication, we find it within three percentage points of a state-of-the-art LLM judge, our strongest comparator, on ordinary preference and evidence-grounded factuality at 0.36% of the comparator's fee. Larger gaps arise when judgments require checking a derivation or resisting an elaborately written wrong answer. On several benchmarks, JEV's gap to this comparator is concentrated in low-confidence decisions. A frozen cascade that accepts confident verdicts and escalates uncertain ones retains 99% of the comparator's accuracy at lower cost.

arXiv ID: 2609.26550 / 要約の誤りについて