予測を見送れる分類器の比較に必要なラベル数を調べる
How Many Labels Does Model Choice Need? Certificates and Budgets for Selective Prediction
この論文をやさしく読む
ひとことで言うと
答えが同じ分類器でも、自信の低い予測を見送る使い方では優劣が変わります。その優劣を確実に決めるために、正解ラベルがどれだけ必要かを調べています。
何に役立つ?
選択的予測のモデルや信頼度スコアを比較するとき、ラベル付け予算が足りるか、いつ調査を止められるかを考える材料になります。
この研究の面白いところ
後から見て勝者を証明する最小ラベル数と、未知のラベルを順に調べて勝者を発見するための数が大きく異なることを、理論とデータの両方で扱っています。
どこまで分かった?
ほぼ全ラベルが必要という漸近結果には、独立な順位とBernoulli誤りなどの仮定があります。実験の割合は記載されたデータセットや分類器の条件での結果で、すべてのモデル比較に同じ割合が必要という意味ではありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
分類器同士がまったく同じ予測をしていても、選択的予測の性能を比較するには正解ラベルが必要になることがある。信頼度の順位によって、同じ誤りにも異なる重みが付くためである。本研究では、一般化リスク・カバレッジ曲線下面積(AUGRC)について、この必要量を定量化する。ラベル取得前の下界によって、不十分な予算を除外できる。全ラベルが既知である場合、被覆線形計画によって、勝者を確定するのに十分なラベルの最小数、すなわち証明書サイズを、候補数Kに対してK − 1ラベル以内の差で評価できる。 Kを固定し、順位が独立な一様順列で予測が同一の場合、取得前の下界はラベル候補集合の4分の1に近づく。順位と独立な独立同分布のBernoulli誤りの下では、厳密な選択を行う任意のラベル取得方策は漸近的にほぼ全ラベルを読む。その一方、候補が2つのときの証明書には半分のラベルだけで足りる。 9つのデータセットにおける108通りの特徴量構成の比較では、予測が食い違う例のラベルによって正解率による選択はすべて確定するが、AUGRCによる選択は1つも確定しない。96条件では20%の予算では足りないことが示され、証明書は平均で56~57%のラベルを必要とする。事前学習済み画像分類器を使った10条件では、信頼度スコアの選択に、厳密な選択で1万ラベルの68~91%、AUGRCの許容差を5 × 10⁻⁴とした場合で50~67%を読む。厳密な停止判定は、どのような取得順序でも機能する。これらの結果は、信頼度順位をラベル予算と保証付きのモデル比較に結び付ける。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-16(UTC)
- 最新改訂
- 2026-09-16 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-16 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Classifiers can make identical predictions yet require labels to compare their selective performance: confidence ranks weight the same errors differently. We quantify this requirement for the area under the generalized risk-coverage curve (AUGRC). A prelabel lower bound rules out insufficient budgets. With all labels known, a covering linear program bounds the minimum number of labels sufficient to fix the winner (the certificate size) within $K-1$ labels for $K$ candidates. For fixed $K$, independent uniform orders and identical predictions, the prelabel bound approaches one quarter of the pool. With iid Bernoulli errors independent of the orders, every exact acquisition policy reads almost all labels asymptotically, although a two-candidate certificate needs only half. Across 108 feature-panel comparisons on nine datasets, disagreement labels settle every accuracy choice but no AUGRC choice. A 20% budget is ruled out in 96 conditions; certificates need 56-57% on average. On ten conditions with pretrained image classifiers, confidence-score choice reads 68-91% of 10,000 labels for exact selection and 50-67% with AUGRC tolerance $5\times10^{-4}$. An exact stopping test works with any acquisition order. Together, these results link confidence ranks to label budgets and certified model comparison.
著者のコメント
22 pages, 13 figures, 3 tables. Includes proofs and experimental details in the main text
arXiv ID: 2609.18622 / 要約の誤りについて