arXiv論文メモ
新着一覧
stat.ML / cs.LG · 査読状況未確認

各クラス1例だけでも偶然を上回る分類は可能か

Extreme classification: beating chance with one training example from each class

Kevin Bleakley (LMO, CELESTE), Aaditya Ramdas

この論文をやさしく読む

ひとことで言うと

2種類の見本を一つずつしか見なくても、種類が同じ確率で出るなら、平均的に当てずっぽうを上回れるかを数学的に調べています。

何に役立つ?

ごく少数の訓練例から分類する際に、何が原理的に可能で、どの前提を外すと不可能になるかを理解するための基礎になります。

この研究の面白いところ

身近な最近傍法には失敗例がある一方、別の規則では広い分布の範囲に保証を与えます。正解率の上積みを分布間の差MMDの二乗で表している点も明確です。

どこまで分かった?

偶然を厳密に上回るという保証は、大きな精度改善を意味しません。クラスの等確率性が重要で、未知の不均衡な事前確率や適応的なクラス選択では不可能性も示されます。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

本研究では、最小限の分類問題を検討する。未知の2つの分布P、Qから、互いに独立なラベル付き観測X~PとZ~Qを一つずつ与え、さらにPまたはQから等確率で独立に抽出した対象Yを与えたとき、P≠Qであれば常に、偶然より厳密に良い精度でYを分類できるだろうか。1最近傍規則は、平均が異なり、共通の正定値共分散行列を持つ多変量ガウス分布のすべての対で成功する。しかし、実数直線上の滑らかな密度に対してさえ、偶然より厳密に悪くなる場合がある。 本研究では、期待正解率が厳密に1/2+MMD_k²(P,Q)/4となる固定されたランダム化カーネル規則を構成する。また、可測な二択の問いの可算族から、可算生成された可測空間上の特性的カーネルを得る。さらに、実数直線上の決定論的な順序規則が、異なるボレル確率測度のすべての対で偶然を上回ることを証明する。続いて、可測な符号化により、すべての可算生成可測空間、特にすべての可分距離空間で偶然を上回る、決定論的で分布に依存しない規則を与える。 最後に、未知で不均衡なクラス事前確率を任意に許すと、異なる分布のすべての対で機能する規則は存在しないことを示す。また、対象のクラスが適応的に選ばれる場合、公平なコイン投げ以外のすべての規則は、有限の台を持つある分布の対に対して、偶然より厳密に悪くなる。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-17(UTC)
最新改訂
2026-09-17 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

We study a minimal classification problem: Given independent labeled observations $X\sim P$ and $Z\sim Q$ from two unknown distributions $P,Q$, and given an independent target $Y$ drawn with equal probability from $P$ or $Q$, can one classify $Y$ strictly better than chance whenever $P\neq Q$? The one-nearest-neighbor rule succeeds for every pair of multivariate Gaussian distributions with distinct means and a common positive-definite covariance matrix but can perform strictly worse than chance even for smooth densities on the real line. We construct a fixed randomized kernel rule whose expected accuracy is exactly $1/2+\operatorname{MMD}_k^2(P,Q)/4$, and obtain characteristic kernels on countably generated measurable spaces from countable families of measurable binary questions. We also prove that a deterministic order rule on $\mathbb R$ beats chance for every pair of distinct Borel probability measures. A measurable encoding then gives a deterministic distribution-free rule which beats chance on every countably generated measurable space, in particular every separable metric space. Finally, we show that no rule works for every distinct pair of distributions and every unknown unbalanced class prior; under adaptive target-class selection, every rule other than a fair coin is strictly worse than chance for some finitely supported pair.

arXiv ID: 2609.20897 / 要約の誤りについて