数学的構成の改善を上限なしの得点で測るベンチマーク
The Endless Exam: Mathematical Constructions from Today's Models toward Superintelligence
この論文をやさしく読む
ひとことで言うと
数学の問題を正解・不正解だけで採点せず、作った対象が既知の方法に比べてどれほど良いかを数値化する評価です。問題を大きくしながら、将来のモデルも測れるようにしています。
何に役立つ?
数学的な構成問題に取り組むモデルの比較や、問題が大きくなると品質がどう変わるかの追跡に役立ちます。自動検証器と応答の公開は、結果を検証し直すための材料になります。
この研究の面白いところ
得点を1で打ち切らないため、既存の到達水準を超えた改善も評価できます。大きな構成を短い証明書で検査できるようにすることで、問題の拡大と検証可能性の両立を目指します。
どこまで分かった?
今回の評価は8モデル・69問題例で、既知の到達水準を超えたモデルはありません。超知能を実現または確認したという報告ではなく、長期的な数学能力の測定方法の提案です。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
現在のモデルから人工超知能へ向かう数学的な進歩を、パラメータ化した14種類の構成問題群で測定するベンチマーク、Endless Examを提案する。提出された各対象は妥当性を自動で検査され、公開済みの到達水準または構成法の基準に対する相対的な品質スコアを与えられる。改善の得点は1を上限としない。 各問題群は数学の未解決問題を長期目標として利用し、より大きいパラメータで新しい問題例を生成する。簡潔な証明書によって、大規模な構成でも検証可能な状態を保つ。69種類の問題例で8モデルを評価したところ、公開済みの到達水準を上回ったシステムはなかったものの、連続的な品質スコアにより性能の違いを区別できた。規模と品質の関係を表す曲線は、問題規模の増大に伴う構成品質の変化を示す。人間の到達水準に至る前から、それを超えた後まで継続して測定できるよう、生成器、検証器、参照資料、モデルの応答、分析を公開する。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-21(UTC)
- 最新改訂
- 2026-09-21 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-21 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
We introduce the Endless Exam, a benchmark for measuring mathematical progress from today's models toward artificial superintelligence through fourteen parameterised construction families. Each submitted object is checked automatically for validity and assigned a relative quality score against a published frontier or construction baseline, without capping improvements at $1$. The families draw on open mathematical problems for long-term targets and generate new instances at larger parameters, where compact certificates keep large constructions verifiable. Across eight models evaluated on 69 distinct instances, continuous quality scores distinguish performance even though no evaluated system surpasses a published frontier. Size-quality curves show how construction quality changes as problem size increases. We release the generators, verifiers, references, model responses and analysis to support continued measurement before and beyond human frontiers.
著者のコメント
51 pages, 13 figures, 25 tables
arXiv ID: 2609.24555 / 要約の誤りについて