arXiv論文メモ
新着一覧
cs.LG · 査読状況未確認

AIの採点を幅のある報酬として扱い追加学習する

Range-GRPO: Policy Optimization via Pairwise Relations among Reward Intervals

Ryunyi Lee, Kangjun Noh, Somin Kim, Heedong Kim, Kyungwoo Song

この論文をやさしく読む

ひとことで言うと

別のAIによる採点を1つの点数ではなく幅で表し、その曖昧さも使って言語モデルを追加学習する方式です。

何に役立つ?

正解データや自動検証器を十分に用意できないタスクで、少数のラベルと疑似評価を使う学習に役立つ可能性があります。

この研究の面白いところ

評価の不確かさが更新の強さだけでなく向きも変えます。範囲を点へ縮めた場合に既存のDr.GRPOへつながることも理論的に整理しています。

どこまで分かった?

最良という結果は評価対象の半教師あり手法との比較です。データセット別の数値、校正条件、必要資源の具体量は要旨には示されていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

大規模言語モデル(LLM)の利用が広がるにつれ、下流タスクへ適応させる事後学習がますます重要になっている。しかし、信頼できる教師信号を得る費用は依然として高く、特に参照解答や実行可能な検証器のない領域で問題となる。LLMを評価者にする方式は、ラベルのない回答へ拡張性の高い疑似報酬を与えるが、単一の点数では報酬の不確かさを明示的に表せない。そこで、疑似報酬をコンフォーマル校正された報酬範囲で表すことを考える。 限られたラベル付きデータとラベルなしのプロンプトを組み合わせる、半教師あり事後学習の枠組みRange-GRPOを提案する。グループ相対方策最適化(GRPO)では、学習信号は各ロールアウト群内での相対的な報酬比較に依存する。提案する目的関数は、報酬範囲を点報酬に縮約せず、範囲どうしを対ごとに比較する。これによって、区間の不確かさが信号の大きさと方向の両方に影響できる。理論解析でこの違いを特徴付け、すべての報酬範囲が点に縮まると、提案目的がDr.GRPOのアドバンテージを再現することを示す。実験では、Range-GRPOは、評価した半教師あり手法の中で、分布内・分布外の平均性能が最も高く、必要な学習資源も少なかった。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-10-01(UTC)
最新改訂
2026-10-01 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

As the use of large language models (LLMs) expands, post-training has become increasingly important for adapting them to downstream tasks. However, obtaining reliable supervision remains costly, especially in domains without reference answers or executable verifiers. LLM-as-a-Judge provides scalable pseudo-rewards for unlabeled responses, but a single point score does not explicitly represent reward uncertainty. This motivates representing pseudo-rewards as conformally calibrated reward ranges. We propose Range-GRPO, a semi-supervised post-training framework that combines limited labeled data with unlabeled prompts. In Group Relative Policy Optimization (GRPO), learning signals depend on relative reward comparisons within each rollout group. The proposed objective compares reward ranges pairwise rather than reducing them to point rewards, allowing interval uncertainty to affect both the magnitude and direction of these signals. Our theoretical analysis characterizes this distinction and shows that the proposed objective recovers the Dr.GRPO advantage when all reward ranges collapse to points. Empirically, Range-GRPO achieves the highest in-distribution and out-of-distribution average performance among the evaluated semi-supervised methods while requiring fewer training resources.

arXiv ID: 2610.01548 / 要約の誤りについて