良いテストを報酬で選びコード生成と同時に育てる
Information-Gain Rewards over Diversity-Pruned Tests: GT-Anchored Verifier Co-Training for Reliable Code Generation
この論文をやさしく読む
ひとことで言うと
コードを書くAIとテストを作るAIを同じモデルで育てるとき、何でも合格させるテストや似たテストばかりにならないよう、報酬と選別を工夫する研究です。
何に役立つ?
考えられる用途は、コード生成の学習用テストを改善し、生成候補の選択にも使うことです。5つのベンチマークで、生成と順位付けの両方の改善を報告しています。
この研究の面白いところ
正解情報と合否の関係からテストの識別力を評価し、さらに実行時の振る舞いが重なる候補も除きます。テスト数を増やすだけでなく、一定予算で有用な情報を増やす設計です。
どこまで分かった?
報酬には正解情報に基づく信号を使うため、正解の手掛かりが一切不要な自己学習ではありません。要旨のyの数式表記は一部崩れているため、訳文では0〜1のm成分の信号として読み下しています。示された改善は記載されたモデル規模とベンチマークでのものです。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
一つの言語モデルをコード作成者とテスト作成者の両方として共同学習する自己対戦法は、コード生成の強化学習を固定テスト集の先へ進める可能性がある。しかし、2つの結び付いた問題を抱える。一つは、簡単で識別力のないテストによって合格率の報酬が最大化される、許容性の崩壊である。もう一つは、独立同分布でサンプルしたテストが典型的な入力に集中し、推定量の分散を増やす集中バイアスである。 本研究では、両方の問題に対処する単一方策のGRPO枠組みCoVer(Co-trained Coder and Verifier)を導入する。第1に、情報利得(IG)報酬が、自己生成した各テストを、その合否ベクトルと、正解情報に基づく段階的な正しさの信号yとの相互情報量で採点する。yは0から1の値を持つm成分の信号である。両者の共分散の符号によって報酬を制御し、正しいものを正しく見分ける方向に働くテストだけに報酬を与える。第2に、多様性を考慮する3段階の選択で、候補群を動作上の冗長性がないテスト集へ絞る。無効性、入力文字列、実行プロファイルに基づくフィルタリングを行い、実行予算を一定にしたままIG推定量の有効サンプル数を増やす。 LiveBench、MBPP、LiveCodeBench、CodeContests、Code-Forcesの5ベンチマークで、CoVerは基盤のQwen2.5-Instructに対し、1回生成でのpass@1を7Bで5.8ポイント、14Bで7.1ポイント改善し、両規模で比較した全手法の中で最高のマクロ平均を達成した。CodeTの順位付け処理の基盤モデルとして差し替えると、CoVer-7Bは3.5ポイントの改善を加え、共同学習が生成と選択の両方に利益をもたらすことを示した。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-18(UTC)
- 最新改訂
- 2026-09-18 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-18 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Self-play methods that co-train a single language model as both coder and test author promise to move code-generation RL beyond fixed test suites, but they suffer from two coupled pathologies: permissiveness collapse, where pass-rate rewards are maximised by trivial, non-discriminative tests, and concentration bias, where i.i.d. sampled tests cluster on modal inputs and inflate estimator variance. We introduce CoVer (Co-trained Coder and Verifier), a single-policy GRPO framework that addresses both failure modes. First, an information-gain (IG) reward scores each self-generated test by the mutual information between its pass/fail vector and a graded, ground-truth-anchored correctness signal y [0, 1] m, gated by the sign of their covariance so that only positively discriminative tests receive reward. Second, a three-stage diversity-aware selection step prunes a candidate pool to a behaviourally non-redundant suite (invalidity, input-string, execution-profile filtering), raising the effective sample size of the IG estimator at fixed execution budget. On five benchmarks (LiveBench, MBPP, LiveCodeBench, CodeContests, Code-Forces), CoVer raises one-shot pass@1 by +5.8 points at 7B and +7.1 points at 14B over the Qwen2.5-Instruct backbone, and achieves the highest macro-average among all compared methods at both scales. As a drop-in backbone inside the CodeT ranking pipeline, CoVer-7B adds +3.5 points, demonstrating the dual benefit of co-training for both generation and selection.
arXiv ID: 2609.21208 / 要約の誤りについて