計算手順の検証を使って数学推論を強化学習する
Function-Structured Reinforcement Learning with Executable Verifiers for Mathematical Reasoning
この論文をやさしく読む
ひとことで言うと
数学の答えだけでなく、問題を分けて計算する途中の手順も検証し、その結果を使ってモデルを学習させる方法です。
何に役立つ?
計算が動くことと数学的に正しいことを分けて評価し、数学問題を解くコード生成モデルの学習を改善するのに役立ちます。
この研究の面白いところ
関数のつながりを表すグラフと実行可能なコードを結び付け、途中のどの部分が結果に寄与したかまで報酬に反映します。正答率と解法全体の成功率を別々に報告しています。
どこまで分かった?
数値は4つのデータ源から構成したベンチマークと統一評価手順での結果です。要旨には教師指導による追加改善の具体的な数値や、他の数学領域への適用結果は記載されていません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
アルゴリズムに基づく数学推論には、信頼できる問題分解、計算、結果の集約が必要である。最終解答に対する報酬だけでは途中の誤りについて得られる手掛かりが限られ、実行に成功しても数学的な正しさが保証されるわけではない。本研究では、部分問題のグラフとPython実装を複数の検証器からのフィードバックで結び付ける、関数構造化グラフ強化学習(FSG-RL)を提案する。まず教師あり微調整(SFT)によって、関数グラフからコードを生成する方策を学習する。その後、解答に基づいて付与を制御する報酬と、スパン単位の貢献度割当てを用い、グループ相対方策最適化(GRPO)で方策を最適化する。この枠組みは教師による指導と構造化メモリーにも対応する。 Grade School Math 8K(GSM8K)、MathQA、MATH、Omni-MATHから選定したベンチマークでは、公開の関数グラフと非公開の検証仕様を対にしている。統一した評価手順の下で、GRPOはSFTに対し、最終解答の正答率を43.25%から67.50%へ、解法全体の成功率を32.25%から52.25%へ改善する。教師による指導を伴う強化学習(RL)を継続すると、さらに改善が得られる。この向上は正しい形式のコードを生成できるようになることだけにとどまらず、数学推論における検証器に導かれた強化学習を支持する。コードは https://github.com/ZihanLiummyycc/FSG-RL で公開されている。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-10-01(UTC)
- 最新改訂
- 2026-10-01 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-10-01 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Algorithmic mathematical reasoning requires reliable decomposition, computation, and aggregation. Final-answer rewards provide limited guidance on intermediate errors, while successful execution does not guarantee mathematical correctness. This work proposes Function-Structured Graph Reinforcement Learning (FSG-RL), connecting subproblem graphs and Python implementations with multi-verifier feedback. The policy first learns to generate code from function graphs through supervised fine-tuning (SFT). Group Relative Policy Optimization (GRPO) then optimizes the policy using answer-gated rewards and span-level credit assignment. The framework also supports teacher supervision and structured memory. A benchmark curated from Grade School Math 8K (GSM8K), MathQA, MATH, and Omni-MATH pairs public function graphs with private verification specifications. Under a unified evaluation protocol, GRPO improves final-answer accuracy from 43.25% to 67.50% and full solution success from 32.25% to 52.25% over SFT. Continued reinforcement learning (RL) with teacher supervision yields additional gains. The gains extend beyond producing correctly formatted code, supporting verifier-guided reinforcement learning for mathematical reasoning. Code is available at https://github.com/ZihanLiummyycc/FSG-RL.
著者のコメント
5 pages, 2 figures, 2 tables
arXiv ID: 2610.01729 / 要約の誤りについて