arXiv論文メモ
新着一覧
cs.CL / cs.AI · 査読状況未確認

コーディングエージェントの途中段階を評価するFLARE

FLARE: A Full-Lifecycle Dense Supervision Paradigm for Long-Horizon Coding Agents via Generative Reward Model

Jingxuan Xu, Gang Wu, Yanan Wu, Yutao Mou, Songwei Yu, Tianzhuang He, Zhengshuo Gong, Zhao Liu, Zihang Xu, Wenqiang Zhu, Xinping Lei, Weihao Li, Yuhui Bai, Zhongqiu Wang, Yan Wu, Ariel Deng

この論文をやさしく読む

ひとことで言うと

コードを書くエージェントを最後の成否だけで評価せず、途中の各手順のリスクを判定し、やり直しや学習に使う仕組みです。

何に役立つ?

考えられる用途は、長いソフトウェア作業で失敗しかけた箇所を局所的にやり直し、全体を何度も試す計算を減らすことです。評価では推論時と学習時の両方を扱っています。

この研究の面白いところ

一つの生成型報酬モデルを、推論時の介入、SFT用データの順位付け、RLの途中報酬へ共通に使います。失敗軌跡も診断の材料にしています。

どこまで分かった?

トークン5分の1はN=1とGlobal RolloutのN=5との比較です。19.13%は相対改善であり、要旨には個々の評価課題や基準性能の詳細はありません。任意の開発作業で同じ削減になるとは示されていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

推論時の計算量拡大は、長期的なソフトウェア工学(SWE)課題に取り組む大規模言語モデル(LLM)エージェントを強化するが、成功・失敗という疎な2値報酬は、どの行動に成果を帰属させるかという深刻な問題を生み、失敗した探索軌跡を無駄にする。既存の軌跡最適化・拡張手法は高コストで構造的な制約があり、因果診断を伴わない経験則的な状態再利用や、その場で行動に使える指針のない遅延したスカラー採点に依存している。 軽量な生成型報酬モデル(GRM)で駆動する新しい密な監督方式FLARE(Full-Lifecycle Alignment and Reward Engine)を提案する。まず、因果を考慮したオフライン診断の枠組みRADARが、因果連鎖を逆にたどることで、事後の結果を手掛かりにすることを避けた高忠実度の教師信号を抽出し、リアルタイムに各ステップのリスクを返すGRMへ蒸留する。次にFLAREは、このGRMを使ってエージェントをライフサイクル全体にわたり継続的に最適化する。 推論時には、FLAREは能動的な補助機構として働き、高リスクな生成ステップを自律的に捕捉し、局所的な中断点から再実行することで計算負担を大幅に減らす。事後学習では、GRMの構造化された信号を、教師あり微調整(SFT)の過程を監督する再順位付けスコアと、強化学習(RL)のステップ単位の密な報酬として利用し、報酬が疎な環境での方策の崩壊を緩和する。 広範な評価により、FLAREがエージェントのライフサイクル全体に新たなパレート最適境界をもたらすことを示す。FLARE(N=1)はGlobal Rollout(N=5)を上回り、トークン消費を5分の1に削減する。学習への拡張は、長期的な対話課題の疎な報酬の問題を克服し、過程を考慮したデータ選別によってSFTで19.13%の相対的性能向上、RLで一貫した9.19%の改善をもたらす。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-20(UTC)
最新改訂
2026-09-20 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

While test-time scaling enhances Large Language Model (LLM) agents in long-horizon software engineering (SWE), sparse binary rewards (Pass/Fail) create a severe credit assignment crisis and waste failed exploratory trajectories. Current trajectory optimization and scaling methods are costly and structurally limited, relying on heuristic state reuse without causal diagnosis or delayed scalar scoring without actionable online guidance. We propose FLARE (Full-Lifecycle Alignment and Reward Engine), a novel dense supervision paradigm driven by a lightweight Generative Reward Model (GRM). First, RADAR, an offline causal-aware diagnostic framework, extracts high-fidelity, hindsight-free supervision through causal-chain backtracking to distill a GRM providing real-time, step-level risk feedback. Second, FLARE uses this GRM to continuously optimize the agent across its entire lifecycle. During inference, FLARE acts as an Active Scaffold, autonomously intercepting high-risk generation steps for localized breakpoint re-execution, drastically reducing compute overhead. During post-training, the GRM's structured signals serve as process-supervised reranking scores for Supervised Fine-Tuning (SFT) and step-level dense rewards for Reinforcement Learning (RL), mitigating policy collapse in sparse environments. Extensive evaluations show that FLARE establishes a new Pareto frontier across the agent lifecycle: FLARE (N=1) outperforms Global Rollout (N=5) with a 5x reduction in token consumption. Extending FLARE to training overcomes the sparse reward problem in long-horizon interactive tasks, delivering relative performance gains of 19.13% in SFT through process-aware data curation and a consistent 9.19% improvement in RL.

arXiv ID: 2609.23808 / 要約の誤りについて