arXiv論文メモ
新着一覧
cs.CL · 査読状況未確認

AIの成功手順を見つけ再利用する強化学習

ArenaFlow: From Trajectory Ranking to Hierarchical Credit Propagation for Open-Ended Agent RL

Qiang Zhang, Ruixue Ding, Fanrui Zhang, Xi Chen, Boli Chen, Shihang Wang, Yinfeng Huang, Yi Zheng, Pengjun Xie, Kaipeng Zhang, Jiawei Liu, Zheng-Jun Zha

この論文をやさしく読む

ひとことで言うと

AIの作業全体に点数を付けるだけでなく、どの途中手順が成功に効いたかを探し、その戦略を次の作業に使える形で残します。正解が1つに決まらない課題での強化学習を扱います。

何に役立つ?

考えられる用途は、複数の解決策がある作業を行うAIエージェントの学習です。評価の信号を重要な手順に届け、役立つ技能を再利用する仕組みを提供します。

この研究の面白いところ

トーナメントでの相対評価を、個々の推論ステップと蓄積する技能の両方に結びつけています。成功した軌跡を丸ごと高評価にするだけで終わらせない点が特徴です。

どこまで分かった?

要旨は実験で有効性を検証したと述べていますが、課題名、比較手法、改善幅の具体値は示していません。振り返りで得た貢献度が実際の因果関係として証明されたとは述べていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

強化学習は、正しさを検証できる領域では大規模言語モデル(LLM)エージェントを大きく改善してきた。しかし、解決方法が多様で、信頼できる単一数値の報酬を得にくい自由度の高いエージェント課題には、依然として適用が難しい。近年の一対比較による評価手法は、個別の採点を相対的な選好に置き換えることで、報酬が良し悪しを見分けられなくなる問題を緩和する。一方で、豊かな比較フィードバックを依然として実行軌跡全体の単一報酬に圧縮するため、決定的な途中のステップが見えにくくなり、成功した行動を再利用可能な技能として蓄積できない。 本研究では、自由度の高いエージェント強化学習のために、貢献度を階層的に伝播させる枠組みArenaFlowを提案する。ArenaFlowはトーナメント形式の相対順位を用いて、軌跡単位の報酬信号を導く。各比較にはさらに構造化された振り返り評価を付け、成功の鍵となったステップ、再利用可能な戦略技能、検索して得た技能の利用寄与という3種類の教師情報を明らかにする。 ステップの階層では、トーナメントで勝ち残った深さに応じて、軌跡単位のアドバンテージを信頼度の高い重要ステップへ伝播させ、局所的な推論行動をより的確に最適化する。技能の階層では、グループ単位での利用寄与から技能の有用性を推定し、有用性を考慮した更新、剪定、検索によって大域的な技能メモリを維持する。得られた有用性の高い技能は、将来の探索における方策の事前知識としても機能する。広範な実験により、自由度の高いエージェント課題に対するArenaFlowの有効性を検証した。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-18(UTC)
最新改訂
2026-09-18 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Reinforcement learning has substantially improved large language model (LLM) agents in verifiable domains, but remains difficult to apply to open-ended agent tasks, where solutions are diverse and reliable scalar rewards are hard to obtain. Recent pairwise evaluation methods alleviate reward discrimination collapse by replacing pointwise scoring with relative preferences. However, they still compress rich comparative feedback into a single trajectory-level reward, obscuring decisive intermediate steps and preventing successful behaviors from being consolidated into reusable skills. We propose ArenaFlow, a hierarchical credit propagation framework for open-ended agent reinforcement learning. ArenaFlow leverages tournament-based relative ranking to derive trajectory-level reward signals. Each comparison is further equipped with structured reflective evaluation, which reveals three types of supervision: pivotal success steps, reusable strategy skills, and usage attribution of retrieved skills. At the step level, ArenaFlow propagates trajectory-level advantages to high-confidence pivotal steps according to tournament survival depth, enabling more targeted optimization of local reasoning behaviors. At the skill level, ArenaFlow estimates skill utility from group-level usage attribution and maintains a global skill memory through utility-aware updating, pruning, and retrieval. The resulting high-utility skills further serve as policy priors for future exploration. Extensive experiments validate ArenaFlow's effectiveness on open-ended agent tasks.

arXiv ID: 2609.21378 / 要約の誤りについて