複数エージェントの協調動作を一段階で生成する
Flowing Faster to Coordinate: One-Step Online Multi-Agent Flow Policies
この論文をやさしく読む
ひとことで言うと
複数のエージェントが協力する行動を、何度も生成処理を繰り返さずに一段階で選ぶ方法です。
何に役立つ?
環境とやり取りしながら協調行動を学ぶ際の計算や経験データの負担を減らすことを目指します。評価では標準タスクでの収益とサンプル効率を測っています。
この研究の面白いところ
複雑な行動分布を表す生成モデルを使いながら、反復生成を省き、価値推定と方策を一緒に最適化します。
どこまで分かった?
3.4倍と10.5倍は最大値であり、全タスクの平均ではありません。要旨の評価対象はMPEとMAMuJoCoの10タスクで、実機への展開結果は記載されていません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
マルチエージェント強化学習(MARL)は、環境との相互作用を通じて協調行動を学ぶ強力な枠組みである。MARLの方策を開発するには、複雑で多峰的な行動分布を表す能力と、学習・実行の効率性を両立させる必要がある。生成方策、特に拡散に基づく方策は、複雑で多峰的な挙動を忠実に捉えられるが、反復サンプリングの費用が高く、オンラインのマルチエージェント環境で規模を拡張する妨げとなる。 本研究では、表現力の高い生成方策と効率的な一段階の行動生成を組み合わせる、一段階フローモデルによるオンラインMARLの枠組みOMAFを提案する。OMAFはTransformerに基づくフロー方策によって複雑な協調行動を捉え、近似的な経路スコアの代理量を用いることで、フロー方策を同期して最適化する原理的な方法を提供する。さらに、安定したサンプル効率のよい学習を可能にするため、softmax Q値推定と協調方策学習のための同時フロー方策目的関数を結び付けた同時最適化方式を開発する。反復サンプリングをなくすことにより、方策の表現力を損なわずに学習の追加負荷を大幅に減らす。 MPEとMAMuJoCoの標準的な10タスクにわたる広範な実験で、OMAFは一貫して優れた性能を示し、基準手法に比べて最大3.4倍の収益と10.5倍のサンプル効率向上を達成した。この結果は、オンラインMARLにおける、表現力が高く計算効率のよい一段階フロー方策というOMAFの方式の有効性を裏付ける。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-10-01(UTC)
- 最新改訂
- 2026-10-01 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-10-01 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Multi-agent reinforcement learning (MARL) provides a powerful framework for learning coordinated behaviors through interactions with the environment. Developing MARL policies requires balancing expressive modeling of complex and multimodal action distributions with efficient training and execution. Generative policies, particularly diffusionbased policies, can faithfully capture complex and multimodal behaviors, but costly iterative sampling hinders their scalability in online multi-agent settings. We propose an Online MARL framework via one-step Flow model (OMAF) that combines expressive generative policies with efficient one-step action generation. OMAF employs a Transformer-based flow policy to capture complex coordination behaviors, while its approximate path score surrogate provides a principled route to synchronized flow policy optimization. To enable stable and sampleefficient learning, we further develop a joint optimization scheme coupling softmax Q-value estimation with a joint flow policy objective for coordinated policy learning. By eliminating iterative sampling, OMAF dramatically reduces training overhead without sacrificing policy expressiveness. Extensive experiments across 10 standard tasks from MPE and MAMuJoCo show that OMAF consistently achieves superior performance, with up to 3.4x higher returns and 10.5x sample efficiency improvement compared with baseline methods. These results validate the effectiveness of OMAF as an expressive and computationally efficient one-step flow policy paradigm for online MARL.
arXiv ID: 2610.01882 / 要約の誤りについて