問い合わせの振り分けと複数AIの学習を同時に改善
CERA-MoA: Co-Evolving Routing Mechanisms with Continually Learning LLM Agents
この論文をやさしく読む
ひとことで言うと
複数の言語モデルを使う仕組みで、誰に質問を任せるかと、誰に何を学ばせるかを一緒に改善します。学習で得意分野が変わることを、振り分けにも反映させます。
何に役立つ?
複数エージェントを使うシステムで、課題に必要なモデルだけを動かしつつ、各モデルの専門化を進める設計に役立ちます。全員に最後まで回答させずに能力を推定する点は、処理負荷を抑える方向です。
この研究の面白いところ
中間層の状態から推定した習熟度を、推論時の選択と学習データ配分の両方に使います。ルータだけ、またはエージェントだけを最適化する分断を埋める構成です。
どこまで分かった?
複数領域の比較で優位と報告していますが、要旨に課題名、改善幅、実測コストはありません。推定器の省力化という設計と、システム全体の削減率の実証は区別する必要があります。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
現在のMixture-of-Agents(MoA)の枠組みは、一般に問い合わせの振り分けとエージェントの微調整を別々の過程として扱うため、エージェントの能力の変化に対応する力が限られる。この分断により、事後学習中に変化するエージェントの能力へ振り分け戦略を適応させることも、データに基づいてエージェントが相乗的な専門化を進めることも妨げられる。 この問題を解決するため、動的なルータと独立したエージェントの方策が共に進化する反復強化学習の枠組み、CERA-MoAを導入する。中間層の隠れ状態を用いて、各エージェントが意味内容をどれほど扱えるかを評価する、予測型の習熟度推定器を設計する。これにより、最後まで応答を生成するロールアウトの負荷を避ける。 これらの習熟度スコアに基づき、累積閾値を用いる適応的な振り分け機構が、対象に合った最小限のエージェント部分集合を動的に起動し、課題の性能と効率を両立させる。変化する能力に基づいて、狙いを定めた学習標本を各エージェントへ積極的に配分することで、CERA-MoAは能力の分化を促す。さまざまな領域での広範な実験により、CERA-MoAが、エージェントを固定した最先端の振り分け手法と、ワークフローを固定した微調整手法の比較基準を上回ることを示す。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-16(UTC)
- 最新改訂
- 2026-09-16 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-16 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Current Mixture-of-Agents (MoA) paradigms generally treat query routing and agent fine-tuning as separate processes, limiting their ability to respond to evolving agent capabilities. This disconnect prevents routing strategies from adapting to evolving agent capabilities during post-training and prevents agents from achieving synergistic data-driven specialization. To resolve this, we introduce CERA-MoA (Co-Evolving Router with continually learning Agents for Mixture-of-Agents), an iterative reinforcement learning framework where the dynamic router and independent agent policies co-evolve. We design a predictive familiarity estimator that leverages mid-layer hidden states to evaluate semantic competence among agents, avoiding the overhead of full rollouts. Based on these familiarity scores, a cumulative-threshold adaptive routing mechanism dynamically activates a tailored minimal agent subset, achieving a trade-off between task performance and efficiency. By proactively allocating targeted training samples to agents based on their evolving competence, CERA-MoA promotes capability differentiation. Extensive experiments across various domains demonstrate that CERA-MoA outperforms state-of-the-art static-agent routing and fix-workflow fine-tuning baselines.
arXiv ID: 2609.18779 / 要約の誤りについて