モデルの習熟度に合わせてツール利用を学ぶMATCH
MATCH: Model-Aware Tool Learning with Curriculum Scheduling and Hierarchically Gated Rewards
この論文をやさしく読む
ひとことで言うと
LLMのツール学習で、その時点の能力に合う課題を選び、ツール名から引数まで順に正しさを採点します。
何に役立つ?
誤ったツールを選んでも引数だけで報酬を得てしまう問題を減らし、能力に合った学習課題を供給するための方法です。
この研究の面白いところ
報酬から課題の難しさを更新し、学習と課題選択を循環させます。前提が正しい場合だけ次の階層の報酬を与える点が特徴です。
どこまで分かった?
API-Bankで72.19%、BFCL V3で62.87%の全体正解率を報告します。二モデル系の四基盤で改善を示しますが、実環境のツール操作の安全性や任意APIへの保証ではありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
ツール学習は、大規模言語モデル(LLM)がパラメータに蓄えた知識を超える課題に、外部ツールを使って取り組むことを可能にする。強化学習はフィードバックからツール呼び出し行動を最適化できるが、現在の手法には二つの問題がある。固定した閾値を使うカリキュラムは、学習方策の能力の境界が変化すると、それに合わなくなり得る。また、加算型の報酬は、予測したツールが誤っていても引数レベルで得点を与えてしまう。 この問題に対処するため、カリキュラムのスケジューリングと階層的に条件付けた報酬による、モデルの状態を考慮したツール学習の閉ループ枠組みMATCHを提案する。Model-Aware Curriculum Learning(MACL)は、方策とともに変化する、報酬に由来するサンプル難易度を維持する。各エポックでは、現在の能力の境界付近にあるサンプルと、より難しい事例の上位k件の集合を選択する。Hierarchical Tool-call Gated Reward(HTGR)は、ツール名、引数キー、引数値を条件付きの連鎖として採点し、前提条件が満たされたときだけ各段階で得点を与える。同じHTGR報酬がGRPOの更新とMACLの難易度更新の両方を駆動し、方策最適化とサンプル選択のループを閉じる。 API-BankとBFCL V3で、MATCHはそれぞれ72.19%と62.87%の総合正解率を達成し、主要な教師あり学習および強化学習ベースの比較手法を上回った。基盤モデルを変えた実験でも、二つのモデル系列に属する四つの基盤モデルで一貫した改善が示された。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-17(UTC)
- 最新改訂
- 2026-09-17 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-17 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Tool learning enables large language models (LLMs) to use external tools for tasks beyond parametric knowledge. Reinforcement learning can optimize tool-call behavior from feedback, but current methods still face two problems: fixed-threshold curricula can become misaligned with the policy's evolving capability boundary, and additive rewards can leak argument-level credit when the predicted tool is wrong. To address these problems, we propose MATCH, a closed-loop framework for model-aware tool learning with curriculum scheduling and hierarchically gated rewards. Model-Aware Curriculum Learning (MACL) maintains reward-derived sample difficulty that co-evolves with the policy, and each epoch selects samples near the current capability boundary together with a top-k pool of harder cases. Hierarchical Tool-call Gated Reward (HTGR) scores tool name, argument key, and argument value as a gated chain, granting credit at each level only when prerequisites hold. The same HTGR rewards drive both GRPO updates and MACL's difficulty refresh, closing the loop between policy optimization and sample scheduling. On API-Bank and BFCL V3, MATCH reaches 72.19% and 62.87% overall accuracy, outperforming the main supervised and RL-based baselines. Backbone experiments further show consistent improvements across four backbones from two model families.
arXiv ID: 2609.20082 / 要約の誤りについて