限定的な判断を軽量化するLLMエージェントの評価
REFLEX with Jev for Efficient Selective Control in LLM Agents
この論文をやさしく読む
ひとことで言うと
選択肢が決まっている判断を軽い処理に任せ、難しい場合だけ高性能LLMを使う仕組みを評価しています。
何に役立つ?
エージェントが高性能モデルを呼ぶ回数を減らす設計を検討する際に役立ちます。100タスクの評価では95%の成功率と呼び出し削減が報告されています。
この研究の面白いところ
削減効果だけでなく、安い生成モデルを段階的に使う比較方式との差が小さくなる条件も調べています。認可境界に近い選択肢が信頼性に影響する点も具体的です。
どこまで分かった?
72.7%は高性能モデルの呼び出し回数の削減で、総費用や処理時間の同率削減ではありません。外部評価では優位性が限定され、行動の選択肢や認可条件にも結果が左右されます。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
LLMエージェントは選択肢の限られた判断にも生成モデルを使うことが多く、タスク成功率を下げずに、いつその判断をより効率的に扱えるかが問題となる。本研究では、Jevを高速で型付きの判断層として用い、確信度が低い場合や生成が必要な場合に高性能LLMを呼び出すエージェント構成REFLEXを調べる。 固定した100タスクのベンチマークで、REFLEXは成功率95%を達成し、高性能モデルのみを使うエージェントに比べ、高性能モデルの呼び出しを72.7%削減した。この削減は3系統のフォールバック先でも維持された。条件を制御した介入実験は、信頼性が行動集合の大きさと、認可境界の近くにある、一見妥当だが完全には妥当でない選択肢に依存することを示した。外部のBFCLおよびτ形式の評価では、通常の振り分けがすでに高精度な場合、安価な生成モデルを段階的に使う構成に対する優位性は限られていた。これらの知見は、Jevによる選択的制御が計算を削減できる条件と、その利点が限られる場面を明らかにする。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-22(UTC)
- 最新改訂
- 2026-09-22 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-22 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
LLM agents often use generative models for bounded decisions, raising the question of when these decisions can be handled more efficiently without reducing task success. We study REFLEX, an agent architecture that uses Jev as a fast, typed decision layer and calls a strong LLM when confidence is low, or generation is required. On a frozen 100-task benchmark, REFLEX achieves 95% success with 72.7% fewer strong-model calls than a strong-only agent, with reductions persisting across three fallback families. Controlled interventions show that reliability depends on action-set size and near-valid alternatives near authorization boundaries. External BFCL and $\tau$-style evaluations reveal limited advantages over a cheap generative cascade when ordinary routing is already highly accurate. These findings identify when selective control with Jev can reduce computation and where its benefits are limited.
arXiv ID: 2609.26532 / 要約の誤りについて