arXiv論文メモ
新着一覧
cs.CL / cs.LG · 査読状況未確認

流れてくる質問の一部を評価して適した言語モデルを選ぶ

Which LLM to pick? Online Active Model Selection for Large Language Models

Alessandro Turrin and Patrik Okanovic and Torsten Hoefler and Nezihe Merve Gürel

この論文をやさしく読む

ひとことで言うと

実際に届く質問を全部採点せず、判断に役立つ一部だけに正解を付けて、その質問群に適したモデルを選ぶ方法です。

何に役立つ?

運用中の入力に合う言語モデルを、限られた評価予算で選びたい場合の手法になります。評価費用と選択の質を同時に測っています。

この研究の面白いところ

固定ベンチマークだけでモデルを決めるのではなく、流れてくる入力から比較に有用な質問を選ぶ点が特徴です。

どこまで分かった?

最大71.67%の費用削減と最大2.51分の1のリグレットは、報告されたデータセットとモデル群での結果です。任意の運用環境で同じ改善幅が得られる保証は要旨にありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

大規模言語モデル(LLM)は、ストリーミングデータの処理にますます利用されている。実務では最良のモデルを選ぶためにベンチマークが使われるが、その指標は実際の性能を近似するにすぎない。正解を与えるオラクルによるアノテーションは信頼できるフィードバックをもたらす一方、コストが高く、大規模に得ることが難しい場合が多い。この課題に対処するため、オンライン環境でLLMを能動的に選択する初の枠組みとしてONLINE LLM PICKERを提案する。任意のクエリの流れと限られたアノテーション予算が与えられると、ONLINE LLM PICKERは、候補モデルの中から最良のLLMを特定するために、アノテーションから最も多くの情報が得られるプロンプトを選ぶ。10データセットを含む複数の課題で130を超える言語モデルを対象に、データの流れに対して最良または最良に近いモデルを確実に特定しながら、アノテーション費用を最大71.67%節約することを示す。また、返されたモデルを使い、流れてくる未アノテーションのプロンプトに順次回答を生成すると、リグレットが最大2.51分の1に低下することも示す。これは、ONLINE LLM PICKERが、ストリーミングされるすべてのプロンプトを処理するよりかなり前に、最良または最良に近いモデルを特定できることを示している。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-10-01(UTC)
最新改訂
2026-10-01 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Large Language Models (LLMs) are increasingly applied to process streaming data, with practitioners relying on benchmarks to select the best model even though these signals only approximate real performance. While oracle annotations can provide reliable feedback, they are often costly and difficult to obtain at scale. To address this challenge, we propose ONLINE LLM PICKER, the first framework for active model selection for LLMs in online settings. Given an arbitrary stream of queries and a limited annotation budget, ONLINE LLM PICKER selects the most informative prompts for annotation to identify the best LLM among candidate models. Across multiple tasks including 10 datasets, for over 130 language models, we show that ONLINE LLM PICKER saves annotation cost by up to 71.67% while reliably identifying the best or near-best model for the stream. We also show that using the returned model for sequential generation on unannotated prompts across the stream reduces regret by up to a factor of 2.51x, indicating that ONLINE LLM PICKER can identify the best or near-best model well before processing all streaming prompts.

arXiv ID: 2610.01592 / 要約の誤りについて