検索結果一覧を基準ごとに評価するSEEK
SEEK: Skill-Routed Evaluation with Evolvable Knowledge for Industrial Search
この論文をやさしく読む
ひとことで言うと
検索結果の一覧を、問い合わせに合う評価基準を選んで判定し、問題の原因も示す手法です。
何に役立つ?
大規模な検索サービスで、結果一覧の品質評価を効率化する用途が考えられます。論文は短い動画の検索での評価と導入を報告しています。
この研究の面白いところ
評価基準をモデルの外の技能として持つため、新しい基準を追加するときに毎回モデルを再訓練せずに済む設計です。
どこまで分かった?
要旨は品質改善を述べていますが、改善幅の数値や導入後の利用者への影響は詳しく記していません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
検索品質の評価は、産業用検索システムの開発と改善に必要な教師信号と問題診断を与える。大規模言語モデルは人手の評価に代わる大規模な方法となり得るが、信頼できる自動評価は難しい。利用者は検索結果をページ全体として見る一方、評価基準は多面的で変化し続ける。全基準を一つのプロンプトに詰めると無関係な情報や基準同士の干渉が生じ、後段の訓練でモデルに組み込むと規則更新のたびに高価な再訓練が必要になる。 そこで、変化可能な知識を使って評価技能を選択するSEEKを提案する。検索評価の個別基準を技能の集まりとして外部化し、問い合わせと結果一覧の組ごとに関連する技能を選び、課題に適応した一覧単位の評価器でページ全体の判定と失敗原因の分類を行う。二段階の訓練により評価器の基準を人間の選好に合わせる一方、過去事例の再評価で更新を制御する技能の集まりによって、繰り返し現れる評価知識の不足をモデルの再訓練なしに取り込める。短い動画の産業用検索での実験では、一覧単位の品質評価の正確さが向上し、原因の特定にも大きな進展があった。SEEKは、1日当たりのアクティブ利用者が4億人を超える短い動画の基盤Kuaishouに導入され、オンライン検索評価の規模と品質を大きく改善したと報告する。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-24(UTC)
- 最新改訂
- 2026-09-24 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-24 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Search quality evaluation provides essential supervision and diagnostic signals for the development and iteration of industrial search systems. Although large language models (LLMs) offer a scalable alternative to manual assessment, reliable automatic evaluation remains challenging: users experience search results at the page level, while the applicable evaluation criteria are multi-dimensional and continuously evolving. Packing all evaluation criteria into a unified prompt introduces irrelevant context and potential criterion interference, whereas internalizing them through post-training tightly couples rule updates with costly model retraining cycles. To address these issues, we propose Skill-routed Evaluation with Evolvable Knowledge (SEEK). Specifically, SEEK externalizes specific search evaluation criteria into a skill bank, dynamically routes relevant skills for each query-result list pair, and employs a task-adapted listwise evaluator to produce page-level judgments and failure mode attribution. A two-stage training pipeline teaches the evaluator to align evaluation criteria with human preferences, while a replay-gated skill bank allows recurring evaluation knowledge gaps to be incorporated without model retraining. Experiments on industrial short-video search show that SEEK improves listwise quality evaluation accuracy and achieves significant progress in attribution diagnosis. SEEK has been deployed at Kuaishou, a short-video platform with over 400 million daily active users, significantly improving the scale and quality of online search evaluation.
arXiv ID: 2609.29803 / 要約の誤りについて