arXiv論文メモ
新着一覧
cs.IR · 査読状況未確認

検索履歴の特徴量が欠けても使える個人向け再順位付け

Robust Fusion of Semantic and Behavioural Signals for LLM Reranking in Personalised Search

Aleksandr V. Petrov, Nathan Stein, Erik Lybecker, Emma Schüldt, Daniel Lazarovski, Hugues Bouchard, Mounia Lalmas

この論文をやさしく読む

ひとことで言うと

個人向け検索で過去の利用履歴を活用しつつ、その情報がない検索でも性能を落としにくくする学習方法。

何に役立つ?

検索語と候補の過去の成功統計が使える場合と使えない場合の両方を扱う再順位付けモデルの設計に役立つ。音声配信サービスのオンライン試験では、QSSを使う二つの方法とも検索成功率が約2%改善した。

この研究の面白いところ

履歴特徴量を単に入れると、利用できないときに弱くなる。各例を特徴量あり・なしの両方で学習すると、ありの場合の利点を保ちつつ、なしの場合のオフライン性能を4.0%改善した。

どこまで分かった?

オンライン試験の全体集計では、二重サンプル学習が特徴量だけを用いる学習より優れるとは判別できなかった。履歴がない条件でのオンライン比較は方向として整合したという報告にとどまる。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

個人向け検索では、検索語の意図を満たすと同時に、ユーザーの文脈と過去の操作を取り入れる必要がある。大規模言語モデル(LLM)を用いるクロスエンコーダーは、候補を再順位付けする共通の仕組みを提供するが、予測に役立つ行動統計量を入力文に加えると、近道的な学習が生じる可能性がある。つまり、データが少ない検索や初めての検索にも一般化できる意味やユーザー文脈のパターンより、過去の行動の手掛かりに依存してしまう。本研究は、大規模な音声配信サービスの個人向け検索システムにおいて、検索語と候補の組ごとの過去の成功度を要約した、操作履歴由来の行動特徴量Query Slice Stats(QSS)を使い、この問題を調べる。QSSを単純に追加すると、特徴量が利用できるときの順位付けは改善したが、それを取り除くと頑健性が低下した。そこで、各学習例をQSSを含む形と除いた形で1回ずつ提示する、決定的な二重サンプルの特徴量ドロップアウト学習を提案する。オフライン評価では、QSSを加えると、利用できる場合の順位付け品質が13.3%向上した。二重サンプル学習はこの向上を維持しつつ、QSSを除いた評価では単純にQSSで学習した場合より性能を4.0%改善した。実際のサービスでのオンライン試験では、QSSを考慮する二つの方法のどちらも検索成功率を約2%改善した。試験全体の集計では二重サンプル学習と特徴量だけを用いる学習の差は区別できなかったが、履歴がない利用開始時の比較は、方向としてオフライン結果と整合していた。したがって、特徴量がある場合とない場合の組を学習することで、強い行動統計量を活用しながら、利用できない場合の頑健性を保つという課題を緩和できる。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-22(UTC)
最新改訂
2026-09-22 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Personalised search must satisfy query intent while incorporating user context and historical interactions. LLM-based cross-encoders provide a single reranking interface, but injecting predictive behavioural statistics into their prompts can encourage shortcut learning: reliance on historical signals at the expense of semantic and user-context patterns that generalise to sparse or unseen searches. We study this problem in the personalised search system of a large-scale audio streaming platform using Query Slice Stats (QSS), an interaction-derived behavioural feature summarising historical success for query-candidate pairs. Naive QSS injection improves ranking when the feature is available but reduces robustness when it is removed. We address this with deterministic dual-sample feature-dropout training, which presents each example once with QSS included and once with QSS removed. Offline, QSS injection improves ranking quality by 13.3% when available. Dual-sample training preserves these gains while improving performance under QSS-removed evaluation by 4.0% relative to naive QSS training. In a live online test, both QSS-aware variants improve search success by roughly 2%. The aggregate test does not distinguish dual-sample from features-only training; the cold-start comparison is directionally consistent with the offline results. Paired feature-present and feature-removed training can therefore reduce the tension between exploiting strong behavioural statistics and remaining robust when they are unavailable.

著者のコメント

Accepted at the USRW Workshop at RecSys 2026

arXiv ID: 2609.25825 / 要約の誤りについて