arXiv論文メモ
新着一覧
cs.IR / cs.CL · 査読状況未確認

複数の推論経路を統合して文書の再順位付けを改善

Think Thrice Before Reranking: Multi-perspective Evidence and Reasoning Integration for Text Reranking

Lijun Liu, Zhengzong Chen, Wenyan Li, Yuanyuan Zhao, Fei Huang

この論文をやさしく読む

ひとことで言うと

検索結果を並べ直すLLMに複数の観点から推論させ、それらをまとめて順位を決めます。

何に役立つ?

一つの推論の誤りに検索順位が左右されることを減らし、複雑な関連性を持つ文書の再順位付けを改善する用途です。

この研究の面白いところ

複数の推論経路を統合する再順位モデルと、段階的に推論の安定性・順位品質を学習する方策最適化を組み合わせます。

どこまで分かった?

推論を要する検索と従来型のベンチマークで評価しています。BRIGHTで4Bが多くの7Bや32Bモデルを上回るという結果であり、すべての大モデルへの優位性や推論費用の削減を意味しません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

大規模言語モデル(LLM)による推論ベースの再順位付けは、テキストのランキング改善に有望な結果を示してきた。しかし、現在の手法は主に単一の推論経路に依存しており、その順位は推論の誤りに影響されやすい。また、文書の関連性を支える多面的な手掛かりをモデル化する能力にも、本質的な制約がある。 この問題に対処するため、相補的な推論経路をモデル化して再順位付けの頑健性を高める枠組み、MERIT-Rank(テキスト再順位付けのための多視点の根拠と推論の統合)を提案する。MERIT-Rankは、クエリと文書の関連性を複数の観点から評価する多軌道推論空間(MTRS)を定式化し、それらの推論経路を一つの順位決定へ統合する共同リランカーを導入する。さらに、段階的な最適化目標を通じて、推論経路を安定させながらランキング品質を継続的に改善する、漸進的な学習枠組みPRPO(Progressive Rank Policy Optimization)を開発する。 推論を多く必要とする検索と従来型の検索の両方のベンチマークで行った実験では、MERIT-Rankが有力な比較手法を一貫して上回った。特に40億パラメータのモデルは、BRIGHTで大半の70億パラメータのリランカーを上回り、320億パラメータのリランカーの一部をも上回る。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-17(UTC)
最新改訂
2026-09-17 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Reasoning-based reranking with Large Language Models (LLMs) has shown promising improvements in text ranking. However, current methods predominantly rely on a single reasoning trajectory, resulting in rankings that are susceptible to reasoning errors and inherently constrained in modeling the multifaceted signals underlying document relevance. To resolve this dilemma, we propose MERIT-Rank(Multi-perspective Evidence and Reasoning Integration for Text Reranking), a framework that models complementary reasoning trajectories to improve reranking robustness. MERIT-Rank formulates a Multi-Trajectory Reasoning Space (MTRS) that evaluates query-document relevance from multiple perspectives and introduces a joint reranker that consolidates these reasoning paths into a unified ranking decision. We further develop Progressive Rank Policy Optimization (PRPO), a progressive training framework that stabilizes reasoning trajectories while continually improving ranking quality through staged optimization objectives. Experiments on both reasoning-intensive and traditional retrieval benchmarks show that MERIT-Rank consistently achieves superior performance over competitive baselines. The 4B model notably outperforms most 7B and even 32B rerankers on BRIGHT.

arXiv ID: 2609.20131 / 要約の誤りについて