arXiv論文メモ
新着一覧
cs.IR · 査読状況未確認

埋め込み学習で推論の質を保ち、検索性能を高める

Reasoning Quality Matters: Combating Reasoning Collapse in LLM-based Embedding Learning

Zihan Gong, Xiaohan Ye, Jiangchao Yao, Jinsong Lan, Xiaoyong Zhu, Xu Chen

この論文をやさしく読む

ひとことで言うと

検索用の文章ベクトルを学習する際に、役立つ推論が失われたり検索と無関係な推論になったりする問題を抑えます。

何に役立つ?

問い合わせと文書の関連性をより適切に捉える検索モデルの学習に役立ちます。22データセットの評価と実サービスのオンライン実験で改善を報告しています。

この研究の面白いところ

参照付きの教師あり調整の後、埋め込みと推論品質の二種類の報酬で強化学習します。CoFree-4Bは比較モデルより平均でnDCG@10が2.8ポイント高くなりました。

どこまで分かった?

2.8ポイントは評価した22データセットでの平均絶対差です。要旨にはオンライン改善の具体値や追加の推論・学習コストは記されていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

大規模言語モデル(LLM)は近年、検索に用いる、文脈情報を豊富に含んだテキスト埋め込みの生成で高い可能性を示している。既存手法の多くは、埋め込み学習を受動的な特徴抽出として扱うか、指示追従を通じてLLMの推論を利用し、埋め込みの最適化を改善している。しかし、埋め込みの目的への特化は、有用な推論の生成を抑制したり、検索と無関係な文章を生み出したりすることがある。本研究では、この2種類の劣化を「推論崩壊」と呼ぶ。 この問題に対処するため、推論の質を維持しながら、クエリと文書の埋め込みの最適化にLLMの推論を段階的に組み込む2段階の枠組みCoFree(Collapse-Free Reasoning Embedding)を提案する。第1段階では、参照情報に基づく教師あり微調整を適用し、基盤となる埋め込みモデルの推論能力を回復させるとともに、その表現力を保つ。第2段階では、埋め込み指向の報酬と推論指向の報酬という2つの報酬を導入し、強化学習において、埋め込みの目的に沿って関連性をきめ細かく推論できるようにする。両端を結び付けたこの最適化は、埋め込み学習を静的な整合化から、質の高い推論に導かれる検索の探索過程へと変える。 広範な実験でCoFreeの有効性を示した。CoFree-4Bは、MTEBとBRIGHTの22データセットにわたり、Qwen3-Embedding-4Bに対してnDCG@10を平均で絶対値2.8ポイント改善した。実際の検索システムでのオンライン実験でも、一貫した改善が得られた。コード、RTED、モデルのチェックポイントを公開する予定である。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-17(UTC)
最新改訂
2026-09-17 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Large Language Models (LLMs) have recently shown strong potential for producing context-rich text embeddings for retrieval. Most existing methods either treat embedding learning as passive feature extraction or exploit LLM reasoning through instruction following for better embedding optimization. However, specialization toward embedding objectives can suppress useful reasoning generation or produce retrieval-irrelevant text. We refer to these two forms of degradation as reasoning collapse. To address this issue, we propose CoFree (Collapse-Free Reasoning Embedding), a two-stage framework that progressively integrates LLM reasoning into query and document embedding optimization while preserving reasoning quality. At the first stage, CoFree applies reference-guided supervised fine-tuning to restore the reasoning ability and retain representational strength of the foundation embedding model. At the second stage, we introduce dual rewards, an embedding-oriented reward and a reasoning-oriented reward, to guarantee fine-grained reasoning of the relevance toward the embedding goal in reinforcement learning. This endpoint-coupled optimization transforms embedding learning from static alignment into a high-quality reasoning-guided search process for retrieval. Extensive experiments demonstrate the effectiveness of CoFree, with CoFree-4B achieving an average absolute improvement of 2.8 nDCG@10 points over Qwen3-Embedding-4B across 22 datasets from MTEB and BRIGHT. Online experiments in a real-world retrieval system further show consistent gains. Code, RTED, and model checkpoints will be made publicly available.

著者のコメント

30 pages, 8 figures

arXiv ID: 2609.20563 / 要約の誤りについて