新しい研究の着想につながる論文を探す能力の評価
ScholarCatalyst: A Benchmark for Retrieving Papers That Inspire New Research
この論文をやさしく読む
ひとことで言うと
研究の問いに対し、単に似ている論文ではなく、研究を前進させるアイデアを含む論文を探せるかを測る評価セットです。実際の論文著者が検索候補を判断しています。
何に役立つ?
研究支援検索の性能を、研究者が必要とする先行アイデアにたどり着けるかという観点から評価するのに役立ちます。未完成の着想への文献提案は目指す用途であり、その全面的な実現を示したものではありません。
この研究の面白いところ
研究開始時点の文献だけを検索対象にし、完成した研究を知る著者の経験から有用性を評価します。検索器を道具として使うエージェントでも、単純な埋め込み検索を上回らなかった点が具体的な課題を示します。
どこまで分かった?
対象は計算機科学の207論文と184人の主要著者です。Recall@20はエージェント検索0.42、埋め込み検索0.48、Claude Fable 5.1を用いたエージェント0.51で、後者には完成論文が学習に含まれた可能性があります。他分野での有効性はこの要旨からは分かりません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
優れた科学者を優れた科学者たらしめているものは何だろうか。AIシステムが未解決問題で進展を見せ始めても、増え続ける研究の蓄積に埋もれたどの先行アイデアを新しい問題が必要としているかを察知する能力では、科学者が依然として大きく先を行っている。この能力を調べるため、私たちは、完了した自分のプロジェクトをどの先行研究が前進させたかを直接知る研究者の知見を利用する。ここでは論文を、その中にあるアイデアを指し示す手掛かりとして扱う。著者による注釈付けを大規模化する自動処理パイプラインを用い、最近の計算機科学論文207本の主要著者184人に、どの候補論文が実際にプロジェクトを前進させたか、あるいは前進させ得たかを、詳しい理由とともにラベル付けしてもらい、ScholarCatalystを構築した。 著者の判断を正解情報として使う検索課題を導入する。初期の研究上の問いを与えられたときに、プロジェクト開始時点で入手できた文献だけから、こうした論文を検索する課題である。エージェントによる検索は、同じ埋め込み検索器をツールとして呼び出しているにもかかわらず、埋め込み検索を上回らなかった。Recall@20はそれぞれ0.42と0.48だった。学習中に完成後の論文を見ていた可能性があるClaude Fable 5.1に基づくエージェントでさえ、R@20は0.51にとどまる。これらの結果は、広範な文献集合を検索する専門家の直観をモデルに身に付けさせる、新しい学習方法の必要性を示している。私たちはScholarCatalystを、まだ形の定まっていないアイデアから、それに必要な先行研究を指し示せる科学研究エージェントに向けた一歩と位置付ける。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-10-01(UTC)
- 最新改訂
- 2026-10-01 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-10-01 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
What makes great scientists great? Even as AI systems start to make progress on open problems, scientists remain far ahead of them at sensing which prior idea, buried in an ever-growing archive of research, a new problem needs. To study this skill, we draw on researchers who know firsthand which earlier work advanced their completed projects, with papers serving as pointers to the ideas within. Using our automated pipeline that makes author annotation scalable, we build ScholarCatalyst by having 184 lead authors of 207 recent computer science papers label which candidates did or could have advanced their project, each with a detailed rationale. We introduce a retrieval task with author-provided judgments: given an initial research question, retrieve these papers from only the literature available when the project began. Agentic search does no better than embedding retrieval (0.42 vs. 0.48 Recall@20) despite calling that same retriever as a tool. Even an agent built on Claude Fable 5.1, which may have seen the completed papers during training, reaches only 0.51 R@20. These results highlight the need for new training recipes that equip models with expert intuition for searching broad corpora. We envision ScholarCatalyst as a step toward scientific agents that can take a half-formed idea and point to the prior research it needs.
著者のコメント
57 pages
arXiv ID: 2610.02202 / 要約の誤りについて