arXiv論文メモ
新着一覧
cs.AI / cs.LG · 査読状況未確認

検証のフィードバックで候補解を改良するLLM

LLM-as-an-Improver: Turning Verification into Better Candidates

Akiyoshi Tomihari, Yuma Ichikawa

この論文をやさしく読む

ひとことで言うと

複数の回答候補から選ぶだけでなく、検証の指摘を使って候補自体を改善し、選び直す方法です。元の最良候補を残し、修正版や別の方針の回答も追加します。

何に役立つ?

コード生成や推論で、最初の候補群が不十分だった場合の改善に役立ちます。新たな正解を作れる可能性があるため、固定した候補群の中で順位を付けるだけの方法を広げます。

この研究の面白いところ

最良候補と次点の修正、別アプローチという補完的な候補を条件付きで生成します。無効・重複候補を推論時に分かる情報だけで除き、もとの基準で最終回答を選びます。

どこまで分かった?

複数モデルとベンチマークの多くの設定で改善したという報告で、全設定での優越を主張していません。最初が全誤答でも回復する例はありますが、検証器自体が必ず正しいという保証ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

検証器に基づく選択では、複数の候補解を生成し、検証器で最も有望なものを選ぶことで、LLMの性能を向上させる。しかし、既存手法は通常、検証を順位付けの段階としてだけ扱い、固定された候補集合を評価し終えると、そのフィードバックを捨ててしまう。本研究では、検証が候補集合そのものも改善できるかを問う。 このため、LLM-as-an-Improverを導入し、検証フィードバックを使って候補を生成し直し、再選択するVerify–Repair–Reselect(VRR)を提案する。VRRは最初の勝者を保持しつつ、条件に応じて三つの相補的な代替候補を生成する。それらは、勝者の修正版、次点候補の修正版、新しい方針に基づく解である。推論時に得られる情報だけを使って、無効な候補と重複候補を除外し、元の評価基準で最終回答を再選択する。 多様なモデルと、コード生成および推論のベンチマークにわたって、VRRは多くの設定で固定候補集合による検証器選択を上回った。また、初期候補集合がすべて誤っていても、正しい解を回復できる場合があった。 これらの結果は、LLMを改善器として使う、より広い役割を示している。検証フィードバックは、既存の解から選ぶだけでなく、初期集合を超える強い候補を構成するためにも利用できる。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-17(UTC)
最新改訂
2026-09-17 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Verifier-based selection improves LLM performance by generating multiple candidate solutions and using a verifier to select the most promising one. However, existing methods typically treat verification only as a ranking step and discard its feedback once a fixed candidate pool has been evaluated. In this paper, we ask whether verification can also improve the candidate set itself. To this end, we introduce LLM-as-an-Improver and propose Verify--Repair--Reselect (VRR), which uses verification feedback to generate and reselect improved candidates. VRR retains the initial winner while conditionally generating three complementary alternatives: repaired versions of the winner and runner-up, and a solution based on a new approach. It filters invalid and duplicate candidates using only inference-time information and then reselects the final answer under the original evaluation criteria. Across diverse models and code-generation and reasoning benchmarks, VRR improves over fixed-pool verifier-based selection in many settings and can recover correct solutions even when all candidates in the initial pool are incorrect. These results highlight a broader role for LLMs as improvers: verification feedback can not only select among existing solutions but also construct stronger candidates beyond the initial pool.

arXiv ID: 2609.19515 / 要約の誤りについて