誤答だけから指示文を修正し簡単な問題での悪化を防ぐ
STEVE: Stabilizing Textual Gradient-Based Prompt Optimization via Error-Driven Refinement and Regularized Verification
この論文をやさしく読む
ひとことで言うと
AIへの指示文を自動修正するとき、誤答からだけ改善案を作り、できていた問題を壊さないか確認してから採用します。
何に役立つ?
推論タスクの指示文を繰り返し調整する際、特定の難問への対策で全体が悪化することを減らすために使えます。
この研究の面白いところ
改善案を作る段階と採用する段階の両方に制御を入れています。誤答に集中しつつ、別の保持用集合で副作用を確認する構成です。
どこまで分かった?
複数モデル・ベンチマークでの改善が報告されていますが、要旨には改善幅や保持用集合の設定の詳細はありません。任意の入力に対して性能悪化が起きない保証を示したものではありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
自然言語のフィードバックを使うテキスト勾配法は、プロンプトの最適化を自動化するが、反復更新が不安定になることがある。本研究では、その不安定性の原因を二つ特定する。すでに正しく処理できた例から生成される雑音の多い勾配と、難しい事例への過度な特化によって簡単な入力での性能が低下することである。 二つの連動する仕組みを備えた安定化の枠組みSTEVEを導入する。誤りに基づく精緻化は、誤って処理した例からのみ勾配を生成し、情報価値のある失敗に更新を集中させる。正則化付き検証では、すべての更新を暫定的なものとし、難しい事例での改善が、性能を保持すべき例の集合で許容できない悪化を起こさない場合にだけ採用する。 10の推論ベンチマーク、3つの評価・最適化モデル、および確立されたプロンプト最適化のベースラインを用いた評価で、STEVEは性能悪化を減らし、より頑健なプロンプトを生成した。さらに、gpt-5.4-miniとgpt-5.4を用い、記号推論、GSM8K-Platinum、DS-1000で追加評価したところ、より新しいモデルと大きなテスト集合でも改善が維持された。したがってSTEVEは、テキスト勾配によるプロンプト最適化の安定性と有効性を高める実践的な方法を提供する。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-20(UTC)
- 最新改訂
- 2026-09-20 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-20 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Textual-gradient methods automate prompt optimization through natural-language feedback, but their iterative updates can be unstable. We identify two sources of this instability: noisy gradients produced from already-correct examples and over-specialization to hard cases that degrades performance on simpler inputs. We introduce STEVE, a stabilization framework with two coupled mechanisms. Error-Driven Refinement generates gradients only from incorrectly handled examples, concentrating updates on informative failures. Regularized Verification treats every update as provisional and accepts it only when improvement on hard cases does not cause unacceptable regression on a preservation set. Across ten reasoning benchmarks, three evaluator/optimizer models, and established prompt-optimization baselines, STEVE reduces degradation and produces more robust prompts. Additional evaluations with gpt-5.4-mini/gpt-5.4 on symbolic reasoning, GSM8K-Platinum, and DS-1000 show that these gains persist with newer models and larger test sets. STEVE therefore provides a practical way to improve the stability and effectiveness of textual-gradient prompt optimization.
著者のコメント
Accepted to Findings of the Association for Computational Linguistics: AACL-IJCNLP 2026
arXiv ID: 2609.23716 / 要約の誤りについて