正規の指示への応答品質を下げるプロンプト注入の研究
ENDOPROMPT: Victim-Side Pseudo-References for Utility Degradation
この論文をやさしく読む
ひとことで言うと
正当な依頼の回答品質を下げる接頭辞を、対象モデルの応答を手がかりに学習する研究です。
何に役立つ?
プロンプト注入による品質低下の評価や防御策の検討に役立つと考えられます。要旨では四モデルと七ベンチマークで平均26.8ポイントの低下を報告しています。
この研究の面白いところ
有害出力の誘導や既知の正解ラベルを必要とせず、通常の応答を擬似的な参照として使います。
どこまで分かった?
依頼ごとに接頭辞を変えること自体の追加効果は、対照実験では確立されていません。評価結果は記載されたモデルとベンチマークに関するものです。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
プロンプト注入は、有害な内容を出力させなくても、正当な課題の処理性能を下げ得る。しかし、多くの攻撃目標は課題の正解ラベルや、あらかじめ決めた目標応答に依存する。本研究では、ラベルのない指示から性能を下げる接頭辞を学習するホワイトボックス手法ENDOPROMPTを提示する。生成器は依頼文を入力とする。攻撃のない場合の対象モデルの続きの応答を擬似的な参照として使い、局所探索でその応答の尤度を下げる接頭辞を特定する。同じ指示内の比較に基づく選好学習と、その後の報酬による精緻化で、この信号を生成器に学習させる。実際の使用時には、対象モデル側で追加の探索をせず、依頼ごとに一つの接頭辞を生成する。 四つの指示調整済みモデルと、七つの無害なベンチマークの全分割で評価すると、ENDOPROMPTによる処理性能の平均変化はマイナス26.8パーセントポイントで、28組の評価条件のうち27組で低下した。失敗分析では、出力の過度な拡張と接頭辞の再利用が見られた。一方、対照実験からは、依頼内容に合わせた接頭辞の生成が追加の性能低下をもたらす優位性は確立できなかった。対象モデルから得た教師信号によって、ベンチマークの結果や所定の失敗応答を使わずに、処理性能上の弱点を見つけられる。コードは採択後に公開予定である。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-24(UTC)
- 最新改訂
- 2026-09-24 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-24 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Prompt injection can degrade benign task performance without eliciting harmful content. Yet many attack objectives depend on task labels or predefined target responses. We present ENDOPROMPT, a white-box method that learns utility-degrading prefixes from unlabeled instructions. Its generator takes the request text as input. Clean victim continuations serve as pseudo-references: local search identifies prefixes that reduce continuation likelihood, and preference fitting on comparisons within the same instruction, followed by reward refinement, distills this signal into a generator. At deployment, the generator produces one prefix per request without further victim-side search. Across four instruction-tuned models and the complete splits of seven benign benchmarks, ENDOPROMPT yields a mean utility change of -26.8 percentage points; 27 of 28 cells are negative. Failure analysis reveals output expansion and prefix reuse; the controls do not establish a degradation advantage from request matching. Victim-derived supervision can reveal utility weaknesses without benchmark feedback or prescribed failure responses. The code will be released upon acceptance.
arXiv ID: 2609.29948 / 要約の誤りについて