定型出力の意思決定モデルに対するプロンプト注入
Decision Hijacking: Prompt Injection Attacks on Jev's Typed Probabilistic Decisions
この論文をやさしく読む
ひとことで言うと
選択肢から行動を選ぶ定型出力モデルでも、悪意ある入力で選択確率が変わることを510事例で調べた。
何に役立つ?
意思決定型モデルに不信頼な内容を渡すシステムの安全性評価や、出力形式以外の防御策の検討に役立つ。
この研究の面白いところ
適応的な攻撃で対象行動の確率は上がったが、新たな検証での成功率は3.5%にとどまった。
どこまで分かった?
Jevと再構成したInjecAgent事例での結果である。成功と判断差などの関係は探索的解析として報告されている。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
プロンプト注入の研究は生成型エージェントに集中しており、決まった形式で出力するモデルへの影響は十分明らかではない。本研究は、生成を行わない意思決定モデルJevを対象に、再構成したInjecAgentの510事例でその影響を調べた。悪意のある内容は行動の確率を動かしたが、攻撃者が狙う行動をJevに選ばせることはまれだった。上書き防止のマーカーは影響を減らし、文脈上関係があるという主張の効果は小さかった。 スコアのフィードバックを使う適応的攻撃は、最適化中に見つかった攻撃対象行動の最大確率の平均を2倍にした。一方、新たな検証呼び出しでの成功率は1.8%から3.5%へ上がった。探索的解析では、元の選択肢間の判断差が小さい場合や、攻撃者が観測情報をより大きく操作できる場合に成功が結び付いていた。決まった出力形式はプロンプト注入の危険を変えるが、なくすわけではない。許可された行動の中で信頼できない内容が選択へどう影響するか評価する必要がある。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-23(UTC)
- 最新改訂
- 2026-09-23 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-23 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Most studies of prompt injection focus on generative agents, leaving their effects on models with schema-defined outputs unclear. We examine these effects in Jev, a non-generative decision model, using 510 reconstructed InjecAgent cases. Malicious content shifts action probabilities but rarely causes Jev to select the attacker's target. Override markers reduce this influence, while claims of contextual relatedness have small effects. Adaptive attacks using score feedback double the mean highest attacker-target probability found during optimization, while success on fresh validation calls rises from 1.8% to 3.5%. Exploratory analysis links these successes to small initial decision margins or greater attacker control over the observation. Together, these findings show that schema-defined outputs change but do not eliminate prompt-injection risk, highlighting the need to evaluate how untrusted content influences choices within the allowed action set.
arXiv ID: 2609.28613 / 要約の誤りについて