スキル間の引き継ぎがAIの不正操作につながる仕組み
Chaining Skills to Hijack LLM Agents
この論文をやさしく読む
ひとことで言うと
複数のスキルを使うAIで、進捗記録に混じった偽の承認が次の操作の根拠として扱われる問題を評価しています。
何に役立つ?
スキルの出力や引き継ぎ記録を、ユーザー本人の承認と区別する防御の評価に役立ちます。報告値は指定されたベンチマークでの攻撃・防御実験です。
この研究の面白いところ
単独のスキルよりも連鎖したスキルの方が高い成功率を示しました。一方、元の依頼との照合を促す防御は、攻撃成功と正当な作業の成功をともに下げています。
どこまで分かった?
評価は6モデル、4種類の標的行動群などの設定に基づきます。防御を入れても攻撃成功率は59.1%残っており、完全な防御を実証したものではありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
LLMエージェントは、専門的なタスクの性能を高めるためにスキルを利用する。ユーザーの依頼を完了するため、複数のスキルを順に呼び出すことがあり、あるスキルのもとで生成された情報が次のスキルの判断を導く。スキルはオープンソースのリポジトリから取得される場合があるため、この引き継ぎを通じて、攻撃者が制御する主張も後続の判断へ持ち込まれうる。 本稿では、ユーザーのタスクと攻撃者が選んだ行動に合わせて、敵対的なスキルの連鎖を構築・改良するAPEXを提案する。中心的な着想は、エージェント自身が書いた実際のタスク進捗記録が、ユーザーの承認を得たという虚偽の主張をスキル間で運びうるというものである。上流のスキルがエージェントにその記録を作らせ、下流のスキルが記録を使って攻撃者の選んだ行動へ誘導する。 SkillsBench上の6モデルと4種類の標的行動群において、この連鎖は690回の試行中512回(74.2%)で指定した行動を引き起こした。GPT-5.4では、完全な連鎖の成功率は84.3%であり、同じ作業の流れを1つのスキルにまとめた場合の17.4%を上回った。さらに、スキルが生成したファイルを元の依頼と照合するようエージェントに求める、プロンプトによる防御を評価した。GPT-5.4では標的行動の成功率を84.3%から59.1%へ下げた一方、72件の無害な標準スキルタスクにおける検証器のテスト合格率は86.7%から56.3%へ低下した。これらの結果は、正当なタスクの性能を保ちながら、攻撃者に誘導された行動を防ぐ防御策が必要であることを示す。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-10-01(UTC)
- 最新改訂
- 2026-10-01 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-10-01 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
LLM agents use skills to improve performance on specialized tasks. To complete a user request, an agent may invoke several skills in sequence, allowing information produced under one skill to guide the next. Because skills may come from open-source repositories, this handoff can also carry attacker-controlled claims into later decisions. In this paper, we introduce APEX, which constructs and refines adversarial skill chains tailored to a user task and an attacker-selected action. The key insight is that an agent-written record of genuine task progress can carry a false claim of user approval across skills: an upstream skill induces the agent to create the record, and a downstream skill uses it to direct the attacker-selected action. Across four targeted-action families and six models on SkillsBench, the chains induce the selected action in 512 of 690 attempts (74.2%). On GPT-5.4, the full chain succeeds in 84.3% of attempts, compared with 17.4% when the workflow is merged into one skill. We further evaluate a prompting defense that asks the agent to check skill-produced files against the original request. On GPT-5.4, it lowers targeted-action success from 84.3% to 59.1%, while the verifier test-pass rate across 72 benign native-skill tasks falls from 86.7% to 56.3%. These results highlight the need for defenses that prevent attacker-directed actions while preserving legitimate task performance.
arXiv ID: 2610.01564 / 要約の誤りについて