arXiv論文メモ
新着一覧
cs.CR / cs.LG · 査読状況未確認

偽の製品説明がLLMのマルウェア判定をゆがめる

ALIBI: Adversarial Legitimacy Injection in Binary Input against LLM Malware Analyzers

Hyeongjun Choi, Wonyoung Jung, Haehoon Seo, Sungyup Nam

この論文をやさしく読む

ひとことで言うと

悪意あるバイナリに無害なセキュリティ製品を装う説明を入れると、LLMによるマルウェア判定がその説明に引きずられることを調べた研究です。

何に役立つ?

LLMを使う解析工程で、攻撃者が書ける説明と検証済みの事実を分ける必要性を示します。解析結果の信頼性評価や、証拠の出所を確認する防御設計に関係します。

この研究の面白いところ

直接命令する文章ではなく、不審な挙動を正当化する物語で判断が変わります。PEの評価ではGeminiが元々悪性と判定した35件中30件を無害へ変更し、別モデルでは判定名が変わらなくても深刻度や確信度が下がりました。

どこまで分かった?

固定したPE 50件とELFでの評価結果です。検証を促す防御でも悪性から無害への判定が42.9%残ったと報告しますが、すべてのマルウェアや解析構成で同じ割合になるとは示していません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

大規模言語モデルは、静的な証拠を要約し、分析担当者向けの判定を出す推論要素として、マルウェアの初期分析の作業工程に組み込まれつつある。本論文は、その推論能力そのものが新しい攻撃面を生むことを示す。最先端のLLMベースのマルウェア解析器に対する、意味的な偽装説明攻撃ALIBIを提示する。ALIBIは、インポートや実行時の振る舞いを変更せずに、一貫しているが虚偽のセキュリティ製品の説明を収めた、実行されない小さな読み取り専用セクションをコンパイル済みバイナリへ追加する。モデルに直接指示を出す代わりに、不審な証拠を、無害なエンドポイントセキュリティツールに期待される動作として再解釈させる。 悪意あるサンプル50個からなる固定したPE集合では、Gemini 2.5 Proに対し、基準時点で悪性と判定された35個のうち30個を、このペイロードによって無害判定へ反転させた。一方、GPT-5.5 ProとClaude Opus 4.7では、判定ラベルが維持される場合にも、深刻度が大幅に引き下げられ、確信度が顕著に低下した。この攻撃はELFバイナリにも転用でき、Geminiでは40個中16個の判定が反転した。 検証を促す防御プロンプトによって無害判定はおよそ半減したが、それでも悪意あるサンプルの42.9%が無害判定に至った。したがって、LLMによるマルウェア解析器には、説明を信用するのではなく、検証済みの事実と攻撃者が制御する主張を区別する出所確認が必要である。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-17(UTC)
最新改訂
2026-09-17 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Large language models are being integrated into malware triage workflows as reasoning components that summarize static evidence and produce analyst-facing verdicts. This paper shows that the same reasoning capability introduces a new attack surface. We present ALIBI, a semantic cover story attack against frontier LLM-based malware analyzers. ALIBI adds a small, non-executed read-only section to a compiled binary, containing a coherent but false security product narrative, without altering imports or executable behavior. Instead of issuing direct instructions to the model, it reframes suspicious evidence as expected behavior of a benign endpoint security tool. On a frozen PE set of 50 malicious samples, the payload flips 30 of the 35 baseline-malicious samples to benign on Gemini 2.5 Pro, while GPT-5.5 Pro and Claude Opus 4.7 produce substantial severity downgrades with significant confidence reductions even when verdict labels are preserved. The attack transfers to ELF binaries, where Gemini flips 16 of 40. A verification-guided defense prompt roughly halves the benign verdicts, but 42.9 percent of malicious samples still reach benign. LLM malware analyzers therefore require provenance checks that separate verified facts from attacker-controlled claims, not narrative trust.

著者のコメント

12 pages, 4 figures, 4 tables

arXiv ID: 2609.19722 / 要約の誤りについて