JavaScript難読化解除を段階的学習から一回の生成へ
Stage-Supervised Latent Reasoning for Single-Shot JavaScript Deobfuscation
この論文をやさしく読む
ひとことで言うと
複数段階の難読化解除の途中結果で学び、JavaScriptを一回で読みやすい形にする方法。
何に役立つ?
考えられる用途は、難読化コードの解析やセキュリティレビューを助けること。予備評価では構文が正しい出力の割合が比較方法を上回った。
この研究の面白いところ
学習時だけ段階ごとの書き換えを使い、実行時は一回の生成にまとめる。
どこまで分かった?
進行中の研究の予備的なベンチマーク結果。妥当な出力に限った意味的正しさが80%で、すべての出力で80%ではない。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
JavaScriptの難読化はコード保護に広く使われるが、プログラム解析やセキュリティレビューも大幅に難しくする。既存の大規模言語モデルによる難読化解除は、実際の解除工程に段階があることを無視し、一段階の翻訳として扱うことが多い。この進行中の研究では、段階を意識した潜在推論の枠組みを提案する。決定的な難読化解除ツールが出す中間結果を、Coconutを用いた学習の教師信号に変える。モデルは学習中に複数段階の書き換えを学ぶが、推論時には整えた最終プログラムを一回で生成する。JsDeObsBenchでの予備的な結果では、Coconutを用いたモデルの構文的妥当性は50%で、直接の追加学習の15%、事前例を与えない基準の25%を上回った。妥当な出力のうち80%は意味的にも正しく、比較対象より元の動作を保ちやすいことを示唆する。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-22(UTC)
- 最新改訂
- 2026-09-22 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-22 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
JavaScript obfuscation is widely used to protect code, but it also makes program analysis and security review substantially harder. Existing LLM-based deobfuscation methods usually treat the task as one-step translation, ignoring the staged structure of practical deobfuscation pipelines. This WIP paper proposes a stage-aware latent reasoning framework that converts intermediate outputs from a deterministic deobfuscation tool into supervision for Coconut-based training. The model learns from multi-stage rewrites during training but generates the final cleaned program in a single shot at inference time. Preliminary results on JsDeObsBench show that the Coconut-based model improves syntactic validity to 50%, compared with 15% for direct fine-tuning and 25% for a zero-shot baseline, and reaches 80% semantic correctness among valid outputs, indicating better semantic faithfulness than either comparison model in deobfuscation.
arXiv ID: 2609.27058 / 要約の誤りについて