AIが書いたコードの検出性能は生成モデルが変わると保てるか
Code Detectors Have a Half-Life: Obsolescence and Metric Illusions in LLM-Generated Code Detection
この論文をやさしく読む
ひとことで言うと
コードを人とAIのどちらが書いたか見分ける仕組みは、生成AIやプロンプトが変わると性能が変わります。正解率だけでは、一方の分類に偏った検出器を見逃すことも調べています。
何に役立つ?
コードの由来を判定するツールの評価で、どの生成モデルや指標を使うべきかを検討する材料になります。研究は、複数生成器での評価とクラス別の成績の報告を勧めています。
この研究の面白いところ
「半減期」という呼び方で世代交代への弱さを捉え、さらに指標による見え方の問題も分けて示しています。専用検出器より汎用LLM評価者が良い場合がある点も比較しています。
どこまで分かった?
評価対象は3言語、7生成器、8つの汎用評価者、3つの専用検出器です。要旨は正解率0.50とF1 0.00を報告していますが、そのF1の対象クラスや集計方法は記載していません。「半減期」の具体的な時間長を測定したとは述べていません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
コード生成モデルが進化すると、コード検出器は陳腐化し得る。ある世代のモデルで検証された検出器が、次の世代にも通用するとは限らない。本研究では、この限られた有効寿命を検出器の半減期と呼ぶ。C++、Java、Pythonについて、人が書いたコードと7つの生成器が作ったコードを用い、8つの汎用LLM評価者と3つの専用検出器を評価する。 結果から2つの問題が明らかになった。第1に、性能は生成器やプロンプト戦略によって大きく変動し、一部の検出器はコードの由来を一般的に示す証拠ではなく、生成器に固有のパターンに依存していることが示唆される。第2に、正解率は深刻な予測の偏りを隠し得る。DetectCodeGPTとGPT-Snifferは、ほぼすべてのサンプルをAI生成と分類したため、すべての生成器にわたり正解率0.50、F1スコア0.00となった。一方、汎用LLM評価者は、より高い正解率とF1スコアを達成した。 これらの結果は、汎用LLMが追加学習を必要としないコードの由来の評価者として有望で、専用検出器を上回り得ることを示している。ただし、その信頼性は評価モデル、コード生成器、プロンプト戦略に依存する。このため、LLM評価者を複数の生成器で評価し、クラス別の適合率・再現率とともにマクロF1を報告することを推奨する。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-10-01(UTC)
- 最新改訂
- 2026-10-01 · v1
- 査読・掲載
- 掲載先の記載あり
著者による掲載先の記載:Proceedings of the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE '26), October 12--16, 2026, Munich, Germany。出版社での独立確認は未実施です。
更新履歴
- v1 2026-10-01 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Code detectors can become obsolete as code-generating models evolve: a detector validated on one generation of models may not transfer to the next. We call this limited useful life a detector half-life. We evaluate eight general-purpose LLM judges and three dedicated detectors on human-written code and code produced by seven generators across C++, Java, and Python. Our results reveal two problems. First, performance varies considerably across generators and prompting strategies, suggesting that some detectors rely on generator-specific patterns rather than general evidence of code provenance. Second, accuracy can conceal severe prediction bias. DetectCodeGPT and GPT-Sniffer achieved an accuracy of 0.50 but an F1 score of 0.00 across all generators because they classified almost every sample as AI-generated. However, general-purpose LLM judges achieved stronger accuracy and F1 scores. Our results show that general-purpose LLMs are promising training-free judges of code provenance and can outperform dedicated detectors. However, their reliability depends on the judge model, the code generator, and the prompting strategy. We therefore recommend evaluating LLM judges across multiple generators and reporting macro-F1 alongside class-specific precision and recall.
arXiv ID: 2610.01664 / 要約の誤りについて