不正なバックテストを見抜くLLMを正常例との対で評価する
Can LLMs Catch a Rigged Backtest? A Clean-Control Calibration Benchmark
この論文をやさしく読む
ひとことで言うと
バックテスト監査用LLMを、欠陥例と対応する正常例の両方で測り、誤警告の多さを明らかにした。
何に役立つ?
金融戦略のバックテスト監査にLLMを使う際、正常例の誤判定率も含めて評価する方法として役立つ。実際の投資成績を検証した研究ではない。
この研究の面白いところ
方法上の細部だけを変えた対照を作るため、欠陥の検出率が同じモデルでも偽陽性の差を見分けられる。
どこまで分かった?
96項目の対のベンチマークと4エンドポイント、1440件の保存済み監査結果に基づく。指示による改善はモデル間で同じではなく、低予算モデルでは正常48件中38件を誤判定した。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
バックテストの監査は、検出の較正の問題である。欠陥の検出率が高くても、対応する正常な戦略を誤って問題ありと判定するなら有用ではない。本研究では96項目からなる対のベンチマークを作成した。欠陥のある各バックテストには正常な対照を用意し、戦略、日付、コードの書き方、ラベル、報告書のひな型を固定して、方法上の細部を一つだけ変える。決定論的な採点器は、欠陥の検出率、正常対照の偽陽性、証拠箇所の特定、修正案の関連性を分けて評価する。4つのテキスト用エンドポイントから保存した1440件の監査結果では、主たるDeepSeek監査モデルは、選択肢付きで正常例を意識させた条件でコード上の欠陥を100.0%検出した。しかし自由回答の指示では、正常なコード対照の93.8%を誤って問題ありと判定した。検出率が飽和する条件でも、正常例を意識させた評価で三つの基準すべてを満たす特異度は87.5%だった。正常例に注意を促す指示により、DeepSeekのコードに関する偽陽性は20.8%(95%信頼区間11.7〜34.3%)から0.0%(同0.0〜7.4%)に下がり、検出率は変わらなかった。一方、低予算の基準モデルは同じ指示でも正常対照48件中38件を問題ありと判定した。検出率だけを報告すると4モデルのうち3モデルは同順位となるが、正常対照の誤判定率も報告すると、モデル間に79ポイントの差が現れる。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-23(UTC)
- 最新改訂
- 2026-09-23 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-23 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Backtest auditing is a calibration problem: high flaw recall is not useful when the model falsely flags matched clean strategies. We build a 96-item paired benchmark in which every flawed backtest has a clean control that holds strategy, dates, code style, labels, and reporting scaffold fixed while changing one methodology detail. A deterministic scorer separates flaw recall, clean-control false positives, evidence localization, and fix relevance. Over 1440 cached audits from four text endpoints, the primary DeepSeek auditor reaches 100.0\% closed and clean-aware code recall, but open prompts over-flag 93.8\% of clean code controls, and clean-aware all-three specificity is 87.5\% even where recall saturates. A clean-aware warning drops DeepSeek code false positives from 20.8\% (95\% CI 11.7--34.3) to 0.0\% (0.0--7.4) at unchanged recall, while the budget anchor still flags 38/48 clean controls under the same prompt. Reporting recall alone would rank three of these four models identically; reporting the clean-control rate separates them by 79 points.
arXiv ID: 2609.28090 / 要約の誤りについて