質問を隠した資料から謎を見つけて解くベンチマーク
EnigmaForge: The Question Is Hidden in the Story
この論文をやさしく読む
ひとことで言うと
質問が明示されていない文書の中から、解くべき論理パズルを見つけて解く能力を調べる評価です。
何に役立つ?
言語モデルが資料から課題そのものを見つける能力と、事実を読み取る能力を分けて評価するのに役立ちます。
この研究の面白いところ
25モデルの比較では事実回復の差が1.6倍でも、隠された課題を解く成績には22倍の差がありました。
どこまで分かった?
拒否を失敗として数えると内容フィルターの挙動も混ざります。評価は生成された論理パズルに基づいています。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
多くのベンチマークはモデルに質問を与えるが、EnigmaForgeは古い文書の束だけを渡し、質問は与えない。手紙、領収書、記録簿の余白に小さな論理パズルが隠されている。生成時にSATソルバーで解が一意であることを証明し、各手掛かりが必要であることを、取り除いた場合の証明書で示す。問題例は収集するのではなく生成するため、データ集合を継続的に更新できる。主な指標は、物語だけを渡されたときの課題成功率で測る「直感」であり、世界の再構成を副次的な評価軸とする。最先端モデル25種を600以上の問題例で、対応をそろえた3条件の下で実行し、17,400件の採点記録を得た。直感の評価ではモデルの順位が入れ替わった。事実の回復能力の差は最大1.6倍である一方、直感の成績差は22倍に達し、事実の回復で2位のモデルは直感では14位だった。あるモデルは質問を明示されても成績が変わらず、別のモデルは質問を与えない方が有意に良かった。複数のモデルはパズルに取りかかる前に自身の内容フィルターで阻まれた。拒否を失敗として採点するベンチマークは、気付かないうちにフィルターの挙動も測っていることになる。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-24(UTC)
- 最新改訂
- 2026-09-24 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-24 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Most benchmarks hand the model a question. EnigmaForge hands it a stack of old documents and no question at all. Buried in the letters, receipts, and logbook margins is a small logic puzzle whose solution is unique - proved by a SAT solver at generation time, with an ablation certificate showing every clue is load-bearing. Because instances are generated rather than collected, the corpus renews forever. The headline measure is intuition: task success when handed only the story, with world reconstruction as the secondary axis. Twenty-five frontier models ran over 600 instances (17,400 scored records) under three matched conditions. Intuition reshuffles the leaderboard: a 22x spread where fact recovery spans 1.6x, the second-best fact-recoverer ranks fourteenth, one model is indifferent to being told the question, and another is significantly better without it. Several models were blocked by their own content filters before reaching the puzzle - any benchmark scoring refusals as failure is quietly measuring filter behavior.
arXiv ID: 2609.30144 / 要約の誤りについて