arXiv論文メモ
新着一覧
cs.CL / cs.AI / cs.LO · 査読状況未確認

変化する状態空間で言語モデルの推論を測る

PetriBench: Benchmarking LLM Reasoning over Dynamic State Spaces

Pyrros Koussios, Benjamin Jäger, John Hua Yao, Ajay Sridhar, Violet Xiang, Chenhao Li

この論文をやさしく読む

ひとことで言うと

状態が行動によって変わる仕組みを、言語モデルがどこまで正しく追えるかをPetriネットで測る評価です。

何に役立つ?

外部知識に頼らず、並行処理や分散システムにも関係する動的な推論能力を比較する用途があります。正解を厳密に求められる課題を生成します。

この研究の面白いところ

推論の範囲と時間的な長さが異なる四種類の課題を、構造の複雑さで三段階に分けています。推論時の計算量を増やす効果も課題ごとに異なると報告しています。

どこまで分かった?

評価した非公開・公開重みモデルでは難度とともに精度が低下しました。要旨にはモデル別の得点はなく、この評価だけで推論能力全般を網羅したとはいえません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

大規模言語モデル(LLM)の推論能力を特徴付けることは、依然として未解決の課題である。既存の多くのベンチマークは特定の推論技能を切り離して扱うか、外部知識に依存するか、拡張に大きな費用がかかる。本研究では、ペトリネットを用いて動的状態空間でのLLMの推論を評価する、コンパクトで完全に自己完結し、規模を拡張できるベンチマークPetriBenchを導入する。ペトリネットは、実世界の並行・分散システムをモデル化するための成熟した形式体系である。 PetriBenchは、対象範囲と時間的な見通しの長さが異なる4種類の課題群に推論を整理する。構造の複雑さを高めてEasy、Medium、Hardの各水準を生成し、厳密な正解に照らして評価する。多様な商用モデルと重み公開モデルでは、難易度が上がるにつれて正解率が一貫して低下し、難しい問題ほど課題ごとの能力の違いが明瞭になる。追加分析では、テスト時の計算量を増やすと性能は向上するものの、その影響は推論課題によって異なること、手続き的な生成によって構造の複雑さに応じた滑らかなスケーリングが得られることを示す。これらの結果は、PetriBenchがLLM推論の強み、限界、スケーリング特性を調べるための統一的で拡張可能な環境を提供することを示している。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-17(UTC)
最新改訂
2026-09-17 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Characterizing LLM reasoning remains an open challenge, as many existing benchmarks isolate specific reasoning skills, rely on external knowledge, or are costly to extend. We introduce PetriBench, a compact, fully self-contained, and scalable benchmark for evaluating LLM reasoning over dynamic state spaces using Petri nets, a mature formalism for modeling real-world concurrent and distributed systems. PetriBench organizes reasoning into four task families varying by scope and temporal horizon, with Easy, Medium, and Hard levels generated by increasing structural complexity and evaluated against exact ground truth. Across a diverse set of proprietary and open-weight models, accuracy decreases consistently with difficulty, while harder instances expose increasingly distinct task-specific capability profiles. Additional analyses show that test-time compute improves performance but interacts differently with different reasoning tasks, and that procedural generation yields smooth scaling with structural complexity. Together, these results show that PetriBench provides a unified and extensible setting for probing the strengths, limits, and scaling behavior of LLM reasoning.

arXiv ID: 2609.19883 / 要約の誤りについて