LLMのゲーム判断は履歴から推論しているのかを調べる
Recursive Reasoning or Statistical Extrapolation? In-Context Learning in Multi-Agent Interdependent Decision-Making
この論文をやさしく読む
ひとことで言うと
相手の考えを読んで判断するゲームで、LLMが過去の傾向を利用しているだけなのか、戦略を推論しているのかを、履歴の統計を変えて調べています。
何に役立つ?
長い履歴で成績が良くなっただけでは推論能力の向上と判断できないことを検討する評価方法になります。
この研究の面白いところ
履歴に依存しない均衡を基準に置き、履歴のパターンを壊したときの性能低下と相互依存の強さを対応させています。
どこまで分かった?
公共財ゲームを用いた特定の戦略的環境での結果です。統計的外挿と整合的という結論であり、LLMがあらゆる課題で推論しないと証明したものではありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
文脈内学習(ICL)によって、LLMエージェントは相互作用の履歴を使って意思決定を改善できる。しかし、その改善が内部の推論の洗練を反映しているのか、単に統計的パターンを外挿しているだけなのかは明らかでない。これらの機構を切り分けるため、再帰的な信念推論を必要とする、複数エージェントの不完備情報ゲームでLLMエージェントを研究する。 公共財ゲームを構成し、過去のフィードバックの統計構造を操作することで、履歴に依存しない合理的期待均衡(REE)を基準として意思決定の質を評価する。実験では、履歴の統計的パターンを崩すと、文脈を長くする利点が大部分失われ、意思決定の質が文脈なしの基準まで低下することが分かった。この低下は、戦略的な相互依存が強いほど大きく増幅された。 これらの結果は、このような戦略的環境では、ICLの挙動は戦略的推論より統計的外挿と整合的であることを示唆する。本研究はICLの機構の研究を戦略的なマルチエージェント設定へ拡張し、推論と外挿を区別する診断手段としてREEを導入する。また、再帰的な信念を扱う課題におけるLLM推論の境界を調べる、再利用可能な枠組みを提供する。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-16(UTC)
- 最新改訂
- 2026-09-16 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-16 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
In-context learning (ICL) enables large language model (LLM) agents to improve decisions using interaction history, yet it remains unclear whether such improvement reflects refined internal reasoning or mere extrapolation of statistical patterns. To disentangle these mechanisms, we study LLM agents in multi-agent incomplete-information games that require recursive belief reasoning. By constructing a public goods game and manipulating the statistical structure of historical feedback, we evaluate decision quality against a history-independent rational expectations equilibrium (REE) benchmark. Our experiments reveal that when historical statistical patterns are disrupted, the benefits of longer context largely vanish, degrading decision quality to the no-context baseline in a way sharply amplified by stronger strategic interdependence. These results suggest that, in such strategic environments, ICL behavior is more consistent with statistical extrapolation than with strategic reasoning. Our work extends the mechanistic study of ICL to strategic multi-agent settings, introduces REE as a diagnostic tool for distinguishing reasoning from extrapolation, and provides a reusable framework for probing the boundaries of LLM reasoning in recursive belief tasks.
arXiv ID: 2609.18591 / 要約の誤りについて