統計表から生成した「すべて・一部」の主張をコードで検査
From Tables to Quantified Statements: Evaluating LLM Inference Generation through Executable Verification
この論文をやさしく読む
ひとことで言うと
統計表を説明するAIの文章に含まれる「すべて」「大半」などの主張が、表の数字から本当に成り立つかをプログラムで検査します。
何に役立つ?
表の要約文が読みやすいだけでなく、論理的にデータへ忠実か評価するために役立ちます。表をどこまで説明したかや、表現の多様性も同時に見ます。
この研究の面白いところ
自然言語の主張を実行可能な真偽検査へ変換し、人の判断との一致も確かめています。正確な文だけを少数出すことで網羅性を落とす問題にも目を向けています。
どこまで分かった?
比較は4つの重み公開モデルと、統制した数量表現の課題です。検査コード自体もLLMが生成しています。人の判断との一致は報告されていますが、要旨には一致率の具体値や検査の完全性保証はありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
LLMは表から流暢な説明を生成できるが、その出力が構造化データによって論理的に裏づけられているとは限らない。本研究では、統計表から「すべて」「一部」「ない」「大半」といった数量表現を使い、数量化された自然言語の推論をLLMに生成させる、条件を統制した課題STAT-TO-TEXTを導入する。これらの推論を評価するため、LLMが生成したPythonの検査コードを実行し、対応する真偽条件が表に対して成立するか確かめる。 モデル系列と規模が異なる、重み公開の4つのLLMを比較し、忠実性、論理的正確性、表の網羅性、多様性を評価する。結果から、モデル規模と系列が影響することが分かった。最大のモデルGPT-OSS-120Bは、小規模モデルとは異なり、より広い表の網羅性と数量表現の多様性を犠牲にせず、一貫して最も忠実な推論を生成した。人によるアノテーションもこれらの結果を支持しており、自動検査器の判定は人の判断とよく一致した。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-21(UTC)
- 最新改訂
- 2026-09-21 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-21 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
LLMs can generate fluent descriptions from tables, but their outputs may remain logically unsupported by the structured data. We introduce STAT-TO-TEXT, a controlled task in which LLMs generate quantified natural language inferences from statistical tables using quantified constructions such as all, some, no, and most. To evaluate these inferences, we use an LLM generated Python checker code which when executed verifies the corresponding truth conditions against the table. We compare four open-weight LLMs across model families and scales, evaluating faithfulness, logical accuracy, table coverage, and diversity. Our results show that model scale and family matter, with the largest model (GPT-OSS-120B) consistently producing the most faithful inferences without sacrificing greater table coverage and quantifier diversity, as opposed to smaller models. These findings are supported by human annotation, which shows that the automated checker closely aligns with human judgments.
arXiv ID: 2609.23966 / 要約の誤りについて