arXiv論文メモ
新着一覧
cs.FL / cs.CL / math.LO / math.PR · 査読状況未確認

nグラムと確率文法が表せる言語分布の違いを証明する

Contributions to the hierarchy of probabilistic languages

Lothar Sebastian Krapp and Remo Nitschke

この論文をやさしく読む

ひとことで言うと

短い直前の履歴に基づくnグラムモデルと、文の構造を規則で表す確率文法とで、生成できる文章の確率分布がどう違うかを調べた理論です。

何に役立つ?

確率的な言語モデルの表現能力を比較するための基礎になります。文章生成の品質や大規模言語モデルのベンチマーク性能を測った研究ではありません。

この研究の面白いところ

一般のPCFGならnグラムの分布を含められるのに、すべての該当規則に正の確率を与える完全結合条件を課すと、その包含関係が成り立たなくなります。

どこまで分かった?

結果は定義された確率的形式言語の厳密な一致に関するものです。近似の良さや有限の文章データ上の予測精度についての結論は要旨にはありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

nグラムモデルと確率的文脈自由文法(PCFG)が生成する確率的形式言語の理論を再検討する。nグラムモデルが生成するすべての確率言語は何らかのPCFGでも生成できる一方、PCFGが生成する確率言語の中には、どのnグラムモデルでも生成できないものがあることを証明し、確率文法について想定される階層関係を確立する。 完全結合PCFGという概念を導入する。これは、非終端記号だけを含むすべての生成規則が0ではない確率を持つ、チョムスキー標準形のPCFGである。主要な結果として、nグラムモデルが生成するどの確率言語も、完全結合PCFGが生成するどの確率言語とも異なることを示す。したがって、nグラムモデルが生成する確率言語のクラスは、完全結合PCFGが生成するクラスの部分集合ではない。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-20(UTC)
最新改訂
2026-09-20 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

We reconsider the theory of probabilistic formal languages generated by n-gram models and by probabilistic context-free grammars (PCFGs). The expected hierarchy of probabilistic grammars is established by proving that every probabilistic language generated by an n-gram model is also generated by some PCFG, while some probabilistic languages generated by PCFGs cannot be generated by any $n$-gram model. We introduce the notion of fully connected PCFGs, namely PCFGs in Chomsky normal form where every production rule only involving non-terminals has non-zero probability. Our main result shows that any probabilistic language generated by an $n$-gram model differs from any probabilistic language generated by a fully connected PCFG. Therefore, the class of probabilistic languages generated by $n$-gram models is not a subset of the class generated by fully connected PCFGs.

arXiv ID: 2609.23567 / 要約の誤りについて