nグラムと確率文法が表せる言語分布の違いを証明する
Contributions to the hierarchy of probabilistic languages
この論文をやさしく読む
ひとことで言うと
短い直前の履歴に基づくnグラムモデルと、文の構造を規則で表す確率文法とで、生成できる文章の確率分布がどう違うかを調べた理論です。
何に役立つ?
確率的な言語モデルの表現能力を比較するための基礎になります。文章生成の品質や大規模言語モデルのベンチマーク性能を測った研究ではありません。
この研究の面白いところ
一般のPCFGならnグラムの分布を含められるのに、すべての該当規則に正の確率を与える完全結合条件を課すと、その包含関係が成り立たなくなります。
どこまで分かった?
結果は定義された確率的形式言語の厳密な一致に関するものです。近似の良さや有限の文章データ上の予測精度についての結論は要旨にはありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
nグラムモデルと確率的文脈自由文法(PCFG)が生成する確率的形式言語の理論を再検討する。nグラムモデルが生成するすべての確率言語は何らかのPCFGでも生成できる一方、PCFGが生成する確率言語の中には、どのnグラムモデルでも生成できないものがあることを証明し、確率文法について想定される階層関係を確立する。 完全結合PCFGという概念を導入する。これは、非終端記号だけを含むすべての生成規則が0ではない確率を持つ、チョムスキー標準形のPCFGである。主要な結果として、nグラムモデルが生成するどの確率言語も、完全結合PCFGが生成するどの確率言語とも異なることを示す。したがって、nグラムモデルが生成する確率言語のクラスは、完全結合PCFGが生成するクラスの部分集合ではない。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-20(UTC)
- 最新改訂
- 2026-09-20 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-20 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
We reconsider the theory of probabilistic formal languages generated by n-gram models and by probabilistic context-free grammars (PCFGs). The expected hierarchy of probabilistic grammars is established by proving that every probabilistic language generated by an n-gram model is also generated by some PCFG, while some probabilistic languages generated by PCFGs cannot be generated by any $n$-gram model. We introduce the notion of fully connected PCFGs, namely PCFGs in Chomsky normal form where every production rule only involving non-terminals has non-zero probability. Our main result shows that any probabilistic language generated by an $n$-gram model differs from any probabilistic language generated by a fully connected PCFG. Therefore, the class of probabilistic languages generated by $n$-gram models is not a subset of the class generated by fully connected PCFGs.
arXiv ID: 2609.23567 / 要約の誤りについて