ランダムな文字列に何種類の部分文字列があるか
The Expected Number of Distinct Substrings in an Alphabet String
この論文をやさしく読む
ひとことで言うと
ランダムに文字を並べた列の中に、重複を除くと何種類の連続した文字列が現れるかを調べる数学研究です。長さ一文字から列全体までを数えます。
何に役立つ?
文字列の多様さを確率的に理解する基礎になります。各文字が同じ確率で出る場合と、出やすさが異なる場合の両方を扱います。
この研究の面白いところ
一つの長さの部分文字列だけでなく、すべての長さをまとめた種類数の期待値に注目しています。
どこまで分かった?
文字は独立同分布に生成される設定です。要旨には証明した期待値の具体式や漸近評価が載っておらず、自然言語など依存のある文字列への結論は読み取れません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
独立同分布の試行列X={X₁, X₂, …, Xₙ}を考えます。各試行では、p(Xᵢ=j)=1/d(j=1, 2, …, d)、またはより一般に、p(Xᵢ=j)=pⱼ、Σ₁≤ⱼ≤d pⱼ=1とします。Xに含まれる、長さ1≤k≤nのあらゆる長さの相異なる部分文字列の数を数える変数Dを考え、その期待値E(D)に関する結果を証明します。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-16(UTC)
- 最新改訂
- 2026-09-16 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-16 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Consider a sequence of i.i.d.~trials $X=\{X_1, X_2, \ldots, X_n\}$ where $p(X_i=j)={1}/{d}; j=1,2,\ldots, d$, or more generally $p(X_i=j)=p_j; \sum_{1\le j\le d}p_j=1$. We consider the variable $D$ that counts the number of distinct substrings of all lengths,$1\le k\le n$ in $X$ and prove results concerning $E(D)$.
著者のコメント
13 pages
arXiv ID: 2609.19409 / 要約の誤りについて