arXiv論文メモ
新着一覧
stat.ME / math.ST / stat.TH · 査読状況未確認

歴史的な中国語記事から言葉の変化点を検出する

Laplacian U-Processes for Multiple Change-Point Detection in Dependent Text Networks: An Application to Historical Chinese Articles

Fanghua Chen, Yizhou Cai, Lu zhou and Ting Fung Ma

この論文をやさしく読む

ひとことで言うと

単語が直接一緒に現れる関係と、似た文脈で使われる関係を照らし合わせ、文章群の使う言葉がいつ変わったかを探す研究です。『新青年』では1919年11月を変化点として検出しました。

何に役立つ?

時系列の文献で、語彙の使われ方が変わった時期を調べる分析に役立ちます。実証例は歴史資料であり、社会運動が言語変化の原因だったことまで示すものではありません。

この研究の面白いところ

単語の頻度だけでなく、2種類の関係の結び付きが変わることを捉えます。依存する文書データの統計理論と、実際の歴史コーパスでの検出を組み合わせています。

どこまで分かった?

変化点の一致性は、識別可能な変化が1つある条件で示されています。報告された95%区間は記述的な安定性区間であり、要旨では通常の信頼区間とは位置付けていません。歴史的な時期との整合は因果関係の検証ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

弱い依存関係を持つテキストネットワークを対象に、オフラインで変化点を検出するための、2つの観点に基づく重み付き一致度作用素(WCO)の枠組みを提案する。重み付き単語共起グラフから、直接の共起を表す1次の観点と、共通する文脈を表す2次の観点を得る。独立した予備コーパスで学習した写像を用い、これらを対になったユークリッド空間上の観測値へ射影する。WCOによる走査は、2つの観点間の依存関係の変化を検出する。依存関係を考慮した乗数ブートストラップで変化の有無を検定し、区間ごとのブロックブートストラップで、その位置について記述的な安定性区間を求める。 帰無仮説の下での弱収束、ブートストラップの妥当性、検定サイズの漸近的制御、識別可能な変化が1つある場合の位置推定の一致性、およびトークン単位の誤りに対する摂動上界を確立する。CUSUMとガウスカーネルMMDによる走査を、相補的な比較手法として用いる。1915〜1921年の『新青年』コーパスでは、1919年11月に変化を検出し、その記述的な95%安定性区間は1919年4月〜1920年6月となった。これは、中国の五四運動と新文化運動の前後における言語的な移行と整合している。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-16(UTC)
最新改訂
2026-09-16 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

We propose a two-view weighted-concordance operator (WCO) framework for offline change-point detection in weakly dependent text networks. Weighted word-co-occurrence graphs yield first-order direct-co-occurrence and second-order shared-context views, projected into paired Euclidean observations using maps learned from an independent pilot corpus. A WCO scan detects changes in cross-view dependence. A dependent multiplier bootstrap tests for a change, while a segment-wise block bootstrap gives a descriptive stability interval for its location. We establish null weak convergence, bootstrap validity, asymptotic size control, consistent localization under a single identifiable change, and perturbation bounds for token-level errors. CUSUM and Gaussian-kernel MMD scans provide complementary benchmarks. In the 1915-1921 New Youth corpus, the method detects a change in November 1919, with a descriptive 95 percent stability interval from April 1919 to June 1920, consistent with the linguistic transition surrounding China's May Fourth and New Culture movements.

著者のコメント

32 pages, 4 figures, and 2 tables. Supplementary material is not included

arXiv ID: 2609.19306 / 要約の誤りについて