タイ語の多分野資料から作った3億4200万語の構文コーパス
ThaiTrees: Thai Syntactic Dependency Trees Across Domains
この論文をやさしく読む
ひとことで言うと
タイ語のニュースや会話などを自動で構文解析し、文法の使われ方を大量に調べられるコーパスを作った研究です。
何に役立つ?
タイ語の文法関係の検索や、分野ごとの統語パターンの定量分析に使えます。
この研究の面白いところ
既存の人手注釈データを使った解析器の評価だけでなく、多分野にわたる3億4200万トークンの解析結果そのものを研究資源として公開しています。
どこまで分かった?
構文解析は自動処理であり、要旨には解析精度や分野別の誤り率は示されていません。人手で全件の構文を確認したコーパスとは述べていません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
自然に使われる言語の統語パターンを研究するには、大規模な構文解析済みコーパスが必要だが、人手による注釈は費用がかかり、規模を大きくしにくい。タイ語には構文解析器の学習と評価に使える、人手で注釈された依存構造ツリーバンクがある一方、定量的な統語研究に使える大規模な自動解析済みコーパスがなかった。本研究は、ニュース、ウィキペディア、話し言葉の書き起こし、ソーシャルメディアから集めた3億4200万トークンのコーパス ThaiTrees を提示する。Universal Dependencies の枠組みの下でタイ語の文章を洗浄、処理、解析する再現可能な工程を開発した。得られたコーパスでは文法関係を検索でき、統語分布の研究を支える。AIの支援を使う分析と従来のプログラムによる分析の両方に適した機械可読形式で、頻度辞書と CoNLL-U 形式の構文解析結果を公開する。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-23(UTC)
- 最新改訂
- 2026-09-23 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-23 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Studying syntactic patterns in naturally occurring language requires a large parsed corpus, but manual annotation is costly and difficult to scale. Thai has a manually annotated dependency treebank for training and evaluating parsers, but lacks a large automatically parsed corpus for quantitative syntactic research. We present ThaiTrees, a 342M-token corpus drawn from news, Wikipedia, spoken transcripts, and social media. We develop a reproducible pipeline for cleaning, processing, and parsing Thai text under the Universal Dependencies framework. The resulting corpus makes grammatical relations searchable and supports the study of syntactic distributions. We release a frequency lexicon and CoNLL-U parses in machine-readable formats suitable for both AI-assisted and conventional programmatic analysis.
arXiv ID: 2609.27558 / 要約の誤りについて