言語ごとのトークンの分離が知識の共有を妨げる
Why Pretraining Fails to Share Cross-Lingual Knowledge
この論文をやさしく読む
ひとことで言うと
ある言語で学んだ知識を別の言語で使いにくい理由を、文章を表すトークンの違いから調べた研究です。内容が同じ文章でも、使うトークンを完全に分けるだけで知識が共有されにくくなりました。
何に役立つ?
多言語モデルの学習データやトークン表現を設計する際の手掛かりになります。単語ごとの翻訳で表現を共通化する方法が、評価した設定で知識転移を改善しました。
この研究の面白いところ
言語の文法や内容の違いを取り除き、同一言語のコピーを使って原因を切り分けています。自然言語同士の比較では混ざりやすい要因を制御した点が特徴です。
どこまで分かった?
14倍の改善後でも、報告値は母語での学習効率の最大12.6%です。完全な知識共有を達成したわけではありません。制御実験と評価モデルでの結果であり、あらゆる言語やモデルへの効果は要旨からは確定できません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
大規模言語モデル(LLM)は、多くの言語の処理とモデル化で目覚ましい進歩を遂げてきた。しかし、人間の多言語話者とは異なり、言語をまたぐ知識転移は驚くほど限られている。この制約は十分に報告されているものの、多言語学習の過程でどこから生じるかは明らかでない。パラメータ数3億6000万および70億のLLMを事前学習し、言語をまたぐ知識の汎化が乏しい状態が事前学習中に現れ、標準的な介入を行っても続くことを示す。 原因を切り分けるため、同じ言語を2つに複製し、同一のテキストとトークン分割を共有しつつ、互いに重ならないトークン空間へ写像した、制御された二言語事前学習の設定を用いる。互いに重ならないトークンだけで、同じ言語の同一内容の複製同士であっても知識の区画化を引き起こすのに十分であることを見いだす。これにより、トークン空間の分離が、言語をまたぐ知識汎化の根本的な障壁であることを示す。 この理解に基づき、単純な単語単位の翻訳によって言語を共通のトークン空間へ写像する方法を提案する。その結果、言語間の知識汎化が大幅に改善し、母語での学習効率の最大12.6%まで回復することを見いだす。これは基準手法の14倍である。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-16(UTC)
- 最新改訂
- 2026-09-16 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-16 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Large Language Models (LLMs) have made remarkable progress in the processing and modeling of many languages. Yet, unlike human multilinguals, they exhibit surprisingly limited cross-lingual knowledge transfer. While this limitation is well documented, its origins during multilingual training remain unclear. We pretrain 360M- and 7B-parameter LLMs and show that poor cross-lingual knowledge generalization emerges during pretraining and persists under standard interventions. To isolate its cause, we employ a controlled bilingual pretraining setting using two copies of the same language, sharing identical text and token segmentation, but mapped to disjoint token spaces. We find that disjoint tokens alone are enough to induce knowledge compartmentalization, even between identical copies of the same language, establishing disjoint token spaces as a fundamental barrier to cross-lingual knowledge generalization. Guided by this understanding, we suggest mapping languages into a shared token space by simple word-wise translation and find it substantially improves cross-lingual knowledge generalization, recovering up to 12.6\% of native-language learning efficiency --- 14$\times$ the baseline.
arXiv ID: 2609.19291 / 要約の誤りについて