言語モデル内部の品詞情報は特徴群に分散する
Parts-of-Speech as Emergent Categories in SAE Latent Space
この論文をやさしく読む
ひとことで言うと
言語モデル内部の品詞情報は、一つの特徴が一つの品詞に対応するのではなく、少数の特徴の組み合わせに分散していると調べます。
何に役立つ?
SAEで言語モデルの内部を解釈する際、単一の潜在変数だけで文法的な役割を説明しないための参考になります。
この研究の面白いところ
品詞の違いは高く復元できますが、関連する品詞の特徴群は重なり、開いた品詞と閉じた品詞でも様子が異なります。
どこまで分かった?
要旨には対象モデルや具体的な復元率は記載されていません。ほかの言語的な性質も同じ構造かは判断できません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
疎なオートエンコーダ(SAE)は言語モデルの内部表現を調べる有望な方法だが、その潜在表現がどのような言語構造を示すかは、まだはっきりしていない。本研究は品詞を制御された試験例として用い、形態統語的な情報が個々の潜在変数に符号化されるのか、それとも構造化された特徴群に含まれるのかを調べる。 品詞の違いはSAEの活性化から高い精度で復元できるが、潜在変数と品詞が一対一に対応するわけではなかった。この復元可能性は単語そのものの記憶だけでは説明できず、開いた品詞群と閉じた品詞群では大きな違いがある。各品詞は少数の疎な潜在変数の集まりに支えられるが、その構成は品詞タグごとにかなり異なる。特徴群は学習時に使わなかったデータでも安定している一方、関連する品詞群の間では重なりもある。これらの結果は、SAEが形態統語的な情報を、単独の原子的な文法特徴としてではなく、分散し品詞に応じて異なる形で局在化することを示す。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-24(UTC)
- 最新改訂
- 2026-09-24 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-24 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Sparse AutoEncoders (SAEs) offer a promising way to inspect language model representations, but it is still unclear what kind of linguistic structure their latents expose. We use part-of-speech (PoS) categories as a controlled test case to study whether morpho-syntactic information is encoded by individual latents or by structured groups of features. We find that PoS distinctions are highly recoverable from SAE activations, but do not align with one-to-one latent / category mappings. This recoverability is not reducible to lexical memorisation, and Open and Closed PoS classes differ substantially. Categories are supported by compact groups of sparse latents, with substantial variation across tags. These groups remain stable on held-out data, while also showing overlap between related categories. Our results show that SAEs localise morpho-syntactic information in a distributed and category-dependent form rather than through atomic grammatical features.
arXiv ID: 2609.29362 / 要約の誤りについて