品質を確認しながら学習済み言語モデルの注意層を置き換える
TinyCeNN-LM: Quality-Gated Conversion of Pretrained Attention with CeNN-Inspired Cellular-Recurrent Layers
この論文をやさしく読む
ひとことで言うと
学習済みモデルの注意機構を軽い別構造へ変える際、性能と内部表現を調べて、問題のない層だけ採用する方法です。
何に役立つ?
考えられる用途は、既存言語モデルの品質を大きく変えずにメモリ構造を調整することです。最大6.01%のキャッシュ削減が報告されています。
この研究の面白いところ
出力のNLLが許容範囲でも内部表現が変わりすぎた層は戻します。出力指標だけで置換の成否を決めない点が特徴です。
どこまで分かった?
著者自身が万能な注意置換や高速化を主張していません。下流評価は200項目の簡易確認で、報告正解率も限定的な検証の結果です。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
学習済み言語モデルの注意機構を置き換えることは、互換性の問題である。もっともらしい代替手段でも、後続層が期待する表現を変えてしまうおそれがある。TinyCeNN-LMは、CeNNに着想を得たセル型再帰層を用いる、品質判定付きの学習後変換の枠組みを導入する。そこには、範囲を限定した局所処理、小さな再帰メモリ、経路選択、融合、そして採用または巻き戻しを決める検証が含まれる。 Integrated Memory、MemoryFusion、PDelta3-GDN2-CLVR+Local32の三つの実装を調べる。厳格なPDelta3変換では、表現と負の対数尤度(NLL)の基準が固定しきい値を満たした場合にだけ層を採用する。SmolLM2-135Mでは0〜2層が採用され、累積ΔNLLは+0.01209となる。一方、3層はNLLが許容範囲でも、表現の忠実度を満たさず却下される。Qwen3.5-0.8Bでは、全体注意を行う3、7、11層が採用され、最終ΔNLLは+0.02073となる。 Integrated Memoryは、パープレキシティの変化を−0.07%から+0.93%の範囲に保ちつつ、キャッシュ総量を最大6.01%削減する。標本抽出した200項目の下流課題の簡易確認では、変換したQwen公開版の全体正解率は28.5〜32.0%となる。結果が支持するのは、品質判定に基づく慎重な構造変換であり、注意機構の普遍的な置換や高速化ではない。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-17(UTC)
- 最新改訂
- 2026-09-17 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-17 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Replacing attention in a pretrained language model is a compatibility problem: a plausible substitute may alter representations expected by later layers. TinyCeNN-LM introduces a \emph{quality-gated post-training conversion} framework using CeNN-inspired cellular-recurrent layers with bounded local processing, compact recurrent memory, routing, fusion, and accept-or-rollback validation. Three implementations are studied: Integrated Memory, MemoryFusion, and PDelta3-GDN2-CLVR+Local32. Strict PDelta3 conversion accepts a layer only when representation and NLL criteria pass fixed thresholds. On SmolLM2-135M, layers 0-2 are accepted with cumulative $\Delta\mathrm{NLL}=+0.01209$, while layer 3 is rejected despite acceptable NLL because representation fidelity fails. On Qwen3.5-0.8B, full-attention layers 3, 7, and 11 are accepted with final $\Delta\mathrm{NLL}=+0.02073$. Integrated Memory keeps perplexity within $-0.07\%$ to $+0.93\%$ while reducing total cache by up to $6.01\%$. A sampled 200-item downstream sanity check gives $28.5\%$--$32.0\%$ overall accuracy for converted Qwen releases. The results support conservative, quality-gated structural conversion rather than universal attention replacement or speedup.
arXiv ID: 2609.21139 / 要約の誤りについて