対数の計算深さで動く再帰型の言語モデル
Log-Depth Recurrent Language Modeling
この論文をやさしく読む
ひとことで言うと
平衡木の再帰演算を自己回帰の言語予測に使い、接頭辞の表現を並列に効率よく計算するモデル。
何に役立つ?
長い入力を扱う言語モデルの構成を検討する際の候補になる。要旨の実験は初期的な特徴付けであり、一般的な優位性が確立したとは述べていない。
この研究の面白いところ
全ての接頭辞表現を、対数の計算深さと線形の実行時間で計算できるようにした点。
どこまで分かった?
実験結果は系列長の外挿に対する頑健性と、ALiBiを用いたTransformerに近づく性能を示すもの。要旨にはデータセットや性能差の数値は記載されていない。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
Transformerを用いた言語モデリングは広く使われているが、計算の深さが固定され、入力トークン数に対して実行時間が二次的に増える。一方、再帰モデルは深さが線形で、並列実行ができない。本研究では、平衡木に基づく再帰演算子を系列の符号化から自己回帰予測へ拡張し、全ての接頭辞表現を対数の計算深さ、線形の実行時間で求められるようにする。実験では、このモデル群の初期的な特徴付けとして、系列長を延ばしても頑健に動作し、ALiBiを用いたTransformerに近づく性能を示した。これは、言語モデリングの代替アーキテクチャとなる可能性を示す。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-23(UTC)
- 最新改訂
- 2026-09-23 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-23 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Language modeling using Transformers has become commonplace despite their fixed computational depth and quadratic runtime with respect to input tokens. Recurrent models on the other hand offer linear depth but no parallel execution. In this work, we extend balanced-tree recursive operators from sequence encoding to autoregressive prediction, enabling all prefix representations to be computed with logarithmic depth and linear runtime. Our experiments provide an initial characterization of this model class, demonstrating robust length extrapolation and performance approaching that of ALiBi-based Transformers, highlighting its potential as an alternative architecture for language modeling.
著者のコメント
5 pages, 3 figures
arXiv ID: 2609.28212 / 要約の誤りについて