arXiv論文メモ
新着一覧
cs.AR · 査読状況未確認

プログラム可能な演算器でMamba系モデルを実行

Mamba-Family State-Space Model Kernels on a Programmable CGLA

Takuto Ando, Yasuhiko Nakashima

この論文をやさしく読む

ひとことで言うと

Mamba系AIモデルの処理を、プログラム可能な演算器へ載せたとき、どの部分が速く動き、どこが詰まるかを調べた。

何に役立つ?

省電力の組み込み機器で状態空間モデルを動かす演算器や実行方法の設計に役立つ。要旨は演算ごとの適性とボトルネックを述べるが、製品全体の電力削減量は示していない。

この研究の面白いところ

長い加算を伴う射影はハードウェアに合う一方、短いSSD処理では切り替え費用が支配的だった。トークン生成まで統合すると、射影の行列・ベクトル積がボトルネックになった。

どこまで分かった?

要旨の統合評価はMamba-130MとIMAXへの割り当てに基づく。他の規模のモデルや演算器で同じボトルネックになるかは分からない。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

機器の近くや組み込み機器での推論は、消費電力とデータ移動に制約される。Mamba系の状態空間モデルは注意機構を、系列の長さに比例して進む再帰計算で置き換えるが、その推論には密な射影、短い加算処理を伴うSSD演算、再帰状態の更新が混在する。本論文は、これらの演算群をプログラム可能なCPU-Grounded Linear Array(CGLA)であるIMAXに割り当て、個別演算の実行からトークン単位の統合まで測定する。射影演算は長い加算処理に適したIMAXのパイプラインとよく合う。一方、SSDの第1段階は、短い加算処理と演算の切り替えに伴う費用が制約となった。Mamba-130Mをトークン単位で統合すると、出力を逐次生成する際のボトルネックは射影の行列・ベクトル積だった。結果は、プログラム可能なCGLAが長い加算を伴う射影演算に適し、SSDや生成時の射影を効率よく支えるには演算間の切り替え費用の削減と、重みを保持して実行する仕組みが必要であることを示す。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-23(UTC)
最新改訂
2026-09-23 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Edge and embedded inference is constrained by power and data movement. Mamba-family state-space models replace attention with sequence-linear recurrence, but their inference path combines dense projections, short-reduction SSD kernels, and recurrent-state updates. This paper maps these kernel groups onto IMAX, a programmable CPU-Grounded Linear Array (CGLA), and measures them from kernel execution to token-level integration. Projection kernels match the long-reduction IMAX pipeline, whereas SSD Step-1 is limited by short reductions and kernel-boundary overheads. Mamba-130M token-level integration identifies projection GEMV as the decode bottleneck. These results show that programmable CGLAs fit long-reduction projection kernels, while SSD and decode-time projection support require boundary reduction and persistent-weight execution.

著者のコメント

Accepted as a regular paper at the 19th IEEE International Symposium on Embedded Multicore/Many-core Systems-on-Chip (MCSoC 2026)

arXiv ID: 2609.27437 / 要約の誤りについて