CGLAでML-KEM向けNTT演算を実装し遅延と電力を評価
Implementation and Evaluation of NTT Arithmetic for ML-KEM on a CGLA
この論文をやさしく読む
ひとことで言うと
耐量子鍵確立 ML-KEM に使う NTT 演算を、再利用可能な計算回路 CGLA に実装して評価した。
何に役立つ?
NTT を専用回路以外で実行する際の正確さ、遅延、エネルギーを比較する材料になる。
この研究の面白いところ
整数の範囲を抑えた FP32 の計算で全係数の一致を確認し、FPGA 実測と ASIC の予測を分けて示す。
どこまで分かった?
実装したのは標準 ML-KEM の7層 NTT と異なる8段の演算で、多項式乗算全体ではない。ASIC の遅延とエネルギーは実測ではなく予測値である。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
FIPS 203 は耐量子の鍵確立方式 ML-KEM を標準化している。その多項式乗算は、法 q=3329 で正確な剰余演算を行う NTT のバタフライ演算に依存する。専用 NTT アクセラレーターは固定の剰余演算と段階の実行順で遅延を抑える。一方、CPU-Grounded Linear Array(CGLA)は、複数の仕事に一つのプログラム可能な線形データ経路を再利用する。この経路へ変換を割り当てるには、正確な FP32 再構成と、ARM と CGLA の接続をまたぐ明示的な段階移行が必要である。本研究は、各回転因子を剰余の計算前に8ビットと4ビットに分割し、ML-KEM の法の下で8段の循環的な基数2の実行器を実装する。これは標準化された7層の不完全な負巡回 NTT とは異なり、ML-KEM の多項式乗算全体は実装しない。演算列ではすべての整数を2^24未満に保つ。41個の処理要素(PE)を使う1回の呼び出しで最初の2段を統合し、47 PE を使う6回の呼び出しで残りの段を実行しながら、出力を次段の記録へ配置する。4つの群にわたる FPGA の105回の実行で、817,152個の出力係数がすべて一致した。バッチサイズ64では、FPGA で測った NTT 1回当たりの端から端までの遅延は27.5マイクロ秒、ASIC の予測値は6.74マイクロ秒だった。PE のゲート制御を使う ASIC システムの予測エネルギーは、バッチサイズ8で NTT 当たり10.1マイクロジュール、64で58.9マイクロジュールだった。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-24(UTC)
- 最新改訂
- 2026-09-24 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-24 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
FIPS 203 standardizes ML-KEM for post-quantum key establishment. Its polynomial multiplication relies on NTT butterflies with exact modular arithmetic over q = 3329. Dedicated NTT accelerators minimize latency with fixed modular arithmetic and stage schedules. A CPU-Grounded Linear Array (CGLA) reuses one programmable linear datapath across several workloads. Mapping the transform to this datapath requires exact FP32 reconstruction and explicit stage transitions across the ARM-to-CGLA interface. We implement an eight-stage cyclic radix-2 driver over the ML-KEM modulus by splitting each twiddle into 8-bit and 4-bit parts before modular reduction. This driver differs from the standardized seven-layer incomplete negacyclic NTT and does not implement the full ML-KEM polynomial multiplication path. The arithmetic sequence keeps every integer below 2^24. One 41-PE call fuses the first two radix-2 stages, and six 47-PE calls execute the remaining stages while scattering outputs into next-stage records. Across four cohorts, 105 FPGA runs match all 817152 output coefficients. At batch size 64, measured FPGA end-to-end latency is 27.5 us per NTT, and the ASIC projection is 6.74 us. With PE gating, projected ASIC system energy is 10.1 uJ per NTT at batch size 8 and 58.9 uJ at batch size 64.
著者のコメント
Accepted as a Regular Paper for the WICS Workshop at CANDAR 2026
arXiv ID: 2609.28904 / 要約の誤りについて