arXiv論文メモ
新着一覧
cs.AR · 査読状況未確認

RISC-V GPUに耐量子暗号用の小型演算器を組み込む

Design-Space Exploration of Post-Quantum Cryptography Acceleration on an Open-Source RISC-V GPGPU

Hossam Hassan, Marc Xander Makkes, Chae Eun Lee and Hyungmin Yoon

この論文をやさしく読む

ひとことで言うと

耐量子暗号で使う数論変換を、RISC-V GPU内の小さな専用演算器に担当させる設計です。

何に役立つ?

暗号処理と汎用並列計算を同じGPUに載せる際、演算器の面積と速度の設計比較に役立ちます。暗号方式全体の処理速度を示す結果とは区別が必要です。

この研究の面白いところ

2種類の法に対応しながら134論理セルに収め、FPGAでの配置配線や機能テスト、GPUシミュレータ、7 nm向け合成という異なる評価を示しています。

どこまで分かった?

42.6倍はSimXでの結果、約36倍はRTLでの予測です。7 nmの数値も合成・配線結果であり、製造したチップの実測とは述べられていません。最小設計という比較は論理セル数に基づきます。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

耐量子暗号(PQC)の高速化はCPUやFPGAで研究されてきたが、高スループット計算の中心を担うGPGPUに、PQC用ハードウェアを機能ユニットとして統合することは未開拓である。本研究では、著者らの知る限りで初となる統合として、オープンソースのVortex RISC-V GPGPUにVortex Post-Quantum Crypto Unit(PCU)を実装する。 PCUは、Kyberの法q=3329とDilithiumの法q=8380417に対応する256点数論変換(NTT)を、134論理セル(73 LUT4と61 CCU2C)で実装する。論理セル数では報告済みのNTTアクセラレータの中で最小であり、次に小さい設計の約2.8分の1である。Lattice ECP5で228.78 MHz、Xilinx Artix-7の配置配線後で299.8 MHzを達成し、7つのテスト群にわたる253件の機能テストに合格した。Vortex SimXではGPUのALUによる実行に比べ42.6倍の高速化を達成し、RTLでは約36倍の高速化が見込まれる。ASAP7の7 nmプロセス向けに合成したNTTデータパスは、配線後の面積が96.53 µm²で、動作周波数は702 MHzである。本研究は、汎用並列計算にPQCハードウェアアクセラレーションを統合するための基盤を示す。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-16(UTC)
最新改訂
2026-09-16 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Post-quantum cryptography (PQC) acceleration has been studied for CPUs and FPGAs, yet GPGPUs - dominating high-throughput computing - remain unexplored for PQC hardware integration as a functional unit. We present what is, to our knowledge, the first such integration: the Vortex Post-Quantum Crypto Unit (PCU) on the open-source Vortex RISC-V GPGPU. The PCU implements a 256-point NTT over Kyber (q=3329) and Dilithium (q=8380417) moduli in 134 logic cells (73 LUT4 + 61 CCU2C) - the smallest reported NTT accelerator by logic-cell count, 2.8x smaller than the next smallest design. It achieves 228.78 MHz on Lattice ECP5 and 299.8 MHz place-and-route on Xilinx Artix-7, and passes 253 functional tests across 7 suites. On Vortex SimX, it achieves 42.6x acceleration over GPU ALU execution, projecting to roughly 36x speedup on RTL. Synthesized to ASAP7 7nm, the NTT datapath occupies 96.53 um^2 (post-route) at 702 MHz. This work establishes a foundation for integrating PQC hardware acceleration into general-purpose parallel computing.

著者のコメント

32 pages, 13 figures

arXiv ID: 2609.22343 / 要約の誤りについて