arXiv論文メモ
新着一覧
cs.PF · 査読状況未確認

GPUで大規模な疎行列のフーリエ解析を高速化

Scaling Fourier-Based Sparse Matrix Analysis on GPUs

Ruifeng Zhang, Sai Krishna Teja Varma Manthena, Jiajia Li, Xipeng Shen

この論文をやさしく読む

ひとことで言うと

巨大で疎な行列の全体構造をFourier変換で調べる際、GPUのメモリ不足と計算量を減らします。

何に役立つ?

グラフ隣接行列などの疎構造を解析し、並列計算の特性を理解するための手法です。

この研究の面白いところ

情報を失わないBS-FFTと、周波数・空間を圧縮する二方式を分けます。40GBのA100では通常の密行列FFTが15行列中6件を処理できたのに対し、BS-FFTは全件を処理しました。

どこまで分かった?

最大1466.4倍の計算高速化は圧縮版をBS-FFTと比較した値です。圧縮率に応じてスペクトル特徴誤差0.16〜11.56%があり、無損失版の性能と混同できません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

疎な計算は、科学技術計算、グラフニューラルネットワーク(GNN)、機械学習などの応用で重要な処理である。多くの疎な演算は最新のGPUの恩恵を受けられるが、疎構造のパターンはメモリアクセスの集約、ブロック構成、負荷分散に影響するため、依然として性能を左右する。先行研究は、スペクトルの特徴が疎行列の大域的構造の解析に役立つことを示している。こうした特徴の抽出には高速フーリエ変換(FFT)が広く使われ、効率的なGPU向けFFTライブラリも存在する。しかし疎行列、とりわけ大規模グラフの隣接行列は、非常に大きく疎になる傾向がある。密行列に基づく既存のFFT実装は大規模化が難しく、これらの行列のスペクトルパターンを得ることが困難である。 そこで、情報損失のないBinary-Sparse FFT(BS-FFT)と、2種類の圧縮手法からなる3つのアプローチを提案する。圧縮手法は、サンプリングした周波数格子上でBS-FFTの処理系を再利用するElastic BS-FFTと、密度マップに基づく空間圧縮である。実験ではBS-FFTは密行列用cuFFTに比べGPUメモリ使用量を2.9〜11.6分の1に削減した。メモリ40 GBのA100上で、密行列用cuFFTが15個中6個しか処理を完了できなかったGNN隣接行列を、BS-FFTはすべて処理できた。Elastic BS-FFTと密度マップ圧縮は、サンプリング率6.25%から0.0061%の範囲で、スペクトル特徴の誤差を0.16〜11.56%に抑えつつ、BS-FFTに比べGPU計算時間を2.0〜1466.4分の1に削減した。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-17(UTC)
最新改訂
2026-09-17 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Sparse computations are important workloads in applications such as scientific computing, graph neural networks (GNNs), and machine learning. While many sparse operations can benefit from modern GPUs, the sparsity pattern remains important to performance because it affects memory coalescing, block organization, and load balancing. Previous studies show that spectral signatures can help analyze the global structure of sparse matrices. The fast Fourier transform (FFT) is commonly used to extract spectral signatures, and efficient GPU FFT libraries are available. However, sparse matrices, especially adjacency matrices for large graphs, tend to be very large and sparse. Existing dense-matrix-based FFT implementations are difficult to scale up, making the spectral patterns of these matrices difficult to obtain. We therefore propose a three-fold research approach comprising a lossless Binary-Sparse FFT (BS-FFT) and two compression methods: Elastic BS-FFT, which reuses the BS-FFT pipeline on a sampled frequency grid, and density-map-based spatial compression. Experiments show that BS-FFT reduces GPU memory use by 2.9--11.6 times relative to dense cuFFT and completes all 15 GNN adjacency matrices where dense cuFFT completes 6 on a 40 GB A100. Elastic BS-FFT and Density Map compression reduce GPU computation time by 2.0--1466.4 times relative to BS-FFT with spectral feature error of only 0.16% to 11.56% across the sampling rates from 6.25% to 0.0061%.

著者のコメント

13 pages, 7 figures

arXiv ID: 2609.20483 / 要約の誤りについて