arXiv論文メモ
新着一覧
cs.AR · 査読状況未確認

GPUに併設する高帯域フラッシュの動作を模擬

HBF-Sim: An Extensible HBF Simulator for Large-scale GPU Memory Systems

Yaqi Li, Jing Wang, Junfeng Wang, Long Yang, Han Yan, Xiaohu Chai, Liang Shi

この論文をやさしく読む

ひとことで言うと

GPUの近くに置く高帯域フラッシュで、要求がどのようにNANDへ届き、どこで遅くなるかを調べるシミュレータ。

何に役立つ?

HBFのチャネル配置や並列処理の設計を、GPUからの実際の要求経路を考慮して比較するために使える。

この研究の面白いところ

GPUの発行制限からNANDのページ操作まで一続きに模擬し、キャッシュライン要求をページ単位にまとめる部分も表現した。

どこまで分かった?

要旨では検証試験と装置レベルの小規模ベンチマークを報告するが、実機での性能改善値は示していない。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

高帯域フラッシュ(HBF)はメモリ性能の壁に対処するために導入され、密度の高いNAND積層体をGPUと同じパッケージに収め、アクセラレータ近傍の帯域幅とフラッシュの記録密度の間を狙う。しかしHBFは、大容量HBMでも高速NVMe SSDでもない。使える帯域幅は、GPUのキャッシュライン要求をNANDページへどう対応させるか、並列性をチャネルに結び付くダイ群へどう分散するか、媒体管理がGPUメモリの処理経路とどう相互作用するかに依存する。著者らの知る限り、既存のGPU、SSD、HBFのシミュレータはこの挙動を忠実にモデル化できない。 本研究は、模擬GPUと統合した拡張可能で再利用できるHBFシミュレータHBF-Simを提示する。GPUの要求発行の制限、装置内の待ち行列、NANDの挙動を、一つの端から端までの要求経路として結び付ける。GPUとHBFの相互作用制御部と、ページ単位で並列動作する積層ストレージを分離し、GPU-HBFの要求経路全体をモデル化する。キャッシュライン要求をページ単位の操作へまとめるMSHRベースのアドレス対応表と、高並列な読み書きのためのページ単位の複数積層フラッシュ管理部を備える。検証試験と装置レベルのマイクロベンチマークは、チャネルへの分散不足や資源競合が生む性能のボトルネックを明らかにし、次世代HBF構造の設計に具体的な指針を与える。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-24(UTC)
最新改訂
2026-09-24 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

High-bandwidth flash (HBF) is introduced to address the memory wall, which can co-package a dense NAND stack with the GPU, targeting the performance gap between near-accelerator bandwidth and flash density. HBF, however, is neither a large HBM nor a fast NVMe SSD. Its usable bandwidth depends on how GPU cache-line requests map onto NAND pages, how concurrency spreads across channel-affine die sets, and how media management interacts with the GPU memory pipeline. To our knowledge, existing GPU, SSD, or HBF simulators cannot faithfully model this behavior. We present HBF-Sim, an extensible, reusable, and faithful HBF simulator integrated with simulated GPUs. It closes the loop between GPU issue limits, device queuing, and NAND behavior in one end-to-end request path. HBF-Sim separates a GPU-HBF interaction controller from page-based parallel stack storage, and it models the full GPU-HBF request path. It provides an MSHR-based address mapping table that merges cache-line requests into page-based operations, as well as a page-based multi-stack flash manager for highly parallel reads and writes. Validation tests and device-level microbenchmarks expose performance bottlenecks caused by limited channel distribution and resource conflicts, offering concrete guidance for next-generation HBF architectures.

著者のコメント

12 pages, 9 figures

arXiv ID: 2609.29246 / 要約の誤りについて