arXiv論文メモ
新着一覧
cs.AR / cs.DC · 査読状況未確認

GPUの物理的な非対称性を調べて計算資源を割り当てる

Dissecting How Die Scaling Breaks GPU Fine-grained Scheduling

Xiaoze Fan, Jianhao Wang, Weihao Cui, Han Zhao, Zhuobin Huang, Yangjie Zhou, Yuxian Qiu, Shixuan Sun, Bingsheng He, Quan Chen and Minyi Guo

この論文をやさしく読む

ひとことで言うと

同じGPU内でも計算ユニットの位置やメモリまでの距離で速さが違うため、その違いを測って割り当てに反映します。

何に役立つ?

GPUを細かく分けて複数の計算を同時実行するときに、性能のばらつきや遅延を抑える設計に役立ちます。

この研究の面白いところ

資源をいくつ渡すかだけでなく、実際にどの物理ユニットを渡すかを問題にしています。チップごとの差を軽量な測定で把握します。

どこまで分かった?

1.22倍、14.3%、1.33倍はいずれも報告された最大値です。平均的に同じ改善が得られるわけではなく、具体的なGPU型番や全ワークロードの結果は要旨にありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

現代のGPUは、物理的にはもはや対称ではない。ダイの大規模化は、製造に起因する一部ユニットの無効化と、キャッシュ・メモリの分割の両方をもたらす。前者はチップ固有の計算トポロジーを作り、後者は非一様なメモリアクセスを生む。これらの非対称性の影響は大きい。トポロジーを考慮しない計算ユニット割り当ては最大1.33倍の性能差を生じさせ、遠隔アクセスはHBM遅延を最大67%増やし、L2遅延をほぼ2倍にする。しかし、これらの非対称性はGPUの論理的な資源抽象化の背後に隠れ、チップごとにも異なり得る。 本研究では、チップごとの計算トポロジーとメモリ親和性を明らかにする軽量な特性評価手法を開発する。得られた情報を用い、割り当てる資源の数だけでなく、どの物理資源を割り当てるかも考慮することで、既存の細粒度スケジューリングを非対称性に対応させる。GPU全体でのカーネル実行、アプリケーション内の多重実行、アプリケーション間の同居実行にわたる評価で、非対称性を考慮したスケジューリングは、一般的なカーネルを最大1.22倍高速化し、多重実行するLLM推論を最大14.3%改善し、最大1.33倍の性能差を回避する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-21(UTC)
最新改訂
2026-09-21 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Modern GPUs are no longer physically symmetric. Die scaling leads to both manufacturing-driven floorsweeping and cache and memory partitioning. The former creates chip-specific compute topologies, while the latter causes non-uniform memory access. These asymmetries are substantial. Topology-oblivious compute unit allocation can lead to up to 1.33x performance variation, while remote accesses increase HBM latency by up to 67% and nearly double L2 latency. However, these asymmetries are hidden behind the GPU's logical resource abstractions and can vary across chips. We develop lightweight characterization methods to uncover per-chip compute topology and memory affinity. We then use the discovered information to make existing fine-grained scheduling asymmetry-aware, considering not only how many resources are allocated but also which physical resources are assigned. Across full-GPU kernel execution, intra-application multiplexing, and inter-application co-location, asymmetry-aware scheduling improves mainstream kernels by up to 1.22x, multiplexed LLM inference by up to 14.3%, and avoids up to 1.33x performance variation.

arXiv ID: 2609.24270 / 要約の誤りについて