LLM配信の電力使用を契約量に合わせて調整する
ePACT: Energy-Performance-Aware Commitment Tracking for LLM Serving
この論文をやさしく読む
ひとことで言うと
電力を単に節約するのでなく、1時間ごとの契約量に近づけるようLLM配信を制御する方法です。使い過ぎにも使い残しにも費用がかかる状況を扱います。
何に役立つ?
そのような電力契約を持つ配信事業者が、応答の要件と電力費用を両立させる用途が考えられます。H20とH200を想定した24時間のシミュレーションで、契約量からのずれに伴う費用を削減しました。
この研究の面白いところ
全体の電力目標を立てる処理と、個々の設定を選ぶ処理を分けています。電力目標だけでなく期限超過の予測も選択に入れ、サービスを優先する仕組みを持たせています。
どこまで分かった?
73.8%と75.7%は24時間シミュレーションにおける偏差費用の削減率であり、総電気料金や総消費電力の削減率ではありません。要旨には電力契約の単価やトレースの詳細はありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
電力調達で事前に定めた契約量からの不利なずれに応じて事業者へ費用が生じる場合、LLM配信の消費エネルギーを減らすだけでは、運用費用の低下は保証されない。本研究では、使い過ぎと使い残しの両方に正の費用がかかり、その費用が非対称である可能性もある時間単位の契約量を扱う。そして、リクエストごとのサービス要件を満たしながら、契約量からのずれの費用を最小化する、エネルギー・性能を考慮した契約量追従を定式化する。 リクエストの到着に合わせて配信能力とGPUクロックを調整する2階層の制御器ePACTを実装した。全体の計画器は、測定された消費量とその時間枠で残っている契約量から、区間ごとのエネルギー目標を更新する。局所的な意思決定器は、候補設定のエネルギーと完了時刻を予測し、予測上の期限超過を点検する。その上で、許容された設定の中から、目標からのずれに対する非対称な費用に基づいて選ぶ。必要な場合にはサービスを優先する代替動作を行う。粗い探索から細かい探索へ進む操作候補の探索は、配信処理と非同期に実行する。 ePACTを、H20とH200のGPU群を対象として、1時間単位の比較、制御器のアブレーション、および終日のトレースシミュレーションで評価した。24時間のシミュレーションでは、vLLMに近いサービスレベル目標(SLO)達成率を維持しながら、非対称なずれの費用をvLLM比でそれぞれ73.8%、75.7%削減した。時間単位の平均絶対偏差は、それぞれ2.16%、2.31%であった。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-10-01(UTC)
- 最新改訂
- 2026-10-01 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-10-01 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Reducing LLM serving energy does not by itself guarantee lower deployment cost when electricity procurement exposes operators to unfavorable deviations from preset commitments. We study hourly commitments with positive, potentially asymmetric costs for overuse and underuse, and formulate energy-Performance-Aware Commitment Tracking: minimize deviation costs subject to request-level service requirements. We implement ePACT, a two-level controller that adjusts serving capacity and GPU clocks as requests arrive. A global planner updates interval energy targets from measured consumption and the remaining hourly commitment. A local decision maker predicts candidate configurations' energy and completion times, checks predicted deadline misses, and selects among admitted configurations by asymmetric target-deviation cost, with a service-first fallback. Coarse-to-fine action search runs asynchronously with serving. We evaluate ePACT through single-hour comparisons, controller ablations, and full-day trace simulations for H20 and H200 GPU pools. In the 24-hour simulations, ePACT reduces the asymmetric deviation cost by $73.8\%$ and $75.7\%$ relative to vLLM while retaining near-vLLM SLO attainment. Mean absolute hourly deviations are $2.16\%$ and $2.31\%$, respectively.
arXiv ID: 2610.01784 / 要約の誤りについて