arXiv論文メモ
新着一覧
cs.LG / math.OC · 査読状況未確認

全パラメータ追加学習のメモリを減らす最適化法

TACO: Ternary Absolute-max Column-wise One-sparse Optimizer for LLM Fine-Tuning

Jichao Jiang (1), Cristian McGee (1), El Houcine Bergou (2), Hanqin Cai (1), Aritra Dutta (1) ((1) University of Central Florida, (2) Mohammed VI Polytechnic University)

この論文をやさしく読む

ひとことで言うと

言語モデルの重みをすべて追加学習するとき、最適化器が覚えておく勾配情報を各列の少数成分に絞る方法です。重み全体を学習対象にしたまま、状態保存のメモリを減らします。

何に役立つ?

全パラメータのファインチューニングでGPUメモリが不足する場合の選択肢になります。単一80 GB H100で300億〜320億パラメータのモデルを学習したという実験結果が示されています。

この研究の面白いところ

単に状態を圧縮するのではなく、特定の作用素ノルムにおける厳密な最急降下方向として、各列の絶対値最大成分を選ぶ更新を導きます。一次勾配を使いながら非常に疎な状態を保持する設計です。

どこまで分かった?

174倍という削減率はOPT-13Bでの最適化器状態メモリの比較で、学習全体のピークメモリの削減率は2.9倍です。同程度の精度と時間は報告された実験での結果であり、要旨には全課題の内訳や各設定がありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

大規模言語モデル(LLM)の全パラメータのファインチューニングでは、最適化器の状態を保存するメモリ負担が大きく、現在のGPUに収まるモデルの規模が制限される。既存手法は、最適化器の状態を圧縮するか、一次勾配を使うことをやめるか、密な状態を保持したまま更新の幾何学的構造を変えている。最近提案されたMuon最適化器は、行列値の更新によって最適化器のメモリを減らす。しかし、その幾何学的構造はAdamWとは異なり、AdamWで事前学習したモデルのファインチューニングでは性能低下を引き起こす場合がある。 LLMのファインチューニングで精度や計算効率を犠牲にせず最適化器のメモリを減らすため、Ternary Absolute-max Column-wise One-sparse optimizer、略してTACOを提案する。TACOは、作用素ノルムに関する最急降下として更新を捉えるMuonの見方を引き継ぎ、その幾何学的な方針をさらに進める。2次元の重み行列の各列で絶対値が最大の要素の符号を選ぶことで、次元で正規化した1→1作用素ノルムのもとでの厳密な最急降下方向を計算する。これにより一次勾配を維持しつつ、最適化器の状態メモリをほぼ無視できる大きさにする。 実用版のTACO最適化器は、各列について低精度の勾配成分を少数だけ保持する。OPT-13Bでは、AdamW8bitと比べて、常時保持する最適化器の状態を174分の1に削減し、27.7 GBから0.16 GBにした。学習時のピークメモリも2.9分の1、80.6 GBから27.5 GBに減らしながら、同程度の精度と実行時間を達成した。さらにTACOは、複数のモデル系列と課題で、300億〜320億パラメータのモデルを単一の80 GB H100 GPU上で全パラメータファインチューニングすることを可能にした。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-10-01(UTC)
最新改訂
2026-10-01 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Full-parameter fine-tuning of large language models (LLMs) incurs substantial optimizer state memory overhead, limiting the model sizes that fit on modern GPUs. Existing approaches either compress optimizer state, abandon first-order gradients, or change the update geometry while retaining dense state. The recently introduced Muon optimizer reduces optimizer memory through matrix-valued updates. Still, its geometry differs from AdamW and can lead to performance degradation when fine-tuning AdamW-pretrained models. To reduce optimizer memory without sacrificing accuracy or computational efficiency in LLM fine-tuning, we propose Ternary Absolute-max Column-wise One-sparse optimizer, or TACO, which follows Muon's operator-norm steepest-descent view but takes the geometric route further. TACO computes the exact steepest-descent direction under a dimension-normalized $1\to1$ operator norm by selecting the sign of the largest magnitude entry in each column of two-dimensional weight matrices. This retains first-order gradients while making optimizer state memory nearly negligible. Our practical TACO optimizer maintains only a small set of low precision gradient components per column, reducing persistent optimizer state by $174\times$ relative to AdamW8bit (from 27.7 GB to 0.16 GB) and peak training memory by $2.9\times$ (from 80.6 GB to 27.5 GB) on OPT-13B, while achieving comparable accuracy and runtime. TACO further enables full-parameter fine-tuning of 30-32B-parameter models on a single 80 GB H100 GPU across multiple model families and tasks.

著者のコメント

24 pages, 7 figures, 10 tables. Code available at https://github.com/Jichao2357/TACO_optimizer

arXiv ID: 2610.02199 / 要約の誤りについて