新しいデータにだけ重み更新を適用して学習済み能力を保つ
Local Support Learning
この論文をやさしく読む
ひとことで言うと
追加学習の変更を、そこで学んだデータに近い入力にだけ適用し、以前の能力への干渉を減らす方法です。
何に役立つ?
以前の学習データを保存・再利用できない状況で、モデルへ順次能力を追加する際に役立つ可能性があります。最大70億パラメータのモデルで評価されています。
この研究の面白いところ
更新量を小さくするだけでなく、更新が働く入力の範囲をゲートで限定します。Gaussian混合モデルの尤度低下を、以前の入力では更新を閉じる性質として使います。
どこまで分かった?
要旨には具体的な課題、保持率、メモリや速度の数値はありません。「忘却を解消」は報告された評価範囲の結果であり、あらゆるデータ分布での保証とは記載されていません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
大規模な事前学習モデルにおける破滅的忘却を調べる。忘却を各重み行列の入力空間における幾何学的問題として捉えることで、自然な能力保持の目的関数が見いだされ、その下では勾配ベースの最適化器による更新が最適でないことが分かる。この観察を踏まえ、以前のデータにアクセスせずに既存能力を保持するため、勾配ベースの学習を拡張する汎用的な枠組みLocal Support Learning(LSL)を提案する。 新たな学習段階では、LSLは役割の異なる2つの要素を組み合わせる。1つは通常どおり損失を最小化するよう学習する標準的な重みアダプタであり、もう1つは、そのアダプタ自身の学習分布から来た入力活性に対してのみアダプタを有効化するゲート関数である。これにより、更新の作用範囲をその分布に局所化する。主な課題は、現在の段階のデータだけで学習しながら、すべての学習段階のデータをゲートが振り分けなければならないことである。 この問題に対し、学習データから離れると尤度が急速に減少するGaussian混合モデル(GMM)に基づくゲートを用いる。これにより、過去の段階のデータに対して自然に閉じたままになる傾向を持たせる。この事後学習法は、最大70億パラメータのLLMで忘却を解消し、複数の学習段階を通じて事前学習とファインチューニングの両方の能力を保持できることを示す。同時に、メモリと計算の効率が良く、ハイパーパラメータの選択に頑健で、規模拡大の可能性も示す。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-10-01(UTC)
- 最新改訂
- 2026-10-01 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-10-01 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
We explore catastrophic forgetting in the context of large pre-trained models. By considering forgetting as a geometric problem in the input space of each weight matrix, we uncover a natural retention objective under which updates produced by gradient-based optimizers are suboptimal. Following this observation, we propose Local Support Learning (LSL), a general-purpose framework that augments gradient-based training for retention of prior capabilities without access to prior data. During a new learning phase, LSL pairs two components with distinct roles: a standard weight adapter, trained as usual to minimize the loss, and a gating function that enables the adapter only on input activations from its own training distribution, making the update local to that distribution. The key challenge is that this gate must route data from all learning phases while training only on data from the current one. We address this with a gate based on a Gaussian Mixture Model (GMM), whose likelihood decays rapidly away from its training data, giving it a natural tendency to stay closed on data from prior phases. We show that this post-training approach can resolve forgetting in LLMs of up to 7 billion parameters, retaining both pretrained and finetuned capabilities across multiple training phases, while being efficient in memory and compute, robust to hyperparameter choice, and showing scaling potential.
著者のコメント
Website and code: https://assafbk.github.io/lsl
arXiv ID: 2610.02126 / 要約の誤りについて