学習データの生成過程を近づけて教師あり追加学習を改善する
Finetuning with Sampling: SFT Learns Better Than You Think
この論文をやさしく読む
ひとことで言うと
教師あり学習のルールを変える代わりに、教師データを学習対象のモデルが扱いやすい形へ調整する方法です。
何に役立つ?
専門家の良い回答を活用しつつ、新しい能力の獲得と既存能力の保持を両立する事後学習に役立つ可能性があります。科学・数学・専門知識の課題で比較されています。
この研究の面白いところ
他の方策から得た実行過程をMCMCで徐々にモデル自身の生成分布へ近づけます。SFTとRLの差を学習目的だけでなく、データ分布の相性から捉えています。
どこまで分かった?
要旨は複数課題での比較を述べますが、具体的なモデル規模、数値、サンプリング費用は示していません。すべての課題でRLを上回るという結果ではありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
最先端モデルに新しい能力を導入することは、長年にわたる事後学習の目標であり、そのために主に教師ありファインチューニング(SFT)と強化学習(RL)が使われている。一般的には、RLは既存能力を失わずに新しい課題への高い汎化を可能にする一方、SFTは汎化が弱く破滅的忘却を起こしやすいと考えられている。同時に、SFTはモデル自身の方策とは異なる方策から得た専門家データで学べるが、RLは繰り返しのサンプリングで成功する実行過程をモデルが見つけられるかに依存する。 本研究では、オフポリシーのデータに含まれる特別な情報を使いながら、オンポリシー学習の強みを生かすことを目指す。ただし、こうしたデータに合わせて学習目的を変更するのではなく、学習するモデルに合うようにデータ分布を調整する。ファインチューニングの参照モデルを与えたとき、オフポリシーの実行過程を、よりオンポリシーに近いものへ段階的に変換するマルコフ連鎖モンテカルロ(MCMC)サンプリングアルゴリズムを導入する。 科学的技能の習得、数学的推論、自由回答型の専門知識といった課題を通じて、このサンプリングアルゴリズムによりSFTは広く使われる事後学習手法に匹敵し、強力なオンポリシーの比較手法より汎化に優れ、忘却が少ないことも多い。さらに、得られた追加学習モデルは分布として見た性能も高く、基盤モデルの分布を単に先鋭化するだけにとどまらない学習が可能である。より大きな観点では、この方法は、学びやすさに合わせてデータを形作るモデル固有の演算としてサンプリングを位置付け、事後学習の仕組み全体で汎用的な基本操作として広く使える可能性を示す。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-10-01(UTC)
- 最新改訂
- 2026-10-01 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-10-01 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Introducing new capabilities to frontier models has long been the goal of posttraining, which predominantly employs supervised finetuning (SFT) and reinforcement learning (RL) to this end. Conventional wisdom dictates that RL enables strong generalization on new tasks without losing existing capabilities, while SFT is prone to weak generalization and catastrophic forgetting. At the same time, SFT can learn from off-policy expert data, whereas RL must rely on a model's ability to find successful trajectories with repeated sampling. In our work, we seek to leverage the strength of on-policy learning while utilizing the privileged information contained in off-policy data. However, rather than modifying the learning objective to accommodate this data, we instead tailor the data distribution to better suit the learner. We introduce a Markov chain Monte Carlo (MCMC) sampling algorithm that progressively transforms off-policy traces to be more on-policy given a reference model for finetuning. Across tasks like scientific skill acquisition, mathematical reasoning, and open-ended expertise, our sampling algorithm enables SFT to rival prevailing posttraining techniques, often generalizing better and forgetting less than strong on-policy baselines. In addition, the resulting finetuned models exhibit strong distributional performance and are capable of learning beyond sharpening the base model distribution. At a higher level, our approach presents sampling as a model-native operator that shapes data for learnability, offering broader utility as a general-purpose primitive throughout the posttraining stack.
arXiv ID: 2610.02140 / 要約の誤りについて