学習データ選択を他のデータやモデルへ移すTESS
Scalable, Transferable Meta-network for Data Selection Requires a Different Loss (and Why the Obvious Choice is Problematic)
この論文をやさしく読む
ひとことで言うと
LLMの学習に使うデータを選ぶネットワークについて、別のデータや大きなモデルにも転用しやすくする学習目的を提案しています。
何に役立つ?
考えられる用途は、小さなデータ集合やモデルで学んだ選択基準を、大規模な学習データの選別に使うことです。要旨では安全性調整と目的を絞った指示調整で評価しています。
この研究の面白いところ
サンプルごとの重みをネットワークに置き換えるだけでは不安定になる原因を指摘し、ネットワークではなく目的関数の設計も変えています。
どこまで分かった?
要旨は転用性能の改善を報告していますが、具体的なスコア、データセット名、計算費用は示していません。安全性に関する実験があることは、LLMの安全性全般を保証することとは別です。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
大規模で多様なコーパスを使って大規模言語モデルを学習させるうえで、データ選択は重要である。学習データ選択のためのメタ学習(MTS)は、対象とする検証目的からデータの重みを学ぶことで、経験則によるスコア付けに代わる原理的な方法を提供する。しかし既存手法には、細かな価値評価と、未見データへの転用可能性の間にトレードオフがある。自然な解決策は、サンプルごとの重みを選択ネットワークで置き換えることである。ところが、このようなネットワークを既存のMTSの目的関数に直接組み込むと、重みの抑制と、学びやすい特徴への持続的な依存によって、最適化が不安定になり、汎化性能が低下することを見いだした。 これらの問題に対処するため、Pointwise Value Matching(PVM)という目的関数に基づく、拡張可能なデータ選択の枠組みTransferable Example Scoring and Selection(TESS)を提案する。LLMの安全性と、特定の目的に向けた指示調整の実験によって、データセット間、部分集合から全コーパス、小規模モデルから大規模モデルへの良好な転用性能を示す。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-10-01(UTC)
- 最新改訂
- 2026-10-01 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-10-01 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Data selection is critical for training large language models on massive and heterogeneous corpora. Meta-learning for Training-data Selection offers a principled alternative to heuristic scoring by learning data weights from a target validation objective, but existing methods face a trade-off between fine-grained valuation and transferability to unseen data. A natural solution is to replace per-sample weights with a selection network. However, we find that directly incorporating such a network into existing MTS objectives leads to unstable optimization and poor generalization, caused by weight suppression and persistent reliance on easy-to-learn features. To address these issues, we propose Transferable Example Scoring and Selection (TESS), a scalable data-selection framework built on a Pointwise Value Matching objective (PVM). Experiments on LLM safety and targeted instruction tuning demonstrate strong transfer across datasets, from subsets to full corpora, and from smaller to larger models.
arXiv ID: 2610.02092 / 要約の誤りについて