事前学習データの選び方をエージェントが探索
AutoData: Agentic Search for Pre-training Data Selection
この論文をやさしく読む
ひとことで言うと
事前学習に使う文書の選び方を、AIが実行可能なプログラムとして探索する方法です。モデルだけでなくデータ選別を改良対象にします。
何に役立つ?
文書の特徴の組合せを使った学習データ選択を自動化する研究に役立ちます。人が固定した分野ごとの混合率だけでは表せない規則を探します。
この研究の面白いところ
語彙統計、分類ラベル、困惑度を使う採点・層化・確率抽出の規則を、小さな代理モデルの評価で反復改良します。選んだ規則をより大きい規模へ移します。
どこまで分かった?
一晩の探索で人手の選別手順を上回り、拡大時にもCORE指標を改善したと報告しています。要旨には計算資源量や具体的な改善値はなく、あらゆるデータでの優越は示されていません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
LLMエージェントは近年、実行結果のフィードバックに基づいてモデルや学習コードを編集することで、機械学習の開発を自動化する可能性を示している。しかし、データは依然として、このエージェントによる最適化の循環の外に置かれていることが多い。事前学習データの選択を、文書ごとの特徴、すなわち語彙統計、カテゴリのラベル、パープレキシティに対するヒューリスティックの設計として定式化する。 実行可能な選択アルゴリズムを直接探索するエージェントAutoDataを導入する。固定されたドメイン集合の重みを最適化する従来のデータ混合手法とは異なり、AutoDataはスコア付け、層化、確率的選択のルールからなる、より豊かなプログラムの空間を探索する。代理モデルからの検証フィードバックを使ってアルゴリズムを反復的に改良し、特徴間の相互作用を自動的に発見する。 一晩の探索で、AutoDataは人間が設計した既存のデータ整備工程を上回る選択アルゴリズムを発見する。小さな代理モデルだけで探索したにもかかわらず、見つかった手順はより大きな規模へ移行でき、下流の指標COREを改善する。これらの結果は、データエンジニアリングをエージェントによる機械学習の問題として扱えることを示唆し、自律的な研究の対象をモデルや学習コードの最適化からデータへと広げる。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-17(UTC)
- 最新改訂
- 2026-09-17 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-17 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
LLM agents have recently shown promise in automating machine learning engineering by editing model and training code under execution feedback. Data, however, remains largely outside this agentic optimisation loop. We frame pre-training data selection as heuristic engineering over per-document features, i.e., lexical statistics, categorical labels, and perplexity. We introduce AutoData, an agent that searches directly over executable selection algorithms. Unlike prior data mixture methods that optimise weights over a fixed set of domains, AutoData searches a richer program space of scoring, stratification, and stochastic selection rules, discovering feature interactions automatically by iteratively refining algorithms with validation feedback from a proxy model. Within an overnight search, AutoData discovers a selection algorithm that outperforms existing human-designed curation pipelines. Despite being searched only on this small proxy, the discovered recipe transfers to larger scales and improves the downstream metric CORE. These results suggest that data engineering can be treated as an agentic machine learning problem, extending autonomous research from model and training-code optimization to the data.
arXiv ID: 2609.19754 / 要約の誤りについて