arXiv論文メモ
新着一覧
cs.LG · 査読状況未確認

学習中の勾配で合成データの有用性を測って選別するFROST

Let Training Guide Selection: Online Synthetic Data Filtering via Real-Anchored Utility

Yanran Wu, Sana Lakdawala, Renzo Tassara Miller, Chongyang Bai, Sharath Ciddu, Shivendra Pratap Singh, Kungang Li, Sandeep Pandey, Chunwei Liu

この論文をやさしく読む

ひとことで言うと

合成データを全部使う代わりに、実データへの学習効果を見ながら必要なときだけ選別する方法を提案した研究。

何に役立つ?

実データが少なく合成データを併用する学習で、不要なサンプルを減らしながら実課題の性能を上げる方法として参考になる。

この研究の面白いところ

固定の品質指標ではなく、学習中の勾配と直近の履歴でバッチの有用性を測る。公開ベンチマークでは合成データを約20~30%減らしても性能が改善した。

どこまで分かった?

公開ベンチマークは画像分類とテキストからSQLへの変換の二つで、産業用広告システムでも試している。性能向上の具体的な大きさは要旨に記載されていない。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

実世界のデータが限られる場合、合成データは学習用の教師情報を増やせるが、雑音や分布のずれによって価値が下がることがある。既存の合成データ選択法は、学習器の変化する必要性よりも、データの忠実さや多様性を重視する場合が多い。本研究は、実際の学習データに基づく勾配のフィードバックから合成データの有用性を推定する、オンラインの枠組みFROSTを提案する。最近の履歴に照らしてバッチの有用性を較正し、いつ選別が必要かを判断する。有用性が通常の範囲を外れたバッチに限ってサンプルを選別し、何を残すかを決める。外部の検証器や取り分けた検証集合は使わない。 画像分類と、テキストからSQLを生成するためのLLMの追加学習に関する二つの公開ベンチマークで実験した結果、FROSTは合成データの約20~30%を除きつつ、合成データの全体を使って学習する場合より、実際の課題での性能を改善した。さらに、大規模な産業用広告の再ランキングシステムの学習中にFROSTを適用すると、高度に最適化された本番環境の基準法を上回る有意な性能向上が得られ、その有効性と適用範囲の広さが示された。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-24(UTC)
最新改訂
2026-09-24 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Synthetic data can scale training supervision when real-world data are limited, but noise and distribution mismatch can reduce its value. Existing synthetic data selection methods often emphasize fidelity or diversity rather than the learner's evolving needs. We propose FROST, an online framework that estimates synthetic-data utility through gradient feedback anchored in real training data. It calibrates batch utility against recent history to determine when filtering is needed and filters samples only in out-of-band batches to determine what to retain, without an external verifier or held-out validation set. Experiments on two public benchmarks for image classification and LLM fine-tuning for text-to-SQL show that FROST filters out around 20--30% of the synthetic data while improving real-task performance compared with training on the full synthetic data pool. We further apply FROST during training in a large-scale industrial ads re-ranking system, achieving significant performance gains over a highly optimized production baseline, demonstrating its effectiveness and generalizability.

著者のコメント

21 pages, 6 figures

arXiv ID: 2609.29988 / 要約の誤りについて