少数の厳選データで自然言語からSQLへの変換を学習する
LIMIT: Less Is More for Instruction Tuning in Text-to-SQL
この論文をやさしく読む
ひとことで言うと
自然言語からSQLを作るモデルの学習例を、難易度、推論の一貫性、品質、テーブルの網羅性で絞り込む方法です。少数でも偏りなく学べる集合を探します。
何に役立つ?
考えられる用途は、Text-to-SQLの微調整に使うデータ量を減らすことです。BIRDとSpiderで、Qwen3-8Bに対する実行正解率を報告しています。
この研究の面白いところ
品質が高い例を選ぶだけでなく、どのテーブルをカバーしているかも遺伝的アルゴリズムで同時に最適化します。796件・863件でもテーブル網羅率100%を達成したとしています。
どこまで分かった?
100%はテーブルの網羅率で、SQLの正解率ではありません。正解率はそれぞれ69.1%と88.9%です。LLMによる合成・採点などの選別工程があり、学習例数の削減が全工程の費用を同じ割合で減らすことまでは要旨に示されていません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
大規模言語モデルは、推論を強化した微調整により、文章からSQLを生成するText-to-SQLで著しく進歩してきた。しかし既存の手法は、規模が性能を左右するという仮定の下で、大量の指示データに主として依存している。本研究では、効果的なText-to-SQLの指示学習に必要なデータの最小量はどれほどか、という基本的な問いを調べ、この考え方に挑む。 データ中心の枠組みLIMIT(Less Is More for Instruction Tuning in Text-to-SQL)を提案し、例を戦略的に選べば、非常に小さな学習集合からでも強いデータベース推論能力が得られることを示す。LIMITは四つの段階からなる。モデルが学習可能な境界にある標本を特定する難易度に応じたフィルタリング、一貫性に基づく選択を伴う思考過程の合成、LLMを判定役に使う多次元の品質採点、そしてスキーマの網羅性と標本品質を同時に最大化する遺伝的アルゴリズムによる最適化である。 BIRDとSpiderベンチマークでは、それぞれわずか796件と863件を選びながら、テーブル網羅率100%を達成し、Qwen3-8Bで実行正解率69.1%と88.9%を得た。この結果は20倍のデータで学習した手法を上回り、オープンソース手法の中で新たな最高性能を確立する。これらの知見は、規模よりも慎重なデータ選別が、効率的なText-to-SQL学習の鍵であることを示唆する。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-21(UTC)
- 最新改訂
- 2026-09-21 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-21 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Large language models have achieved remarkable progress on Text-to-SQL through reasoning-enhanced fine-tuning, yet existing approaches predominantly rely on massive instruction corpora under the assumption that scale drives performance. We challenge this paradigm by investigating a fundamental question: what is the minimal data requirement for effective Text-to-SQL instruction tuning? We propose LIMIT(Less Is More for Instruction Tuning in Text-to-SQL), a data-centric framework that demonstrates strong database reasoning can emerge from an extremely compact training set when examples are strategically selected. LIMIT operates through four stages: difficulty-aware filtering that identifies samples within the model's learning frontier, chain-of-thought synthesis with consistency-based selection, multi-dimensional quality scoring via LLM-as-judge, and genetic algorithm optimization that jointly maximizes schema coverage and sample quality. On the BIRD and Spider benchmark, LIMIT selects only 796 and 863 samples while achieving 100% table coverage, enabling Qwen3-8B to reach 69.1% and 88.9% execution accuracy.This result surpasses methods trained on 20 times more data and establishes a new state-of-the-art among open-source approaches. Our findings suggest that careful data curation, rather than scale, is the key to efficient Text-to-SQL learning.
arXiv ID: 2609.24186 / 要約の誤りについて