arXiv論文メモ
新着一覧
cs.AI / cs.LG · 査読状況未確認

難しい問題を段階的に易しくして推論を学習

Ladders of Thought: A Self-Evolving Curriculum of Progressively Simplified Reasoning Traces

Minghui Liu, Thomas Magelinski, Dehao Yuan, Qi Yu, Furong Huang

この論文をやさしく読む

ひとことで言うと

難しい推論問題を意味を保って易しく書き換え、モデルの進み具合に応じて学習問題を選ぶ方法。

何に役立つ?

小・中規模の言語モデルの数学や複数段階の推論を改善する学習方法として役立つ可能性がある。要旨では複数のモデル系列と課題で比較している。

この研究の面白いところ

難易度別の問題を固定順で与えず、バンディット型の仕組みで学習量を調整する。蒸留より成績が上がり、段階固定のカリキュラムより早く収束した。

どこまで分かった?

改善幅は課題やデータセットによって異なり、評価対象は数学と複数段階の推論、および10億〜80億パラメータのモデルである。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

大規模言語モデルは数千億のパラメータまで拡大すると推論に優れるが、小・中規模モデルは知識蒸留(KD)を使っても推論が不安定である。本研究は、問題を段階的に書き換えることと、自ら変化するカリキュラムを組み合わせて推論力を高める枠組み、Ladders-of-Thought(LoT)を提案する。LoTは、元の意味を保ちながらより易しくした推論問題を自動生成し、解答の段階数に基づく尺度で難易度ごとに分け、自ら更新するバンディット型のスケジューラで学習量を適応的に割り当てる。 数学と複数段階の推論という二つの分野で、異なる系列の10億〜80億パラメータのモデルを評価したところ、LoTはKDを一貫して上回った。算術課題では大きな改善があり、例えばAddSubで32パーセントポイント、SVAMPで25ポイント向上した。同じ分野のテスト分割では2〜8ポイント改善し、複数段階の推論でもデータセットによって差はあるが、QASCで16ポイント、StrategyQAで25ポイント向上した。LoTは段階を固定したカリキュラムよりも早く収束した。これらの結果は、段階的な書き換えと適応的なカリキュラムの組合せが、小規模な言語モデルの推論を強化する簡潔で有効な方法であることを示す。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-22(UTC)
最新改訂
2026-09-22 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Large language models (LLMs) excel at reasoning when scaled to hundreds of billions of parameters, but small- and mid-scale models remain brittle reasoners even with knowledge distillation (KD). We present Ladders-of-Thought (LoT), a framework that improves reasoning by combining progressive question rewrites with a self-evolving curriculum. LoT automatically generates semantically faithful but easier variants of reasoning problems, organizes them into difficulty buckets using step-based measures, and employs a self-evolving bandit scheduler to allocate training adaptively. Evaluated on two reasoning domains, math and multi-hop reasoning, across 1-8B models from different families, LoT consistently improves over KD. It delivers large gains on arithmetic tasks (e.g., +32 percentage points on AddSub, +25pp on SVAMP), +2-8pp improvements on in-domain test splits, and strong though dataset-dependent benefits on multi-hop reasoning (e.g., +16pp on QASC, +25pp on StrategyQA). LoT also converges faster than staged curricula, highlighting the value of adaptive progression. These results show that progressive rewrites coupled with adaptive curricula provide a simple yet effective recipe for strengthening reasoning in smaller LLMs.

arXiv ID: 2609.25643 / 要約の誤りについて