問題の難易度を調整しながら言語モデルを自己改善する
STRETCH the Boundaries: A Unified Self-Taught Framework for Progressive LLM Evolution
この論文をやさしく読む
ひとことで言うと
言語モデルが自分の能力に合った少し難しい問題を作り、その問題を解く学習と交互に進める方法です。
何に役立つ?
固定問題で自己学習が停滞する場合に、課題の難易度を学習の進み具合に合わせる設計として参考になります。
この研究の面白いところ
問題を出す役と解く役が同じパラメータ空間を使い、互いの進歩に応じて課題と解答を変えていく構成です。
どこまで分かった?
報告は交渉とオペレーションズ・リサーチのベンチマークに基づきます。要旨に改善率や学習コストの数値はなく、報酬ハッキングを完全に防止する保証も述べられていません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
大規模言語モデル(LLM)の自己改善学習では、固定した難易度が変化する能力に適応しないため、能力が停滞することが多い。この問題に対処するため、認知的な足場かけの理論に着想を得た統一的な枠組みSTRETCH(Self-Taught Reasoning Evolution via Targeted CHallenge)を提案する。STRETCHは、問題の難しさをモデルの解答能力に継続的に合わせる、動的なStretch Zone機構を導入する。 単一のパラメータ空間で、モデルは、能力の境界を押し広げる適応的な課題を生成するScaffolderと、強化学習によって解答軌跡を最適化するLearnerの役割を交互に担う。この二重ループの共進化は、学習を効果的に安定化させ、報酬ハッキングを軽減し、推論能力の段階的な向上を促す。交渉とオペレーションズ・リサーチの両ベンチマークでの実験により、STRETCHが有力なプロンプティング手法や分野専用の比較手法を一貫して上回ることを示す。Scaffolderの設定に関する追加分析は、能力改善を持続させ、推論の進化を同期させるうえで、動的な難易度の調整が重要であることを示す。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-16(UTC)
- 最新改訂
- 2026-09-16 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-16 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Large language models (LLMs) often suffer from capability stagnation in self-improvement training because fixed difficulty levels fail to adapt to their evolving proficiency. To address this issue, we propose STRETCH (Self-Taught Reasoning Evolution via Targeted CHallenge), a unified framework inspired by cognitive scaffolding theory. STRETCH introduces a dynamic Stretch Zone mechanism that continuously aligns question difficulty with the model's solving capability. Within a single parameter space, the model alternates between a Scaffolder that generates adaptive, boundary-pushing challenges and a Learner that that optimizes its solving trajectories through reinforcement learning. This dual-loop co-evolution effectively stabilizes training, mitigates reward hacking and promote progressive reasoning growth. Experiments on both negotiation and operation research benchmarks demonstrate that STRETCH consistently outperforms strong prompting and domain-specific baselines. Further scaffolder configuration analysis shows that dynamic difficulty alignment is critical for sustained capability improvement and synchronized reasoning evolution.
arXiv ID: 2609.18642 / 要約の誤りについて