高速推論モデルの性能向上に混入する思考モードの影響
Thinking Leakage: A Causal Audit of NoThink Post-Training in Hybrid Reasoning Models
この論文をやさしく読む
ひとことで言うと
高速なNoThinkモードの性能向上に、元からあるThinkモードの働きがどれだけ関わるかを調べた研究。
何に役立つ?
推論モデルの追加学習を評価する際、真のNoThink能力の改善と既存の思考動作の再利用を区別する手がかりになる。
この研究の面白いところ
内部の活性化をThink方向と逆方向へ動かす介入で因果的な寄与を調べ、9チェックポイントで42~79%の漏れ込み比率を報告した。
どこまで分かった?
要旨の検証は3モデル、3学習法、競技数学のベンチマークに基づく。他の課題で同じ比率になるとは記載されていない。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
推論を速く保ちながら性能を高める方法として、推論モデルをNoThinkモードで追加学習することへの関心が高まっている。しかし、その性能向上は、基盤モデルのThinkモードですでに利用できる思考の振る舞いに依存している可能性がある。本研究は、この「思考の漏れ込み」を因果媒介の枠組みで定式化し、基盤モデルから導いた単純な活性化方向に沿って両方向に介入し、その寄与を検証する。競技数学のベンチマークで、3モデルと3種類の追加学習法を調べた結果、漏れ込みは実在し、因果的で、影響も大きかった。行動と内部表現の分析ではThink方向への移動が見られ、基盤モデルをその方向へ誘導すると追加学習による正答率向上の大部分が再現され、学習後のチェックポイントを逆方向へ誘導すると向上分のかなりの割合が失われた。NoThinkの性能向上が見られた対応する9つのチェックポイントでは、漏れ込みの比率は42~79%だった。これらの介入は、思考の漏れ込みが相当程度、因果的に寄与することを支持する。したがって、追加学習法の見かけ上の優位性には、Think方向への移動がより大きいことが反映される場合があり、NoThinkの枠内で能力を高めたのか、既存のThinkの振る舞いをより強く呼び戻したのかを見分けにくくなる。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-23(UTC)
- 最新改訂
- 2026-09-23 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-23 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Post-training hybrid reasoning models in NoThink mode has attracted growing interest as a way to improve performance while keeping inference fast. However, these gains may draw on thinking behavior already accessible through the base model's Think mode. We formulate this thinking leakage in a causal mediation framework and audit its contribution using bidirectional interventions along a simple base-derived activation direction. Across three models and three post-training methods on competition math benchmarks, we find that leakage is real, causal, and substantial: behavioral and representational analyses reveal shifts toward Think, steering the base model along this direction reproduces most of the post-training accuracy gain, and counter-steering a checkpoint removes a substantial share of what it gains. Across nine aligned checkpoints with positive NoThink gains, the resulting leakage ratio ranges from 42% to 79%. These interventions support a substantial causal contribution of thinking leakage. Our findings show that a post-training method's apparent advantage can therefore reflect greater drift toward Think, obscuring whether it improves capability within NoThink or more effectively re-invokes existing Think behavior.
arXiv ID: 2609.28682 / 要約の誤りについて