arXiv論文メモ
新着一覧
cs.CL / cs.AI · 査読状況未確認

潜在空間の推論を操作しても言語出力に伝わりにくい

When Steering Fails in Latent Reasoning: A Latent-to-Language Transition Gap

Gaoxiang Huang, Lei Qi

この論文をやさしく読む

ひとことで言うと

AIの内部で言葉になっていない推論を動かしても、その変化が最終的な言葉の出力には伝わりにくいという研究です。

何に役立つ?

内部表現の変化だけを見て制御が成功したと判断せず、実際の出力まで確認する評価に役立ちます。潜在推論を制御する新しい手法の設計箇所も示唆します。

この研究の面白いところ

課題の情報が内部から消えたわけではないのに、操作の効果は弱くなります。情報の有無と、言語出力へ影響を伝えられるかを切り分けています。

どこまで分かった?

遷移ギャップは実験結果が支持する仮説として提示されています。要旨には対象モデルや効果量の詳細がなく、あらゆる潜在推論モデルで同じ機構が成立するとは示されていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

活性化ステアリングは、明示的な思考連鎖(CoT)推論中の言語モデルを制御する方法として広く使われるようになり、潜在CoTへの拡張も動機付けられている。しかし本研究では、隠れた表現を同程度に動かした場合でも、連続表現での思考に対するステアリングが、その後の言語生成に与える効果は、明示的CoTへのステアリングより大幅に弱いことを見いだす。 まず、連続表現での思考の中でも課題に関する情報は識別可能なままであることを示す。このことから、潜在空間での介入効果が言語生成へ移らない「潜在表現から言語への遷移ギャップ」という仮説を立てる。さらに2つの結果がこの仮説を支持する。出力分布が遷移の境界で急激に変わることと、課題に関連する方向が及ぼす双方向の制御効果が、明示的CoTより潜在CoTではるかに弱いことである。これらの知見は、将来の潜在ステアリング手法の評価と設計において、遷移の接続部分が中心的な対象となることを明らかにする。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-18(UTC)
最新改訂
2026-09-18 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Activation steering has become a widely used approach for controlling language models during explicit chain-of-thought (CoT) reasoning, motivating its extension to latent CoT. However, we find that steering continuous thoughts produces substantially weaker effects on subsequent language generation than steering explicit CoT, even when the hidden representations are moved by comparable amounts. We first show that task information remains identifiable in continuous thoughts. Hence, we hypothesize a \textbf{latent-to-language transition gap}, in which an intervention effect in latent space fails to transfer to language generation. Two further results support this hypothesis: the output distribution changes abruptly at the transition boundary, and task-related directions exert much weaker bidirectional control in latent CoT than in explicit CoT. These findings identify the transition interface as a central target for evaluating and designing future latent-steering methods.

arXiv ID: 2609.21662 / 要約の誤りについて