視覚言語モデルの推論過程を監視しやすくする学習法
Taming CoT Obfuscation in VLMs: From Mechanistic Evidence to Activation Enforcement
この論文をやさしく読む
ひとことで言うと
強化学習で答えが当たりやすくなっても、説明が根拠から離れて監視しにくくなる問題を、内部の活性を制御して抑える研究です。
何に役立つ?
モデルの推論記録を人や監視モデルが点検する際、その記録の根拠との結び付きを維持するための学習法として役立つ可能性があります。
この研究の面白いところ
定型表現に関係する活性を常に抑えるのではなく、強化学習前の水準を超えた部分だけに罰則を与えます。人手と別系列の監視モデルでも改善を確認しています。
どこまで分かった?
改善幅は監視可能性の指標のパーセントポイントです。正解率の変化は小さく方向が混在し、一般能力にも課題別の得失があります。CoTの不明瞭化をモデルの意図的な隠蔽と解釈する研究ではありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
強化学習(RL)は視覚言語モデル(VLM)の推論能力を高める一方で、思考の連鎖(CoT)の不明瞭化を引き起こすことがある。これは意図的なものではなく、課題の報酬や正解率が上がる一方、推論記録の根拠との結び付きや監視可能性が低下するという、運用上の結果を指す。先行研究は主に挙動の面からこの劣化を記録してきたが、表現レベルで何が対応して変わるのか、有効な制御をどう行うかは明確でない。本研究では、RL中に定型表現に関連する活性と根拠に関連する活性の分離性が低下することを見いだす。条件を揃えた介入も、選択した特徴が監視可能性の低下に寄与することを支持する。 この証拠に基づき、Targeted Anti-obfuscation with Mechanistic Enforcement(TAME)を提案する。TAMEはスパースオートエンコーダ(SAE)を用い、行動に対するフィードバックと、RL中の定型表現に関連する活性の選択的抑制を組み合わせる。非対称な制約は、定型表現の活性がRL前の基準値を超えた場合にのみ罰則を与える。これによって局所化した特徴を基準に留めながら、行動フィードバックで根拠に即した改善を促す。VIRL-39k、SPA-VLと2つのモデル系列において、TAMEはグループ相対方策最適化(GRPO)に比べ、CoTの監視可能性をそれぞれ最大30.9ポイント、16.7ポイント改善する。盲検の人手評価でも両データセットで監視可能性が高く、評価用に取り分けた2系列の監視モデルでも改善が再現される。課題の正解率の変化は小さく、改善と悪化が混在し、一般能力ベンチマークでは課題ごとのトレードオフが見られる。これらの結果は、RLで学習したマルチモーダルシステムをより監査しやすくするため、行動の監視から表現レベルの監督へ進む道筋を示す。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-21(UTC)
- 最新改訂
- 2026-09-21 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-21 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Reinforcement learning (RL) improves reasoning in vision-language models (VLMs) but can induce chain-of-thought (CoT) obfuscation: an operational, non-intentional outcome where task reward or accuracy rises while traces become less grounded and monitorable. Prior work largely documents this decay behaviorally, leaving its representation-level correlates and actionable controls unclear. We find that template- and ground-associated activations become less separable during RL; matched interventions support the contribution of selected features to monitorability degradation. Guided by this evidence, we propose Targeted Anti-obfuscation with Mechanistic Enforcement (TAME), which uses Sparse Autoencoders (SAEs) to combine behavioral feedback with targeted suppression of template-associated activations during RL. Its asymmetric constraint penalizes template activations only above their pre-RL baseline, anchoring the localized features while behavioral feedback promotes grounded refinements. Across VIRL-39k, SPA-VL, and two model families, TAME improves CoT monitorability by up to 30.9 and 16.7 percentage points over Group Relative Policy Optimization (GRPO), respectively. Blinded human evaluation finds higher human monitorability on both datasets, and two held-out monitor families reproduce the monitorability gains. Task accuracy changes are small and mixed, and general-capability benchmarks show task-specific trade-offs. These results provide a path from behavioral monitoring to representation-level oversight for more auditable RL-trained multimodal systems.
arXiv ID: 2609.24243 / 要約の誤りについて