arXiv論文メモ
新着一覧
cs.AI · 査読状況未確認

言語モデルの内部解析から動作誘導の位置と強さを選ぶ

Deep Noir: Autonomous Steering Discovery via Architectural Chronometry in Transformer Models

Frank E. Bobe III, Gregory D. Vetaw, Darshan W. Bryner, Matthew G. Cook, and Jose L. Salas-Vernis

この論文をやさしく読む

ひとことで言うと

言語モデルの内部活動をどこでどれだけ変えるかを自動で探し、分類性能を改善する方法です。

何に役立つ?

考えられる用途は、モデルを推論時に調整する際の手作業の削減です。

この研究の面白いところ

層ごとの予測収束と注意ヘッドの寄与を使って介入点を探し、モデル規模やタスクをまたぐ改善を報告しています。

どこまで分かった?

スパム・感情分類などでの検証です。同時に、介入を強くするとプロンプト注入への脆弱性が高まる傾向も報告しており、性能向上だけの結果ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

活性化ステアリングは推論時に大規模言語モデルの振る舞いを変えるが、どこをどの程度の強さで誘導するかの特定は依然として手作業である。Logit Lensの収束と、注意ヘッド単位の因果的寄与分析を用いて、最適なステアリング・パラメーターを自律的に見つける枠組みDeep Noirを導入する。 三つの規模(10億パラメーター級3モデル、20億〜30億級2モデル、70億〜90億級4モデル)で評価した。このエンジンは、10億級のスパム課題で16.7パーセントポイントの改善を達成した(標準偏差4.7、39回の実行)。70億〜90億級では、四つのアーキテクチャにわたる改善幅が21〜42パーセントポイントに増える。SST-2感情分類では、コードを変更せず13.1パーセントポイントの改善を達成する。 内部機構に根拠を置くことで、課題やアーキテクチャをまたいで一般化する介入点を自動発見できる。感情分類では、ヘッドマスキングを使わないRepEは基準を上回れない一方、Deep Noirはすべてのモデルを改善する(p<0.01)。さらに、ステアリングが予測可能なプロンプトインジェクションの攻撃面を生み、その脆弱性がステアリングの強さとともに単調に増加することを示す。この知見は、ステアリングされた分類器を導入するエージェントシステムに関係する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-17(UTC)
最新改訂
2026-09-17 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Activation steering modifies LLM behavior at inference time, but identifying where and how strongly to steer remains manual. We introduce Deep Noir, a framework that uses Logit Lens convergence and causal head-level attribution to autonomously discover optimal steering parameters. Across three scales (1B x 3, 2-3B x 2, and 7-9B x 4), our engine achieves 16.7 percentage-point improvement on spam at 1B (standard deviation 4.7; 39 runs), with gains increasing to 21 to 42 percentage points at 7-9B across four architectures. On SST-2 sentiment, it achieves a 13.1 percentage-point improvement with zero code changes. Mechanistic grounding enables automated discovery of intervention points that generalize across tasks and architectures. On sentiment, RepE without head masking fails to improve over baseline, while Deep Noir improves all models (p less than 0.01). We further show that steering creates a predictable prompt-injection attack surface whose vulnerability increases monotonically with steering magnitude. This finding is relevant to agent systems deploying steered classifiers.

arXiv ID: 2609.20722 / 要約の誤りについて