arXiv論文メモ
新着一覧
cs.CL · 査読状況未確認

LLMの安全性に共通の有害性だけでなくリスク別信号も関与

The Role of Fine-grained Harm Signals in LLM Safety

Soyeon Park, Seogyeong Jeong, Sunwoo Kim, Alice Oh

この論文をやさしく読む

ひとことで言うと

AIが危険さを捉える内部信号を、共通部分とリスク別の部分に分け、後者が有害性の認識や回答拒否にどう関わるかを調べています。

何に役立つ?

モデルの安全性を解析する際、単一の共通した有害性の方向だけを見る評価を補う知見になります。

この研究の面白いところ

ある層で共通の有害性と直交する成分でも、その後の層では共通の有害性表現を強め得るという、層をまたぐ関係を示しています。

どこまで分かった?

評価は指示調整済み3モデルと11カテゴリでの活性操作です。有害性を表す傾向と拒否を起こす傾向は異なり、特に拒否の傾向はモデルに依存します。

v2のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

先行研究では、大規模言語モデル内部の有害性表現はリスクのカテゴリごとに異なる一方、一般的な有害性を表す共通成分を持つことが示されている。ここから、LLMの安全性において、一般的な有害性表現以外のカテゴリ固有成分がどのような役割を果たすかという問いが生じる。本研究では、各カテゴリの有害性表現から共有された一般的な有害性表現を除き、すべての層で一般的な有害性に直交するカテゴリ残差を得ることで、固有成分を分離する。 指示調整済みLLM3種類の11のリスクカテゴリについて、カテゴリ残差を使って活性を操作したところ、残差が有害性を符号化するかどうかはカテゴリによって異なり、このカテゴリ別の傾向はモデル間で似ていた。一方、残差が回答拒否を誘発するかどうかもカテゴリによって異なるが、こちらのカテゴリ別傾向はモデルへの依存がより強かった。また、カテゴリ残差は、後段でのLLM内部表現と、共有された一般的な有害性表現との整合を強めることも分かった。 これらの知見は、LLMの安全性を十分に理解するためには、共有された一般的な有害性表現に加えて、より細かなカテゴリ残差も考慮する必要があることを示す。より広くは、ある層で概念に直交する方向であっても、後段でその概念を増幅することに寄与し得ることを示している。

v2の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-16(UTC)
最新改訂
2026-09-18 · v2
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Prior work has shown that internal harmfulness representations in large language models vary across risk categories, while sharing a common general harm representation component. This raises a question about the role of the category-specific component beyond general harm representation in LLM safety. To answer this question, we isolate the category-specific component by removing shared general harmfulness representation from each categorical harmfulness representation, yielding a category residual that is orthogonal to general harmfulness at every layer. Using activation steering with category residuals across 11 risk categories in 3 instruction-tuned LLMs, we find that whether category residuals encode harmfulness varies across categories, and that this category-wise pattern is similar across models. Whether category residuals induce refusal also varies across categories, but this category-wise pattern is more model-dependent. We also find that category residuals increase LLMs' downstream internal alignment with shared general harmfulness representation. Together, these findings demonstrate that more fine-grained category residuals should also be considered beyond shared general harmfulness representation to fully understand LLM safety. More broadly, our findings show that even a direction orthogonal to a concept at one layer can contribute to the concept's downstream amplification.

著者のコメント

9 pages, 6 figures

arXiv ID: 2609.19366 / 要約の誤りについて