arXiv論文メモ
新着一覧
cs.CL / cs.AI · 査読状況未確認

GPTの安全性訓練で性差別は形を変えるのか

Harm Laundering in GPT Models: Evidence That Gender Discrimination Is Transformed Rather Than Reduced Across Safety-Trained Generations

Sarah Wyer, Sue Black, Noura Al Moubayed

この論文をやさしく読む

ひとことで言うと

有害な表現のスコアが下がっても、性別に関する表現上の偏りが減ったとは限らないと検討します。GPT系列15モデルの45万件の生成を分析します。

何に役立つ?

言語モデルの安全性評価で、表面的な毒性と表現上の不公平を分けて測る必要性を考える材料です。著者らは検出の条件と手順も提案しています。

この研究の面白いところ

毒性分類器では非有害とされる出力にも、話題の偏りがあるとしています。毒性スコアと表現上の害の指標で、公開時期との相関が異なる点を示します。

どこまで分かった?

結論はこのGPT系列、生成条件、分析指標に基づきます。すべての利用場面で同じ影響が出るという因果的な実証や、全生成モデルの比較ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

大規模言語モデルの安全性評価は、表面的な表現を判定する分類器に依存しており、それらはモデルの世代が進むにつれて有害性スコアが低下すると報告する。本研究では、この方法論が系統的に不完全であり、露骨な差別的内容は除去されるのではなく、別の形へ変換されていることを示す証拠を提示する。これを「有害性のロンダリング」と呼ぶ。 OpenAIのGPT系列に属するGPT-2からGPT-5までの15モデルについて、3つの人口統計学的条件の下で、性別を対象とする45万件の生成文を分析する。その結果、GPT-2の女性を対象とした出力で多かった性暴力のクラスターはGPT-4までに消える一方、男性を対象とした生成文には、ケアを担うこと、感情表現の幅、支援者としてのアイデンティティといった肯定的な表象領域が加わるが、女性を対象とした生成文には同様の変化が見られない。 この傾向はGPT-5で最も明瞭である。トピック5(1,997文書)は乳がんを男性の権利をめぐる議論として描く一方、女性を対象とした出力には同等のクラスターが一つもない。独立した3つの分類器は、この内容を非有毒と判定する。感情スコアはGPT-4で逆転し、初期モデルは女性をおとしめ、後期モデルは過剰に補正する。GPT-4のアラインメントの境界では、女性を対象とした生成文のトピック多様性が男性に対して相対的に36%低下する。女性/男性比は、GPT-2の0.91から0.58になる。 REGARDが測定する表象上の有害性の格差は公開日と相関する(ρ = +0.55、p = .034)が、Detoxifyでは相関しない(ρ = −0.23、p = .42)。すなわち、表象上の有害性が増す一方で、有毒性スコアは低下する。有害性のロンダリングを3基準の検定として定式化し、あらゆる生成モデルに適用できる3段階の検出手順を提示する。OpenAIのGPT系列では、有毒性スコアの低下を、有害性低下の十分な代理指標とすることはできない。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-17(UTC)
最新改訂
2026-09-17 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Safety evaluations for large language models rely on surface-form classifiers that report declining harm scores across model generations. We provide evidence that this methodology is systematically incomplete: explicit discriminatory content is transformed rather than removed. We call this \emph{harm laundering}. Analysing 450,000 gender-directed completions across 15 models spanning GPT-2 through to GPT-5 (OpenAI GPT lineage; three demographic conditions), we show that sexual violence clusters prevalent in GPT-2 women-directed output disappear by GPT-4, while men-directed completions gain positive representational territory (caregiving, emotional range, ally identity) that women-directed completions do not. The pattern is most visible at GPT-5: Topic~5 (1,997~documents) frames breast cancer as a men's rights debate, while zero equivalent clusters appear in women-directed output. Three independent classifiers score this content as non-toxic. Sentiment scores invert at GPT-4: early models demean women; later models over-correct. Topic diversity in women-directed completions falls 36\% relative to men at the GPT-4 alignment boundary (W/M~$= 0.58$, from $0.91$ at GPT-2). REGARD representational harm disparity correlates with release date ($\rho = +0.55$, $p = .034$) while Detoxify does not ($\rho = -0.23$, $p = .42$): toxicity scores fall as representational harm grows. We formalise harm laundering as a three-criteria test and provide a three-stage detection protocol applicable to any generative model. Within the OpenAI GPT lineage, toxicity score reduction is not a sufficient proxy for harm reduction.

著者のコメント

Accepted at EMNLP 26 Main Conference

arXiv ID: 2609.20779 / 要約の誤りについて