中立的な指示でも画像生成に現れる偏りを測る
IMPLICIT-Bench: Measuring Implicit Bias in Text-to-Image Models under Neutral Prompts
この論文をやさしく読む
ひとことで言うと
性別などを指定していない普通の画像生成指示でも、モデルが固定観念に沿った絵を出す傾向を測るベンチマークです。
何に役立つ?
画像生成モデルの評価や、偏りを減らす方法の比較で、明示的に指定した属性以外の偏りを調べる用途があります。
この研究の面白いところ
同じ場面の意味を保ち、一つの偏りの次元だけを変えた3種類の指示を作ります。偏りを減らす際に元の指示の意味が保たれるかも評価します。
どこまで分かった?
対象は11分類・5,493プロンプトでの評価です。要旨には個々のモデルの偏りの数値や、偏り低減と意味忠実性のトレードオフの大きさは示されていません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
テキストから画像を生成する(T2I)モデルの偏りは通常、「ある職業の人の写真」のように枠を埋めるテンプレートで評価される。このようなテンプレートは、性別や肌の色などの明示的な人口統計的属性だけを個別に調べるものである。そのため、自然なプロンプトで生じる、より広い暗黙的な偏りを見落とす。すなわち、ステレオタイプに関わる属性を指定しなくても、モデルが既定でステレオタイプ的な出力を生成するという問題である。 本研究では、こうしたプロンプトの下でT2Iモデルの暗黙的偏りを測るベンチマークIMPLICIT-Benchを導入する。中心となる設計は、構造化知識グラフ(KG)を使って、制御されたプロンプトの3つ組を構成することにある。中立、ステレオタイプ、反ステレオタイプの3種類は、場面の意味を保ちながら一つの偏りの次元だけが異なる。これにより、テンプレート型ベンチマークではできない、偏りの効果の正確な帰属が可能になる。 IMPLICIT-Benchは11の偏りの分類にわたる5,493個のプロンプトからなり、複数モデルの一致、CLIPに基づく検証、人手評価を通じて検証されている。このベンチマークを使い、最先端のT2Iモデルが中立的プロンプトの下でも体系的な偏りを示すことを明らかにする。これは既存の評価ではほとんど見えない失敗の形である。さらにIMPLICIT-Benchを使って偏りを減らす手法を評価し、偏りの低減と意味への忠実さの間に根本的なトレードオフがあることを明らかにする。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-21(UTC)
- 最新改訂
- 2026-09-21 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-21 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Text-to-image (T2I) models are typically evaluated for bias using slot-based templates such as ``a photo of a [profession]''. Such templates probe only \emph{explicit} demographic attributes (e.g., gender, skin tone) in isolation. They overlook a broader \emph{implicit} bias that arises in natural prompts: when stereotype-relevant attributes are left unspecified, models still default to stereotypical outputs. We introduce IMPLICIT-Bench, a benchmark for measuring implicit bias in T2I models under such prompts. The key design is a structured-knowledge-graph (KG) construction of controlled prompt triplets: neutral, stereotype, and anti-stereotype variants that differ only along a single bias dimension while preserving scene semantics. This enables precise attribution of bias effects that template benchmarks cannot achieve. IMPLICIT-Bench comprises 5,493 prompts across 11 bias categories, validated through multi-model agreement, CLIP-based verification, and human evaluation. Using this benchmark, we show that state-of-the-art T2I models exhibit systematic bias under neutral prompts, a failure mode largely invisible to existing evaluations. We then use IMPLICIT-Bench to evaluate debiasing methods, uncovering a fundamental trade-off between bias reduction and semantic fidelity.
arXiv ID: 2609.24228 / 要約の誤りについて