arXiv論文メモ
新着一覧
cs.CL · 査読状況未確認

応答に合わせて続く会話で言語モデルの社会的偏りを調べる

DyMT-ESB: Dynamic Multi-Turn Evaluation of Social Bias in User-LLM Interactions

Rem Hida, Masahiro Kaneko, Daisuke Oba, Danushka Bollegala, Naoaki Okazaki

この論文をやさしく読む

ひとことで言うと

会話の返答に合わせて次の質問を変えながら、言語モデルの偏りが途中で現れたり消えたりする様子を評価します。

何に役立つ?

単発の質問や決まった長さの台本では見逃し得る偏りを、対話システムの評価で調べるために役立ちます。

この研究の面白いところ

偏りが会話の進行とともに一方向に増えるとは限らず、遅れて現れる場合や、いったん消えた後に再び現れる場合を扱っています。

どこまで分かった?

統制した対話生成・評価手順での実験です。要旨には対象モデル数や偏りの出現率などの詳細がなく、一般利用者の会話全体での発生頻度を示す結果ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

注意:本論文にはステレオタイプや社会的偏りの例が含まれる。大規模言語モデル(LLM)は一般の人々によって対話的な場面でますます利用されており、ステレオタイプに関わる害を含めた安全性のため、複数ターンの会話におけるモデルの振る舞いを評価することが重要である。しかし既存の複数ターンの社会的偏りの評価は、モデルの返答に適応しない、事前指定またはテンプレートに基づくユーザー入力に頼ることが多く、通常は会話の長さもあらかじめ固定している。 本論文では、進行中の対話履歴から追加のユーザー質問を生成し、可変のターン数で評価できる統制された評価手順を用いて、応答に応じた複数ターンのやり取りで社会的偏りがどう変化するかを研究する。実験結果は、一貫性のある、応答に応じた複数ターンの対話であってもLLMが社会的偏りを示すことを明らかにした。そこでは、後半になって現れる偏り、単調には変化しない偏りのパターン、偏りの再出現が見られた。これらの結果は、固定ターン数で事前に台本を作る手順を越えた評価の必要性を示す。本研究の知見は、社会的偏りをターン単位で変化する現象として分析する重要性を明らかにする。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-16(UTC)
最新改訂
2026-09-16 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Warning: This paper contains examples of stereotypes and social bias. LLMs are increasingly used in interactive settings by the general public, making the evaluation of model behavior in multi-turn conversational scenarios important for safety, including stereotyping-related harms. However, existing multi-turn social bias evaluations often rely on pre-specified or template-based user inputs that do not adapt to model responses and typically assume a fixed dialogue length in advance. In this paper, we study social bias dynamics in response-conditioned multi-turn interactions using a controlled evaluation protocol that generates follow-up user queries from the evolving dialogue history and allows evaluation over variable numbers of turns. Experimental results show that LLMs exhibit social bias even in coherent, response-conditioned multi-turn interactions, revealing late-emerging bias, non-monotonic bias patterns, and bias re-emergence. These results motivate evaluations that extend beyond fixed-turn, pre-scripted protocols. Our findings highlight the importance of analyzing social bias as a turn-level dynamic phenomenon.

著者のコメント

Accepted to Findings of EMNLP 2026

arXiv ID: 2609.18649 / 要約の誤りについて