集団の誤った合意に流される言語モデルの応答を抑える
Recovering Agentic Sovereignty: Mitigating the Consensus Paradox via Contrastive Epistemic Decoding
この論文をやさしく読む
ひとことで言うと
言語モデルが周囲の誤った合意に迎合する問題を、回答生成時の計算方法で抑える研究。
何に役立つ?
考えられる用途は、複数のエージェントから意見を受ける言語モデルの応答を評価・調整すること。報告された改善は指定されたモデルとベンチマークでの結果である。
この研究の面白いところ
別の弱いモデルを用意せず、同じモデルの2回の計算を対比して同調バイアスを抑える。モデルによって、課題への集中と集団への反論という異なる振る舞いが観察された。
どこまで分かった?
評価は3種類のモデルと7200件の対応づけられた軌跡に基づく。別のモデルや実環境で同じ改善が得られるかは要旨からは分からない。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
大規模言語モデル(LLM)には、敵対的な集団が示す合意に、モデル内部の性質として影響されやすい弱点がある。この迎合を抑えるため、著者らは追加学習を要しない推論時の介入手法、Contrastive Epistemic Decoding(CED)を導入する。弱い別モデルに依存する通常のContrastive Decodingとは異なり、CEDは同一のモデル構造で2回の前向き計算を行い、同調バイアスを取り出す。新しい非対称で下限をゼロに固定した確率の制限と、離散的な上位k件の切り詰めマスクを導入することで、文法を崩さずに有害な合意へ向かうトークンを数学的に抑制する。 Gemma-2(90億パラメータ)、Llama-3.1(80億)、Mistral v0.3(70億)を使い、GAIA、SWE-bench、Multi-Challengeという複雑なベンチマーク上の対応づけられた7200件の軌跡で評価した。CEDはモデル構造や位置に由来するバイアスを緩和した。認知的な手抜きの割合を最大で絶対値33.00ポイント減らし、精度を最大30.75%回復させた。主体的な判断を取り戻した際の振る舞いはモデルによって異なり、Gemma-2では受動的に課題へ集中し、Llama-3.1では模擬集団へ積極的に反論した。これは、追加学習なしで同調と能力を切り離せることを示している。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-22(UTC)
- 最新改訂
- 2026-09-22 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-22 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Large language models (LLMs) exhibit a parametric vulnerability to adversarial swarm consensus. To mitigate this sycophancy, we introduce Contrastive Epistemic Decoding (CED), a zero-shot inference intervention. Unlike standard Contrastive Decoding (CD) which relies on a weaker secondary model, CED utilizes a dual forward-pass on a single architecture to isolate conformity bias. By introducing a novel asymmetric, zero-bounded probability clamp and discrete top-k truncation mask, CED mathematically suppresses toxic consensus tokens without causing grammatical collapse. Evaluated across 7,200 paired trajectories on complex benchmarks (GAIA, SWE-bench, Multi-Challenge) using Gemma-2 (9B), Llama-3.1 (8B), and Mistral v0.3 (7B), CED successfully neutralizes architectural and positional biases. By reducing cognitive loafing by up to 33.00% absolute, CED drives significant performance gains, yielding up to a 30.75% accuracy recovery. Regaining sovereignty induces distinct architectural behaviors---passive task-focus in Gemma-2 and active refutation of the simulated swarm in Llama-3.1---showing CED decouples compliance from capability without fine-tuning.
arXiv ID: 2609.25570 / 要約の誤りについて