arXiv論文メモ
新着一覧
cs.AI · 査読状況未確認

議論履歴からLLMごとの信頼性を推定して回答を集約

Counting Moves, Weighing Voices: Bayesian Dialectical Argumentation for Calibrated Multi-LLM Councils under Persistent Adversaries

Ionel Eduard Stan and Paolo Napoletano

この論文をやさしく読む

ひとことで言うと

複数のLLMが議論した内容から、各モデルがどれだけ信用できるかを推定し、回答の正しさの確率を計算する方法です。意見の数だけでなく、提案・反論・譲歩の種類を使います。

何に役立つ?

複数モデルの回答を集約する際に、確信の強さを正答確率と取り違えないための方法になります。継続的に誤った発言をする参加者がいる条件での頑健性も評価しています。

この研究の面白いところ

一貫して信用できない参加者を除外するだけでなく、逆向きの情報として利用できます。既に得られた議論履歴を使うため、集約のための追加LLM呼び出しを要しません。

どこまで分かった?

要旨には具体的なベンチマーク名や較正誤差の値はありません。「ゼロ追加コスト」は追加LLM呼び出しがないという意味で、評議会の議論自体や集約計算の費用が不要という意味ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

複数LLMによる評議会は、いくつかの大規模言語モデル(LLM)に問いを議論させ、回答と信頼度の推定値を返す。こうしたシステムが推論に使われることが増えるなか、その信頼度は較正された「正しい確率」を表すべきであり、一部のエージェントが継続的に信頼できない場合にも、判断は頑健である必要がある。既存の評議会集約法は、この両面で不十分である。信頼度は正しさではなく判断の強さを測っており、継続的に信頼できないエージェントを特定したり、その影響を割り引いたりできない。 本研究ではBayesian Dialectical Argumentation(BDA)を導入する。これは、誰がどの回答を提案し、異議を唱え、譲歩したかという、種類を区別した評議会内の行動を、エージェントごとの信頼性を持つ古典的なアノテータモデルの観測として扱う。この定式化によって、複数エージェントの審議を信頼性推定の問題として捉え直し、議論履歴から、持続的な敵対行動の下でのエージェントの信頼性を推定する。 推定された信頼性に応じて証拠に重みを付けることで、BDAは回答候補に対する較正された事後確率を生成する。同時に、継続的に信頼できないエージェントを単に多数決で負かすのではなく、その判断を反転して利用できる。二値・多クラスのベンチマークを通じて、BDAは追加のLLM呼び出しを必要としないゼロ追加コストの評議会集約法の中で最良の較正を達成し、敵対者のいない設定で競争力を保ちながら、持続的な敵対的集団に対する頑健性を改善する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-10-01(UTC)
最新改訂
2026-10-01 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

A multi-LLM \emph{council} lets several large language models (LLMs) deliberate on a question and return an answer together with a confidence estimate. As these systems become increasingly used for reasoning, that confidence should represent a calibrated \emph{probability of being correct}, and the decision should remain robust when some agents are persistently unreliable. Existing \emph{council aggregation} methods fail on both fronts: their confidence estimates measure decisiveness rather than correctness, and they cannot identify or discount persistently unreliable agents. We introduce Bayesian Dialectical Argumentation (BDA), which treats the council's \emph{typed} moves---who proposed, challenged, or conceded which answer---as observations of a classical annotator model with \emph{per-agent} reliabilities. This formulation recasts multi-agent deliberation as a reliability estimation problem, using the deliberation trace to infer agent reliability under persistent adversarial behavior. By weighting evidence according to inferred agent reliability, BDA yields calibrated posterior probabilities over candidate answers while allowing persistently unreliable agents to be inverted rather than merely outvoted. Across binary and multi-class benchmarks, BDA achieves the best calibration among zero-cost council aggregation methods, requiring no additional LLM calls, and improves robustness under persistent adversarial coalitions while remaining competitive in clean settings.

arXiv ID: 2610.02005 / 要約の誤りについて