arXiv論文メモ
新着一覧
cs.CL · 査読状況未確認

AIの内部を見ずに人が主張を検証できる条件を定式化

Human-LLM Deliberation as Interactive Proof: Conditions for Verifiability Without Transparency

Baotong Zhang, Dean Foster, João Sedoc

この論文をやさしく読む

ひとことで言うと

AIが出した難しい主張について、人が根拠を少しずつ問い、確認していくことで、誤った受理の確率を抑えられる条件を理論化しています。

何に役立つ?

AIの説明を人が確認する手順を設計する際に、必要な検証精度や作業負担を考える枠組みになります。確認回数だけを増やせばよいわけではないことも表します。

この研究の面白いところ

AIの内部を透明にする代わりに、やり取りの履歴に応じても有効な誤り評価を使って、受理の安全性を保証する点が特徴です。

どこまで分かった?

保証には、誤った確認通過と人間の確認誤りについて、履歴を経ても有効な上界が必要です。専門性や疲労を含む人間側の制約も関係します。任意の利用者とAIの会話がそのまま正しさを保証するという結果ではありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

大規模言語モデル(LLM)が、利用者自身では容易に構成できない議論を提示したとき、利用者はその主張を受け入れるべきかをどう判断できるだろうか。対話型証明に着想を得て、人間とLLMの熟議を、内部探索に制限のない証明者と、資源に制約のある人間の検証者の相互作用としてモデル化する。検証者はLLMの内部状態にアクセスせず、根拠となる詳細を求めて確認する。確認に合格するたびに、受理の閾値へ向けて証拠が蓄積する。 適応的に応答する証明者に対して、任意の時点で有効な健全性を証明する。関連するあらゆる履歴の後にも有効であり続ける、誤った主張の確認通過と人間の確認誤りの上界がタスクから与えられるなら、誤った主張を一度でも受理する確率は、選択した誤り水準以下となる。有限期間内の完全性の評価には、さらに、誠実な応答の十分性に関する評価と、十分な診断的進展が必要になる。 確認を追加すると受理の証拠を強められるが、そのたびに十分な応答と信頼できる人間の努力が必要となる。このトレードオフの下で保証が可能かどうかは、検証者の努力に使える予算、認知負荷、専門性、疲労に依存する。同じ資源予算の下で、与えられた評価によって、指定した局所的確認の列は保証できても、指定した全体的確認は保証できない条件を特定する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-21(UTC)
最新改訂
2026-09-21 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

When an LLM supplies an argument that a user could not readily construct, how can the user decide whether to accept its claim? Inspired by interactive proofs, we model human-LLM deliberation as an interaction between a prover with unrestricted internal search and a resource-bounded human verifier. The verifier requests and checks supporting details without access to the LLM's internal state. Passed checks accumulate evidence toward an acceptance threshold. We prove anytime-valid soundness against adaptive provers: the probability of ever accepting a false claim is at most a chosen error level, provided the task supplies bounds on false passes and human checking errors that remain valid after every relevant history. A finite-horizon completeness bound additionally requires bounds on the adequacy of honest responses and sufficient diagnostic progress. Further checks can strengthen the evidence for acceptance, but each requires another adequate response and reliable human effort. Whether this tradeoff permits certification depends on the verifier's effort budget, cognitive load, expertise, and fatigue. We identify conditions under which the supplied bounds certify a specified sequence of local checks but not a specified global check under the same resource budgets.

著者のコメント

48 pages, 3 figures

arXiv ID: 2609.24895 / 要約の誤りについて