arXiv論文メモ
新着一覧
cs.CL / cs.CY · 査読状況未確認

検索付きAIの回答を文脈の丸写しと比較して評価

The Copy Ceiling: An Input-Exposure Control for Ontology-Grounded Generation over Curated Corpora

John J. O'Hare

この論文をやさしく読む

ひとことで言うと

検索で正解を見せたために答えられたのか、見せていない情報まで回収したのかを分け、文脈の丸写しを基準に回答を評価する研究です。

何に役立つ?

検索拡張やグラフ付き生成の評価で、再現率の向上をそのまま推論能力の向上とみなさず、提示情報の取りこぼしと範囲外の回収を調べるために使えます。

この研究の面白いところ

平均再現率が0.26から0.92へ上がっても、コピーの基準を下回りました。語彙上は正解とされた非露出項目も、要求された関係を述べているかを確認すると妥当ではありませんでした。

どこまで分かった?

集計は推論の有無を直接判定するものではありません。423件の監査による97.1%は推定で、関係回収率全体を確立した値でもありません。運用評価の+0.27という品質改善も、内容固有の効果を陰性対照で確定した結果とは区別されています。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

言語モデルが、グラフに基づく検索を通じて整備済みのコーパスから回答するとき、根拠情報の付与による大きな性能向上だけでは、検索した構造に基づいて推論したことは示せない。文脈に正解が既に露出している可能性があるためである。本研究では、提示された文脈に各正解項目が含まれているか、回答がそれを回収したかに基づいて分類する、露出の集計を提案する。その単一指標の参照値は「コピー上限」、すなわち文脈を逐語的にコピーした場合に達成する再現率である。コピーに対する符号付き利得は、判定器を必要としないこの決定的な基準と比べた、モデルの再現率を測る。 10モデルを通じて、支援なしの再現率は平均0.26、根拠情報付きでは0.92となるが、コピーに対する利得は一様に負で、−0.067~−0.022である。1,136の対象事例を10モデルで評価した11,360件の正解項目観測のうち、文脈に露出していない項目が語彙上の一致として得点したのは3件だけだった。423件の観測について、引用検証に対称的な方針を適用した層別のモデル判定監査では、得点した項目の97.1%が要求された関係を述べていると推定される。露出していない3件は、関係に関する判定ではすべて不合格だった。 補助構造が露出させない対象では、語彙上の回収率は支援なしの0.121から、根拠情報付きの0.004へ下がる。判定では、支援なしで得点した92件のうち71件が妥当とされ、根拠情報付きの3件は一つも妥当とされなかった。ただし、これによって評価母集団全体の関係回収率が確立されるわけではない。質問をグラフのタイトル語彙の外へ言い換えると、露出率は0.964から0.328へ低下する一方、不在を契機とする代替処理が作動したのは506問中2問だけだった。 対応付けた運用環境の研究では、判定された品質がプールした全体で+0.27改善するが、陰性対照からは、整った形式で同一コーパス由来の情報ブロックを与える以上の、内容固有の効果は確立されない。これらの結果は、コーパス由来の評価で露出の集計を常設の対照とすることを支持する。この集計は、露出していた項目の取りこぼしと、露出を超えた回収を区別するものであり、推論が起きたかどうかを決定するものではない。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-21(UTC)
最新改訂
2026-09-21 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

When a language model answers from a curated corpus via graph-based retrieval, a large grounding uplift does not establish reasoning over the retrieved structure: the context may already expose the gold answers. We propose exposure accounting, which classifies each gold item by whether the shown context exposes it and whether the answer recovers it. Its scalar reference is the copy ceiling, the recall a verbatim copy of the context achieves; signed gain over copy measures the model's recall relative to this deterministic, judge-free baseline. Across ten models, unaided recall averages 0.26 and grounded recall 0.92, yet gain over copy is uniformly negative (-0.067 to -0.022). Of 11,360 gold-item observations, representing 1,136 target instances evaluated under ten models, only three unexposed items receive lexical credit. A stratified model-judged audit of 423 observations, with a symmetric quotation-verification policy, estimates that 97.1% of credited items assert the requested relation; all three unexposed credits fail relational adjudication. On targets the scaffold does not expose, lexical recovery falls from 0.121 unaided to 0.004 grounded; adjudication validates 71 of the 92 unaided credits and none of the three grounded credits, without establishing full-frame relational recovery rates. Rephrasing questions outside the graph's title vocabulary reduces exposure from 0.964 to 0.328, while an absence-triggered fallback activates on only 2 of 506 questions. A paired production study improves judged quality by +0.27 pooled, but negative controls do not establish content specificity beyond a well-formed on-corpus block. These results support exposure accounting as a standing control for corpus-derived evaluations. The accounting distinguishes exposed-item omissions from beyond-exposure recoveries; it does not determine whether reasoning occurred.

著者のコメント

28 pages, 6 figures

arXiv ID: 2609.24885 / 要約の誤りについて