生成文が伝える意味の忠実さと網羅性を別々に測る
A Semiotics-Aware Framework for Evaluating Fidelity and Coverage in Natural Language Generation
この論文をやさしく読む
ひとことで言うと
似た単語を使っているかだけでなく、同じ表現の意味や文脈をどれだけ忠実に、漏れなく伝えているかを二つの指標で調べます。
何に役立つ?
生成された説明文を人手で整備した文章と比較し、内容のずれと取りこぼしを分けて評価するために役立ちます。
この研究の面白いところ
記述した内容が相手の文章で裏づけられることと、相手が含む内容を十分に拾っていることを区別しています。忠実でも網羅的とは限らないという結果が出ています。
どこまで分かった?
要旨には使用データの規模や各スコアの具体的な数値はありません。低温度での整合性向上は報告された実験の結果で、すべての生成タスクに最適な温度を定めたものではありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
二つの文章が同じ表現を説明するとき、単語の重なりや文章全体の類似度に基づく標準的な指標では、その表現をどのように位置づけているかという重要な違いを検出できない場合がある。本研究では、文章間の記号論的な整合性を評価する枠組みを提案する。ここで記号論的プロファイルには、文脈上の意味と、その文章によって目立たせられる談話上の参照対象の両方が含まれる。 提案手法は、記号論的忠実度(Semiotic Fidelity)と記号論的網羅度(Semiotic Coverage)という二つのスコアを算出する。一方の文章のプロファイルのどの程度が他方に裏づけられるか、また他方のプロファイルのどの程度を回収できているかを推定する。実験では、一般に網羅度は忠実度より低く、LLMと人手で整備したデータとの整合性はサンプリング温度が低いときに最も高く、温度を上げるとその整合性が低下することが示された。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-22(UTC)
- 最新改訂
- 2026-09-22 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-22 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
When two texts describe the same expression, standard metrics based on lexical overlap or whole-text similarity may fail to detect meaningful differences in how that expression is framed. We propose a framework to evaluate semiotic alignment between texts, where a semiotic profile encompasses both the contextual meaning and the discourse references made salient by a text. Our approach yields two scores, Semiotic Fidelity and Semiotic Coverage, estimating how much of one text's profile is supported by the other and how much of the other's profile it recovers. Experiments show that coverage is typically lower than fidelity, and that alignment between LLMs and human-curated data is highest at low sampling temperatures, while higher temperatures reduce this alignment.
arXiv ID: 2609.26527 / 要約の誤りについて