arXiv論文メモ
新着一覧
cs.CL · 査読状況未確認

自由記述の文章生成で一貫性・多様性と人間の評価を比べる

Reference-Based Analysis of Coherence and Diversity in Open-Ended Text Generation

Esteban Garcés Arias

この論文をやさしく読む

ひとことで言うと

生成文章の一貫性と多様性を人間の参照文と比較し、人間の品質評価との関係を調べた。

何に役立つ?

自由記述の文章生成を評価する指標の解釈や比較に役立つ。自動指標だけで品質を確実に予測できると示したものではない。

この研究の面白いところ

文章の変化の推移、平均的な性質、参照分布での尤度を分けて調べ、参照文への類似と品質を混同しない。

どこまで分かった?

時間的な対応付けが単純な基準法より予測に優れるとは示されていない。参照尤度の結果も参照文の設定や採点範囲によって変わる。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

自由記述の文章生成を評価するには、続きの文章のさまざまな性質が、知覚される品質とどう関わるかを理解する必要がある。本研究では、参照文を使って一貫性と多様性を調べる枠組みを、三つの観点から提示する。第一に、これらの性質の時間的な変化を人間の文章での推移に合わせる。第二に、同じ指示文に対する人間の続きの文章と、性質の要約値を比較する。第三に、人間の参照文章の分布の下で、生成された文章の尤度を推定する。人間による品質評価を使った実験では、多様性に基づく推移の対応付けと平均値に基づく比較が、品質に関係する違いを捉えることが示唆された。ただし、これらの比較は、単純な基準法より時間的な対応付けの予測性能が優れることを示してはいない。参照文に基づく尤度も評価との正の関連を示したが、結果は参照文の構成や採点する文章の範囲によって変わった。これらの分析は、測定された一貫性・多様性と人間の判断との関係を体系的に調べる方法を提供しつつ、人間の参照文との類似性と品質そのものを区別する。コードと分析資料は公開されている。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-23(UTC)
最新改訂
2026-09-23 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Evaluating open-ended text generation involves understanding how different properties of a continuation relate to its perceived quality. We present a reference-based framework for examining coherence and diversity through three perspectives: aligning their evolution with human trajectories, comparing their summaries with a human continuation of the same prompt, and estimating their likelihood under a human reference distribution. Experiments with human quality ratings suggest that diversity-based alignment and mean-based comparisons capture quality-related variation, although the comparisons do not establish a predictive advantage for temporal alignment over simpler baselines. Reference likelihood also shows positive associations with ratings, with results varying across reference configurations and scoring horizons. Together, these analyses provide a structured way to examine how measured coherence and diversity relate to human judgments, while distinguishing similarity to human references from quality itself. Code and analysis resources are available at https://github.com/EstebanGarces/likely_human.

著者のコメント

Accepted at INLG 2026

arXiv ID: 2609.28080 / 要約の誤りについて