arXiv論文メモ
新着一覧
cs.CL / cs.LG · 掲載先の記載あり

著者照合に対照学習を使うModernBERTモデル

Contrastive Learning for Authorship Verification

Peter Kirby

この論文をやさしく読む

ひとことで言うと

文章の著者が同じかどうかを判定するため、対照学習を使ったモデルを評価した。

何に役立つ?

考えられる用途は、文章の著者照合の性能改善である。要旨で報告する98.4%の正解率はPAN21課題での値である。

この研究の面白いところ

学習方式だけでなく、損失関数、文脈長、文章の一部を使うデータ拡張など複数の設計要因を調べた。

どこまで分かった?

比較優位は調べた条件下の結果である。他のデータセットや実際の作者特定への精度は要旨には示されていない。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

著者らの結果は、調べた条件下で、著者が同じかどうかを判定する課題において、対照学習が分類に基づく方法より優れていることを示す。損失関数、バッチサイズ、学習期間、事前学習済みモデル、入力の文脈長、文章の一部をランダムに取り出すデータ拡張が、モデル性能を左右する重要な要因であると特定した。これらを踏まえてModernBERTのバイエンコーダーモデルを開発し、PAN21の著者照合課題で98.4%の正解率を達成した。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-23(UTC)
最新改訂
2026-09-23 · v1
査読・掲載
掲載先の記載あり

著者による掲載先の記載:Experimental IR Meets Multilinguality, Multimodality, and Interaction (CLEF 2026), LNCS 17087, pp. 92-102, Springer (2027)。出版社での独立確認は未実施です。

arXivで読むPDFDOI

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Our results show that contrastive learning outperforms a classification-based approach to authorship verification under the tested settings. We identify loss function, batch size, training duration, pre-trained model, input context length, and random text span data augmentation as important factors of model performance. Based on these considerations, we develop a ModernBERT Bi-Encoder model that achieves 98.4% accuracy on the PAN21 authorship verification task.

著者のコメント

Published in the proceedings of CLEF 2026. Code: https://github.com/petekirby/contrastive-av

arXiv ID: 2609.28471 / 要約の誤りについて