検証可能な報酬で生成型イベント抽出を改善
EAGER: Enhancing Generative Event Extraction via Reinforcement Learning with Verifiable Rewards
この論文をやさしく読む
ひとことで言うと
文章から出来事の種類や関係する語句を取り出す言語モデルを、細かく検証できる報酬で学習する方法。
何に役立つ?
イベント情報を所定の形式で抽出するモデルを改善する際、正確さだけでなく原文との対応や過剰生成も評価する設計に役立つ。
この研究の面白いところ
正誤だけの疎な報酬で学習信号が弱くなる問題に対し、形式・網羅性・文字列範囲などを分けた報酬と対比的推定を組み合わせた。
どこまで分かった?
要旨では7ベンチマークでの優位性を報告するが、具体的なスコアや実運用での性能は記載されていない。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
大規模言語モデルによる端から端までのイベント抽出は、イベントを示す語の特定、イベント種類の分類、定義済みの形式に沿った引数の文字列範囲の抽出を同時に要するため、依然として難しい。本研究は、生成型イベント抽出向けの強化学習の枠組みEAGERを提示する。細かい単位で検証できる報酬と、疎な二値報酬の下で優位度の差が失われる問題を和らげる「スキーマ対比的優位度推定」を組み合わせる。報酬設計では、構造の妥当性、抽出の正確さ、原文との対応、網羅性、過剰な生成、文字列範囲の精度を明示的に評価する。7つのベンチマークデータセットでの実験では、EAGERはプロンプトによる方法、教師あり微調整、従来の強化学習の比較法を一貫して上回り、従来の最良手法に対して大幅に改善した。結果は、課題に合った検証可能な報酬と対比的な優位度推定が、構造化された抽出を大きく改善することを示す。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-24(UTC)
- 最新改訂
- 2026-09-24 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-24 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
End-to-end event extraction remains challenging for large language models as it requires simultaneous identification of event triggers, classification of event types, and extraction of schema-grounded argument spans. We present EAGER, a reinforcement learning framework for generative event extraction that combines fine-grained verifiable rewards with Schema-Contrastive Advantage Estimation to alleviate advantage collapse under sparse binary rewards. Our reward design explicitly targets structural validity, extraction accuracy, groundedness, coverage, over-generation, and span precision. Experiments across seven benchmark datasets show that EAGER consistently outperforms prompting, supervised fine-tuning, and prior reinforcement learning baselines, achieving a substantial improvement over the strongest prior method. Results demonstrate that task-aligned verifiable rewards and contrastive advantage estimation substantially improve structured extraction.
著者のコメント
Accepted to EMNLP 2026 Findings
arXiv ID: 2609.29230 / 要約の誤りについて