arXiv論文メモ
新着一覧
cs.AI / cs.CL · 掲載先の記載あり

文章中の主張と根拠を生成型言語モデルで直接抽出する

Extracting Arguments, Not Just Classifying Them: Instruction-Tuned LLMs for Generative Component Detection

Sofiane Elguendouze (UniCA, I3S, MARIANNE), Erwan Hain (UniCA, MARIANNE), Elena Cabrio (MARIANNE, UniCA), Serena Villata (CNRS, MARIANNE)

この論文をやさしく読む

ひとことで言うと

文章を先に細かく分割してから分類するのではなく、言語モデルに主張やその根拠の範囲を直接取り出させる方法です。

何に役立つ?

議論を含む文章から、主張と前提の構造を取り出す作業を支援する用途が考えられます。

この研究の面白いところ

どこからどこまでが議論の部品かという境界検出と、その種類の判定を、生成タスクとしてまとめて扱っています。

どこまで分かった?

要旨にはベンチマーク名や改善幅は記載されていません。また、公開リポジトリへの言及はありますが、入力の要旨にはURLが含まれていないためリンクを補っていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

議論構成要素検出(ACD)は、議論マイニング(AM)の中心的な下位タスクであり、特に難しい側面の一つである。議論に当たる文章範囲を区切ると同時に、主張や前提などの構成要素に分類する必要があるためである。他のAMタスクと比べ、この下位タスクの研究は依然として比較的限られており、既存手法の多くは、単純化した系列ラベリング、構成要素の分類、あるいは構成要素への分割後に分類するパイプラインとして定式化している。 本論文では、簡潔な指示型プロンプトを使う、指示チューニング済み大規模言語モデル(LLM)に基づく新手法ITFACDを提案する。ACDを言語生成タスクとして捉え直すことで、あらかじめ分割された構成要素に頼らず、通常の文章から議論を直接同定できるようにする。標準ベンチマークでの実験では、最先端システムより高い性能を達成した。著者らの知る限り、これはACD全体を生成タスクとしてモデル化する初期の試みの一つであり、複雑なAM問題に対する指示チューニングの可能性を示す。コードと使用したデータセットは、以下のGitHubリポジトリで公開されている。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-21(UTC)
最新改訂
2026-09-21 · v1
査読・掲載
掲載先の記載あり

著者による掲載先の記載:COLM 2026 - Third Annual Conference on Language Modeling, Oct 2026, San Francisco, CA, United States。出版社での独立確認は未実施です。

arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Argumentative component detection (ACD) is a core subtask of Argument(ation) Mining (AM) and one of its most challenging aspects, as it requires jointly delimiting argumentative spans and classifying them into components such as claims and premises. While research on this subtask remains relatively limited compared to other AM tasks, most existing approaches formulate it as a simplified sequence labeling problem, component classification, or a pipeline of component segmentation followed by classification. In this paper, we propose ITFACD, a novel approach based on instruction-tuned Large Language Models (LLMs) using compact instruction-based prompts, and reframe ACD as a language generation task, enabling arguments to be identified directly from plain text without relying on pre-segmented components. Experiments on standard benchmarks show that our approach achieves higher performance compared to state-of-the-art systems. To the best of our knowledge, this is one of the first attempts to fully model ACD as a generative task, highlighting the potential of instruction tuning for complex AM problems. Our code and the datasets used are openly available in the following GitHub repository.

arXiv ID: 2609.24855 / 要約の誤りについて