災害報告の文章から位置情報付きイベント候補を抽出する
From UNDRR Reports to Event Records: Schema-Constrained LLM Extraction of Georeferenced Disasters
この論文をやさしく読む
ひとことで言うと
災害の報告書から、災害種別・場所・年などを決まった形式で取り出し、地図上の情報と結び付ける研究です。出力は確認を要する記録の候補として扱います。
何に役立つ?
文章中心の災害資料をデータベース化する際の前処理に利用が考えられます。1万文書への適用実績があり、抽出の根拠も人が点検できるよう保持します。
この研究の面白いところ
属性抽出のF₁が最も高いモデルと、根拠文言が原文に実在する割合が高いモデルは一致していません。精度と追跡可能性を別の指標として示しています。
どこまで分かった?
F₁は文書内の属性をまとめた評価であり、属性と個別イベントの正しい対応付けは評価していません。また、引用文言の存在は内容の裏付けを保証しません。生成した3,572件すべてが検証済みの災害記録という意味ではありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
災害リスク削減の資料群は、EM-DAT(Delforgeら、2025年)のようなデータベースが直接取り込めない文章形式で災害事象を記述している。本研究は、統制された災害種別の語彙と固定スキーマを用い、確認用の根拠を保持しながら、地理的位置を付与したイベント記録の候補を生成するLLM処理系を提示する。UNDRRが運営する知識ハブPreventionWebの10,000文書に適用し、1,913文書から24種類の災害にわたる3,572件の記録を生成した。また、言及された場所の81%をOpenStreetMapの地理形状に対応付けた。 層化して構成した217文書の参照セットのうち、人が陽性と判定した171の文書内区間で、GPT-5は属性をまとめて評価したF₁で86.0%を達成し、spaCyと地名辞書を組み合わせたベースラインは44.2%だった。この評価では文書内の災害系統、場所の文字列、発生年をまとめて扱い、それらが個々のイベントへ正しく割り当てられているかは評価していない。10種類のLLMの中ではGPT-5.4が最高で、F₁は86.6%だった。根拠として示した文言が原文にそのまま出現する割合は、GPT-5で72.0%、GPT-5.4で47.2%だった。これは文章上の追跡可能性を測るものであり、属性が根拠によって裏付けられることまでは確認していない。運用時の失敗の種類と、ラベルおよび位置ルールへの適合性の自動検査も報告する。各国の報告資料へ適用できるよう、プロンプト、スキーマ、出力を公開する予定である。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-20(UTC)
- 最新改訂
- 2026-09-20 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-20 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Disaster-risk-reduction archives describe hazard events in prose that databases such as EM-DAT (Delforge et al., 2025) cannot ingest directly. We present an LLM pipeline that generates candidate georeferenced event records using a controlled hazard vocabulary and fixed schema, retaining evidence for review. Applied to 10,000 documents from PreventionWeb, the knowledge hub managed by UNDRR, it produced 3,572 records from 1,913 documents across 24 hazard types and resolved 81% of location mentions to OpenStreetMap geometries. On 171 human-positive document windows from a stratified 217-document reference set, GPT-5 achieved 86.0% pooled attribute $F_1$, versus 44.2% for the spaCy-gazetteer baseline. Evaluation pools hazard families, location strings, and event years within documents, without assessing their assignment to individual events. GPT-5.4 ranked highest among ten LLMs (86.6% $F_1$). Verbatim evidence occurrence was 72.0% for GPT-5 and 47.2% for GPT-5.4, measuring textual traceability without establishing attribute support. We report production failure modes and automated label and location-rule compliance checks. Prompts, schema, and outputs will be released for adaptation to national reporting archives.
著者のコメント
17 pages, 3 figures
arXiv ID: 2609.23853 / 要約の誤りについて