arXiv論文メモ
新着一覧
cs.AI · 査読状況未確認

停電報告XMLの生成を最小リスク学習で改善

Enhancing Small Language Models for Power Outage Report Generation via Minimum Risk Training

Hung Phan, Waqwoya Abebe, Youssef Hussein, Supriya Chinthavali, Dalton Lunga, Ali Jannesari

この論文をやさしく読む

ひとことで言うと

形式が異なる停電報告を標準XMLに直す小型言語モデルを、文全体の評価結果で学習する研究。

何に役立つ?

考えられる用途は、停電報告の標準化。要旨ではODIN向けのXML生成で評価している。

この研究の面白いところ

最小リスク学習により、Qwen2.5-7B-Instructの全体正解率が16.20%から68.95%になった。

どこまで分かった?

数値は停電報告生成の対象課題での結果。ほかのXML変換課題への一般化は要旨にない。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

最小リスク学習(MRT)は、ニューラル機械翻訳のモデルが、各トークンの最尤推定だけに頼らず、文全体を対象とする評価指標を直接最適化できるようにする。約10年前に導入された方法だが、近年の研究は現在の言語モデルにおけるリスクに基づく最適化の可能性を改めて示している。 本研究は、全国停電データ構想ODINの停電報告生成にMRTを適用し、形式の異なる報告をCIM IEC 61968-3に準拠する標準化されたXMLへ変換する。MRTにより、Qwen2.5-7B-Instructの全体的な正解率は16.20%から68.95%へ向上した。特定分野の構造化された文章生成で、系列全体を対象とする最適化が有効であることを示す。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-23(UTC)
最新改訂
2026-09-23 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Minimum Risk Training (MRT) enables neural machine translation models to directly optimize sequence-level evaluation metrics instead of relying only on token- level maximum-likelihood objectives Shen et al. [2016]. Although introduced a decade ago, recent work shows renewed potential for risk-based optimization in modern language models Yang et al. [2024], Jinnai et al. [2025]. We apply MRT to power outage report generation for the Outage Data Initiative Nationwide (ODIN), transforming heterogeneous reports into standardized XML compliant with CIM IEC 61968-3. Our MRT approach improves Qwen2.5-7B-Instruct overall accuracy from 16.20% to 68.95%, demonstrating the effectiveness of sequence- level optimization for domain-specific structured generation

arXiv ID: 2609.27197 / 要約の誤りについて