arXiv論文メモ
新着一覧
cs.SE · 査読状況未確認

工場向けテスト障害の分析をLLMで支援する実地評価

Supporting Industrial Test-Failure Analysis with LLM-Based Systems: An Experience Report

Eric Jansson, Per Strandberg, Thomas Sörensen, Eduard Paul Enoiu, Wasif Afzal

この論文をやさしく読む

ひとことで言うと

夜間テストの障害調査で、LLMを1体使う方法と複数体を協働させる方法を、現場の担当者の評価と実行コストで比べています。

何に役立つ?

障害分析支援システムを導入するとき、構成の複雑さに見合う品質向上があるかを判断する参考になります。この事例では単一構成が速度と費用で有利でした。

この研究の面白いところ

120回の反復実行による運用測定と、人が読んで判断する報告書の品質評価を組み合わせています。複数エージェントが必ず優れるという結果にはなっていません。

どこまで分かった?

実際の障害シナリオは2件、評価者は6人の探索的研究です。品質は実務担当者が感じた評価であり、より複雑な障害への一般化は今後の課題とされています。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

本研究は、Westermo Network Technologies ABにおける夜間テストの失敗の根本原因分析を支援する、ツールを備えた大規模言語モデル(LLM)システムを調べる。夜間テストでは異種のテストデータやログが生成され、現在は実務担当者が複数の情報源を手作業で調査している。テストのメタデータとログにアクセスできる根本原因分析のワークフローを、単一エージェント構成と、複数エージェントを統括する構成で実装した。 探索的な産業事例研究では、実際の障害シナリオ2件を用いた。6人の実務担当者が、アンケートとフォーカスグループを通じてシナリオの報告書を評価し、120回の反復実行から運用上の測定値も収集した。評価対象は、担当者が感じた正確さ、推論の質、修正案の現実性、明確さ、有用性、信頼に加え、コスト、所要時間、一貫性である。2つのシナリオを通して、どちらの構成にも、担当者が感じる品質で一貫した優位性はなかった。単一エージェントのシステムは、より速く低コストで報告書を生成し、この状況ではより実用的な基準構成となった。エージェント構成が持つ潜在的な利点は、さらに複雑なシナリオで評価する必要がある。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-18(UTC)
最新改訂
2026-09-18 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

This study examines tool-augmented Large Language Model (LLM) systems for supporting Root Cause Analysis (RCA) of nightly test failures at Westermo Network Technologies AB. Nightly test executions produce heterogeneous test data and logs that practitioners currently inspect manually across multiple sources. We implemented an RCA workflow in single-agent and orchestrated multi-agent configurations, both with access to test metadata and logs. An exploratory industrial case study used two real failure scenarios. Six practitioners evaluated the scenario reports through a survey and focus group, and operational measurements were collected from 120 repeated executions. The evaluation covered practitioner-perceived correctness, reasoning quality, fix realism, clarity, usefulness, and trust, as well as cost, duration, and consistency. Neither configuration showed a consistent practitioner-perceived quality advantage across the two scenarios. The single agent system generated reports faster and at lower cost, making it the more practical baseline in this context. The potential benefits of agent architectures require further evaluation in more complex scenarios.

著者のコメント

16 pages, 4 figures, accepted to PROFES 2026, 30 Nov to 2 Dec 2026, Karlskrona, Sweden

arXiv ID: 2609.21843 / 要約の誤りについて