FINSKILLOPS:SEC提出書類QAの自己進化型マルチエージェントシステム
FINSKILLOPS: A Self-Evolving Multi-Agent System for SEC Filing QA
この論文をやさしく読む
ひとことで言うと
SEC提出書類への質問応答で生じた失敗を、適用範囲を絞った修正用スキルに変え、既存の正答を壊さないか確認して導入する仕組みです。
何に役立つ?
期間、企業、根拠、計算の取り違えを、運用後にも管理しながら減らすための設計になります。
この研究の面白いところ
新しいスキルを作るだけでなく、対象を絞った検証、既存事例の回帰確認、負の対照、版管理と廃止を組み込みます。12回の運用研究では提案33件中6件だけを採用しています。
どこまで分かった?
強化した評価集合で正しさの点数が3.70から4.55、別の運用研究で非正答率が20%から12.5%へ改善しています。これらは異なる評価であり、点数を正答率と読み替えることはできません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
金融QAシステムは通常、検索・プロンプト・エージェント連携を改善してから配備され、その後の信頼性は固定される。実際には、新しいSEC提出書類の質問が、期間、企業、根拠の利用、計算など多様な誤りを繰り返し露呈させる。既存の自己改善手法は失敗を新しい挙動に変えられるが、修正をどこに適用するか、以前正しかった回答を壊す可能性を制御しにくい。そこで配備後改善を制御された挙動保守として捉え、繰り返す失敗を範囲限定のスキルパッチにし、回帰を導入しないことを検証してから各パッチを配備する。 この考え方をSEC提出書類QA用マルチエージェントシステムFINSKILLOPSとして実装した。根拠に基づく型付き失敗診断から再利用可能スキルを導出し、対象を絞った検証、保護ケースの回帰チェック、ネガティブコントロール、バージョン管理した置換・廃止で統制する。6つの金融QAベンチマーク全体で、単一の凍結スキルレジストリが評価システム中最高の判定重み付き正確性と参照整合性を達成した。進化スキルで拡張ベンチマークの正確性は3.70から4.55へ上昇した。別の12ラウンド運用調査では33個の提案スキルのうち6個だけが採用され、監視時の不正確率は20.0%から12.5%へ下がった。これは制御されたスキル範囲・採用・ライフサイクル管理が信頼できる自己改善の基盤であることを示す。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-17(UTC)
- 最新改訂
- 2026-09-17 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-17 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Financial QA systems are typically improved before deployment through better retrieval, prompting, or agent coordination, leaving their reliability behavior fixed thereafter. In practice, new SEC-filing questions repeatedly expose heterogeneous errors in period, entity, evidence use, and calculation. Existing self-improvement methods can turn failures into new behaviors, but offer limited control over where a correction should apply or which previously correct answers it may break. We therefore frame post-deployment improvement as controlled behavioral maintenance: recurring failures should become scoped skill patches, and each patch should earn deployment with- out introducing regressions. We instantiate this view in FINSKILLOPS, a multi-agent system for SEC filing QA. FINSKILLOPS derives reusable skills from evidence-grounded, typed failure diagnoses and governs them through targeted validation, protected-case regression checks, negative controls, and versioned replacement or retirement. Across six financial QA benchmarks, a single frozen skill registry achieves the highest verdict-weighted correctness and reference consistency among the evaluated systems. Evolved skills raise correctness from 3.70 to 4.55 on our enhanced benchmark. In a separate 12-round operational study, only six of 33 proposed skills are promoted, while the monitoring non-correct rate falls from 20.0% to 12.5%. These results establish controlled skill scope, admission, and lifecycle management as the foundation for reliable self-improvement.
arXiv ID: 2609.19680 / 要約の誤りについて