arXiv論文メモ
新着一覧
cs.SE / cs.LG · 査読状況未確認

ハードウェア検証エージェントの実行基盤を自動改良する効果と限界

Automatic Harness Evolution for Hardware Design Verification: Can LLMs Consolidate Gains Across Discovered Harnesses?

Kidus Seyoum, Ajay Mittur

この論文をやさしく読む

ひとことで言うと

ハードウェア検証用のAIエージェントを動かす設定を自動改良し、改善が課題間で持続するか調べた。

何に役立つ?

エージェントの設定を自動探索する際に、単発の成功数だけでなく再現性や別課題での維持を評価する設計に役立つ。

この研究の面白いところ

完了数や一度でも当たる割合は大きく増えた一方、正解総数や繰り返し再現できる成功の改善は小さかった。

どこまで分かった?

主な評価は非公開の12課題で各5試行。別の142課題では改善も報告されたが、単一のハーネスに全課題の利点を安定して統合したとは示されていない。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

エージェントの振る舞いは言語モデルを取り巻く実行基盤(ハーネス)に左右されるが、言語モデルがハードウェア設計の課題に向けてハーネスを安定して改善できるかは明らかでない。本研究は、固定した対象モデルを用い、非公開の設計検証における根本原因の特定課題12件について、ハーネスの自動進化を調べた。各課題で5回ずつ試すと、自動進化したハーネスにより、完了した試行の数は71〜76%、一度でも正解した課題の網羅率は80〜100%増えた。しかし、正解した試行の総数の改善は18〜24%にとどまった。少なくとも二度再現した成功という最も強い指標では、改善は1課題分だった。後期の候補は課題ごとに改善と悪化を交換する形になり、改善を保持できなかった。 探索に含めなかった4課題の検証集合では補助的な候補が改善したが、探索課題と検証課題を含む後続の12課題で再実行すると、基準手法と同点になり、選択した改善は全体では持続しなかった。試した系列には、有用な探索、証拠収集、最終回答の行動がそれぞれ異なる候補に現れたが、課題と評価指標をまたいで一貫して優位な単一のハーネスにはまとまらなかった。別のCVDPベンチマーク事例では、定義幅の修復用に自動進化したハーネスが、142課題の参照基準より機能テストの通過数を35.6%増やした。最終的な機能検証器は完成した出力を採点したが、修復中の対象エージェントには示されなかった。結果は、自動進化が一貫した統合を生まない場合、補完的な専門化を記録した候補群を踏まえて選択する方法を支持する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-24(UTC)
最新改訂
2026-09-24 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Agent behavior depends on the harness surrounding a language model, but it remains unclear whether language models can reliably improve such harnesses for hardware-design tasks. We study automatic harness evolution around a fixed subject model on 12 proprietary design-verification root-cause localization tasks. Across five trials per task, automatically evolved harnesses increased completed attempts by 71-76% and any-hit task coverage by 80-100%, while total correct attempts improved by only 18-24%. The strongest success reproducible at least twice result improved by one task, and later candidates exchanged gains across tasks rather than preserving them. An auxiliary candidate improved on a four-task validation set excluded from search but tied its baseline on a subsequent 12-task replay containing both search and validation tasks, so the selected gain did not persist across the full pool. Across the tested lineage, useful search, evidence, and finalization behaviors appeared in different candidates but did not consistently consolidate into a single harness that dominated across tasks and metrics. In a separate CVDP cross-benchmark case study, an automatically evolved defined-width repair harness produced 35.6% more functional passes than its 142-task reference baseline; the final functional verifier scored completed outputs but was not shown to the subject agent during repair. These results support archive-aware selection when evolution yields complementary specializations without consistent consolidation.

arXiv ID: 2609.28908 / 要約の誤りについて