arXiv論文メモ
新着一覧
cs.SE / cs.AI · 査読状況未確認

動くウェブアプリから仕様を読み取る開発エージェント評価

ProgramDistill: From Interactive Web Apps to Verifiable Reference-Guided SWE Tasks

Jeonghye Kim, Minseon Kim, Young Jin Kim, Matheus Pereira, Marc-Alexandre Côté, Alessandro Sordoni, Xingdi Yuan, Zhengyan Shi

この論文をやさしく読む

ひとことで言うと

動作するウェブアプリを触って仕様を読み取り、同じ機能を作れるかを測る試験です。文章で仕様を渡す評価とは異なり、何を実装すべきか発見する力も問います。

何に役立つ?

開発エージェントが、機能の復元範囲を広げたときにどこで失敗するかを調べるのに役立ちます。難易度を段階的に上げる学習への活用は、今後の用途として示されています。

この研究の面白いところ

26アプリから再実行で検証済みの動作を抽出し、4,063課題を自動で作っています。復元の深さによる成功率の低下を測ることで、単独機能の実装だけでは分からない弱点を表しています。

どこまで分かった?

報告された数値は、このベンチマークの全体再構築と部分再構築という別々の設定の結果です。任意の実務開発の成功率を示すものではなく、学習への利用効果も要旨では実証されていません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

コーディングエージェントは通常、望ましい動作を課題票や指示で指定して評価される。しかし実際のウェブ開発では、動作中のソフトウェアから振る舞いを推測し、未完成のアプリケーションに実装する必要がある。本研究では、完全に動作する参照アプリケーションとの対話を通じて発見した機能について、コーディングエージェントを評価するベンチマークProgramDistillを導入する。 ProgramDistillは、アプリケーションを粒度の異なる機能に分解して構築する。各機能には、正解パッチを適用することで実行できる、再現可能な動作を対応付ける。mine-craft-patchという処理パイプラインは、26個のアプリケーションから、再実行により検証した1,975個の動作を発見し、人手を介さず4,063件の課題を構築する。 最先端のコーディングエージェント9種を評価したところ、アプリケーション全体を再構築する設定の累積的なワークフローでは、GPT-6 AstraとClaude Opus 5の成功率はそれぞれ49.2%と28.8%だった。アプリケーションの一部を再構築する設定では、復元の深さを1から8へ増やすと、成功率はそれぞれ100%から64.0%、96%から32%へ低下した。したがってProgramDistillは、難易度を制御できる拡張性の高いベンチマークとして、コーディングエージェントの評価と診断に利用でき、将来のカリキュラムに基づく学習の自然な基盤にもなる。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-16(UTC)
最新改訂
2026-09-16 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Coding agents are typically evaluated with desired behavior specified through issues or instructions. In practical web development, however, agents may need to infer behavior from working software and implement it in an incomplete application. We introduce ProgramDistill, a benchmark evaluating coding agents on features discovered through interaction with fully functional reference applications. We build ProgramDistill by factorizing applications into features of different granularities, each associated with replayable behaviors executable via its gold patch. Our pipeline, mine-craft-patch, discovers 1,975 replay-verified behaviors across 26 applications and constructs 4,063 tasks without human intervention. Across nine frontier coding agents, GPT-6 Astra and Claude Opus 5 achieve 49.2% and 28.8% success on cumulative workflows in full-application reconstruction. In partial-application reconstruction, success falls from 100% to 64.0% and from 96% to 32% as restoration depth increases from 1 to 8. ProgramDistill thus provides a scalable benchmark with controlled difficulty for evaluating and diagnosing coding agents, and a natural basis for future curriculum-based training.

arXiv ID: 2609.18805 / 要約の誤りについて