AIだけで書かれたコードの履歴と応答の誤りを分析
Between the Commits: Process, Error, and Claim Reliability in a Wholly AI-Authored Codebase
この論文をやさしく読む
ひとことで言うと
AIのみで開発した一つのPythonツールの履歴を追い、コード生成と対話応答の誤りを調べた。
何に役立つ?
コーディングエージェントの開発過程や、テストと応答の信頼性を評価するための実例と分類方法になる。
この研究の面白いところ
コードだけでなく指示、コミット、対話応答を追跡し、生成イベントの14.3%で後からテストに見つかった誤りを報告した。
どこまで分かった?
調査対象はClaude AIだけで作られた21,000行の一つのツール。示された割合を他のモデルや開発現場全体へそのまま一般化はできない。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
著者らは、人間が書いたコードやテストを含まずClaude AIだけで構築された21,000行のPythonツールの全開発履歴からなる新しいデータセット、コードの出所を追跡する2つのツール、指示の意図・コミットの出所・応答の信頼性に関する3種類の分類体系を提示し、それらを使ってデータセットを分析する。分析によると、利用者がコーディングエージェントのCLIへ出す指示は、IDEチャットへの指示とは種類が異なり、理解、計画、相談をより重視している。コード開発は主として先回りして行われる。AIによるコード生成の出来事の14.3%には、後にAIが書いたテスト群で捕捉された実際の誤りがある。また、AIの対話応答のおよそ4~5件に1件は、一つ以上の事実誤認を含む。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-24(UTC)
- 最新改訂
- 2026-09-24 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-24 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
We present: (i) a new dataset consisting of the full development history of a 21,000-line Python tool built entirely by Claude AI, with no human-authored code or tests, (ii) two code-provenance tracing tools, (iii) three taxonomies for instruction intent, commit provenance, and response reliability, (iv) application of these to analyse the dataset. We find that: (i) user coding agent CLI instructions differ in kind from IDE-chat instructions, with a greater focus on comprehension, planning and consultation, (ii) code development is mainly proactive, (iii) 14.3% of AI code-generation events contain a real error later caught by the AI-authored test suite, (iv) roughly 1 in 4-5 of the AI's interactive responses contains one or more factual errors.
arXiv ID: 2609.29744 / 要約の誤りについて