論文から計算機の性能モデルを自動で組み立てるRosetta
Rosetta: Automating First-Principles Performance Modeling Using Multi-Agent LLMs
この論文をやさしく読む
ひとことで言うと
計算機の研究論文を入力すると、性能を説明する数式と実行可能なモデルを作り、説明に足りない仮定や数値を洗い出す仕組みです。
何に役立つ?
考えられる用途は、性能に関する主張を点検したり、追加実験の必要性を見つけたりすることです。著者による評価では、実際に主張の修正や新たな実験につながったと報告しています。
この研究の面白いところ
答えを生成するだけでなく、別のエージェントによる批評と修正を組み込みます。プログラムが動くかと科学的に妥当かを分けて検証する点も特徴です。
どこまで分かった?
重大なハルシネーションがなかったという結果は専門家評価の12論文でのものです。Tier Aの56%も適合性審査を通った論文を分母とするため、全論文で同じ品質を保証する結果ではありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
解析的な性能モデル、すなわちハードウェアのパラメータからスループットや高速化率を導くモデルは、主張を独立に検証可能にし、性能を制約する条件を明らかにする。しかし、専門家が手作業で構築すると数週間を要するため、計算機アーキテクチャの論文に添えられることは少ない。本研究では、研究論文のPDFから第一原理に基づく解析モデルを自動生成する、複数の大規模言語モデルエージェントからなる処理系Rosettaを提示する。 Rosettaは論文だけを入力として、数学的な仕様、実行可能なPythonモデル、平易な英語による解釈を、人間の介入なしに自律的に生成する。主要な価値は形式化の過程そのものにあり、暗黙の仮定を表面化させ、不足するパラメータを特定する。単純なLLM生成に伴う失敗に対し、四つの設計上の工夫を施す。循環論法を禁じる科学的な基本規則、独立した批評エージェントを使う検証・修正の反復、機能的な正しさと科学的妥当性を分離する二重の検証、LLMの確率性を活用してN候補から最良を選ぶアンサンブルである。 評価は相補的な三つの系統で行う。代表的な12論文の専門家評価(CS1)、選別していないISCA 2025およびHPCA 2026の97論文の自動採点(CS2)、活動中の六つの研究グループによる著者自身の評価(CS3)である。CS1では、12論文中10論文で仕様品質が5点満点中4~5点となり、重大なハルシネーションはなかった。CS2では、適合性の審査を通った論文の56%が、洞察品質でTier Aに達した。最も強い知見はCS3から得られた。Rosettaの出力を受けて、投稿中の論文の主張が修正され、新たな実験が行われた。また、評価した著者の6人中5人が、再び使いたいと答えた。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-16(UTC)
- 最新改訂
- 2026-09-16 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-16 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Analytical performance models --- derivations of throughput or speedup from hardware parameters --- make claims independently verifiable and expose binding constraints, yet rarely accompany architecture papers because building one by hand takes weeks of expert effort. We present Rosetta, a multi-agent LLM pipeline that automatically generates first-principles analytical models from research paper PDFs. Given a paper as sole input, Rosetta produces a mathematical specification, an executable Python model, and a plain-English interpretation --- all autonomously, with zero human intervention. The formalization process itself is the primary value: it surfaces implicit assumptions and identifies missing parameters. Four design decisions address failure modes of naïve LLM-based generation: a scientific constitution that prohibits circular reasoning, verify-repair loops with independent critic agents, dual verification separating functional correctness from scientific validity, and a best-of-$N$ ensemble that exploits LLM stochasticity. We evaluate Rosetta across three complementary tracks: expert evaluation of 12 landmark papers (CS1), automated scoring of 97 unfiltered ISCA 2025 and HPCA 2026 papers (CS2), and author self-evaluation by six active research groups (CS3). Across CS1, specification quality scores 4--5/5 on 10 of 12 papers with zero significant hallucinations; across CS2, 56\% of fit-screened papers reach Tier~A insight quality. The strongest finding comes from CS3: Rosetta's output led to revised claims and new experiments in active submissions, and five of six author-evaluators said they would use it again.
著者のコメント
14 pages, 7 Figures, 3 tables
arXiv ID: 2609.19376 / 要約の誤りについて