arXiv論文メモ
新着一覧
cs.LG · 査読状況未確認

数式の候補生成と修正を組み合わせた記号回帰

MOSAIC-SR: Transformer-Guided Symbolic Regression for Scientific Equation Recovery

Peiyi Zheng, Yanming Kang, Hans De Sterck, Giang Tran

この論文をやさしく読む

ひとことで言うと

AIが数式のたたき台を複数作り、その形と定数を探索で直して、観測に合う式を見つける方法です。

何に役立つ?

考えられる用途は、測定データから人が読める数式モデルの候補を得ることです。実証されたのは記号回帰ベンチマークでの復元性能です。

この研究の面白いところ

ニューラルモデルの速い候補生成と探索による修正を分担させ、無関係な入力変数が混ざる場合にも優位性を保っています。

どこまで分かった?

要旨には具体的な復元率や実行時間は示されていません。ベンチマークで式を復元できることと、新しい自然法則を実験で発見したことは区別が必要です。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

記号回帰は観測から閉じた形の数式を復元し、科学的発見に向けた解釈可能なモデルを得ることを目指す。既存の方法では、柔軟な構造探索と効率的な推論を両立させるのが難しい。探索型の方法は式の構造を改善できるが、ランダムな初期化を伴う高コストな組合せ最適化に頼ることが多い。事前学習済みのニューラルモデルはほぼ瞬時に式を生成するものの、予測に記号上の誤りを含むことが多い。 本研究では、事前学習済みTransformerに複数の初期的な式の骨格を提案させるMOSAIC-SRを導入する。これらの骨格から複数の有望な領域で探索を始めることで、広大な式の空間におけるランダムな出発を避ける。各探索では、スケールを考慮した定数の最適化と局所的な記号修正によって、構造と定数を同時に復元する。 ダミー変数の有無を変えたSRSD-Feynmanデータセットと、追加の六つのベンチマークでMOSAIC-SRを評価した。MOSAIC-SRはすべてのデータセットで最も高い記号解の復元率を達成し、予測精度でも上位二手法に入った。この優位性は無関係なダミー入力が存在しても維持された。結果は、学習した事前知識が探索を有望な数式構造に集中させられること、そして数値最適化と記号修正が復元に重要であることを示している。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-17(UTC)
最新改訂
2026-09-17 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Symbolic regression aims to recover closed-form equations from observations, providing interpretable models for scientific discovery. Existing approaches struggle to combine flexible structural search with efficient inference. Search-based methods can refine expression structure but often rely on costly combinatorial optimization with random initialization. Pretrained neural models generate formulas almost instantly, but their predictions often contain symbolic errors. We introduce MOSAIC-SR, which uses a pretrained Transformer to propose multiple initial sketches. These sketches initialize searches in several promising regions, avoiding random starts in the vast expression space. Each search jointly recovers structure and constants through scale-aware constant optimization and local symbolic repair. We evaluate MOSAIC-SR on the SRSD-Feynman dataset with and without dummy variables and on six additional benchmarks. MOSAIC-SR obtains the highest symbolic solution rate on every dataset while ranking among the top two methods in predictive accuracy. This advantage persists in the presence of irrelevant dummy inputs. The results show that learned priors can focus search on promising equation structures, and that numerical optimization and symbolic repair are important for recovery.

arXiv ID: 2609.20997 / 要約の誤りについて