arXiv論文メモ
新着一覧
cs.DB / cs.AI · 査読状況未確認

AI演算を含むSQLの正しさを二段階に分けて評価する

The Stochastic Shift: A New Evaluation Paradigm for Text-to-SQL with AI Operators

Tarfah Alrashed, Fatma Ozcan, Per Jacobsson, Tal Neiman, Xianshun Chen

この論文をやさしく読む

ひとことで言うと

AIを含むSQLでは、正しい質問でも答えの表現が揺れます。通常のデータベース処理とAIの処理を別々に採点し、正しいクエリを誤って不正解にしにくくする方法です。

何に役立つ?

考えられる用途は、自然言語からAI拡張SQLを作るシステムの評価です。生成器の性能と、採点器の誤判定を区別するために役立ちます。

この研究の面白いところ

完全一致の実行結果に頼る評価だけでなく、LLMによる採点にも誤却下があることを測り、評価対象を分解しています。

どこまで分かった?

最大97.2%はクエリを評価する枠組みの総合正解率です。SQL生成自体の正解率ではありません。検証先はBigQueryとThalamusDBです。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

SQLはAI演算子によって拡張され、現代のデータ分析プラットフォームは構造化・非構造化の両方のデータから洞察を得られるようになった。現在のText-to-SQLシステムはこうしたAI拡張クエリを生成できる一方、その正しさを信頼できる形で評価することは重要な未解決課題であると指摘する。完全に一致するクエリ結果と決定論的実行に依存する現在の指標は、AI演算子の柔軟で非決定論的な出力に対して、系統的に機能しなくなる。 本論文では、この特有の評価失敗の類型を定式化し、決定論的なデータベース論理と柔軟なAIの意味処理を切り離す多層評価の枠組みを導入する。産業界のBigQueryと学術系のThalamusDBの両システムで手法を試す。従来のExecution Accuracyは妥当なクエリを厳しく減点し、正しい変換の検出率が25%にまで低くなることを示す。さらに最先端のLLMによる自動採点器でも、関係演算とAIの要素を同時に判定する複雑さのため、正しいクエリの32%を誤って却下する。 標準的な関係論理とAI演算を別々に検証することで、提案の枠組みは両プラットフォームで最先端の総合正解率を達成し、最大97.2%となる。これにより、AIを利用するSQL生成器を比較評価するための信頼できる標準を提案する。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-17(UTC)
最新改訂
2026-09-17 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

SQL has been augmented with AI operators, enabling modern data analytics platforms to derive insights from both structured and unstructured data. We observe that while current Text-to-SQL systems can successfully generate these AI-augmented queries, reliably evaluating their correctness remains a critical open challenge. Current metrics, which rely on exact query results and deterministic execution, systematically fail against the flexible, non-deterministic outputs of AI operators. In this paper, we formalize these unique evaluation failure modes and introduce a Multilayered Evaluation Framework that decouples deterministic database logic from flexible AI semantics. We test our approach across both industry (BigQuery) and academic (ThalamusDB) systems. We demonstrate that traditional Execution Accuracy severely penalizes valid queries, achieving as low as a 25% detection rate for correct translations. Furthermore, even a state-of-the-art LLM-based autorater falsely rejects 32% of accurate queries due to the complexity of judging both relational and AI components simultaneously. By validating the standard relational logic and the AI operations separately, our framework achieves state-of-the-art overall accuracy across both platforms (up to 97.2%), proposing a reliable standard for benchmarking AI-powered SQL generators.

arXiv ID: 2609.21133 / 要約の誤りについて