arXiv論文メモ
新着一覧
cs.CL · 査読状況未確認

小型言語モデルの出力形式と内容の正確さを分けて評価

Constrained Decoding Eliminates Structural Failures in Small LLMs but Reveals a Scale-Dependent Semantic Gap

Akash Chavan

この論文をやさしく読む

ひとことで言うと

小型AIに正しいJSON形式で答えさせても、答えの中身まで正しくなるとは限らないことを調べています。

何に役立つ?

構造化出力を使うシステムで、形式検証と内容検証を分けて設計する判断材料になります。今回の評価では、出力形式の強制は構造上の失敗を防ぎました。

この研究の面白いところ

失敗を一括りにせず、型変換の問題と指示の理解の問題に分けています。同じ生成制約でも、直せる失敗と残る失敗が異なります。

どこまで分かった?

100%は対象5モデル・14タスクでのスキーマ適合率であり、内容の正解率ではありません。あらゆるモデルやスキーマでの完全な動作を実証したものでもありません。

v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。

アブストラクトの日本語訳

6億〜40億パラメータの小型オープンソース大規模言語モデル(LLM)は、JSON、関数呼出し、データ抽出などの構造化出力生成に利用される機会が増えている。しかし、この規模で制約付きデコーディング(CD)がモデルの大きさとどう相互作用するかは、ほとんど分かっていない。本研究では、3系列の5モデルを、14種類の構造化出力タスクについて、標準の生成方式、Outlines、XGrammar の3条件で比較する。構造の正しさ、すなわちスキーマへの適合性と、意味の正しさ、すなわち内容の正確さを区別する2軸の評価を導入する。 CDは全モデルの構造上の失敗を解消し、スキーマ適合率を78.6〜92.9%から100%へ引き上げた。一方、内容の正確さにはモデル規模に依存する意味上の隔たりが残る。型変換に関する失敗はCDで完全に救済できるが、複数段階の関数呼出しなど、指示の意味に関する失敗はCDでも解消しにくい。スキーマ適合は意味的な正しさに必要だが、それだけでは十分でない。CDの効力が及ぶ範囲は、スキーマ適合が規定する範囲までである。

v1の要旨から自動生成。本文の精読・人による確認は未実施。

初稿
2026-09-20(UTC)
最新改訂
2026-09-20 · v1
査読・掲載
査読状況未確認
arXivで読むPDF

更新履歴

取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。

原文の要旨

Small open-source large language models (LLMs) in the 0.6B-4B parameter range are increasingly deployed for structured output generation (JSON, function calling, data extraction), yet little is known about how constrained decoding (CD) interacts with model scale in this regime. We benchmark five models from three families across 14 structured-output tasks under three decoding conditions (native, Outlines, XGrammar). We introduce a two-axis evaluation that separates structural correctness (schema validity) from semantic correctness (content accuracy). We find that CD eliminates all structural failures across all models (schema validity: 78.6-92.9% to 100%), but content accuracy reveals a persistent semantic gap that is scale-dependent: type coercion failures are fully CD-rescuable, while instruction-semantic failures (e.g., multi-step function calling) remain CD-resistant. Schema conformance is necessary but not sufficient for semantic correctness; CD's reach ends exactly where schema conformance ends.

著者のコメント

6 pages, ACL format Code and task suite: https://github.com/CruiseDevice/small-llm-structured-benchmark (tag v1.0)

arXiv ID: 2609.23742 / 要約の誤りについて