キーワード評価が見逃す小型言語モデルのツール呼び出し失敗
Keyword Harnesses Fail Open: A Cheap Diagnostic Ladder for Tool-Use Claims in Small Language Models
この論文をやさしく読む
ひとことで言うと
ツール名などのキーワードが出ることと、正しい形式でツールを呼べることを区別する評価研究です。
何に役立つ?
小型モデルのツール利用能力を確認する際に、出力形式、最初のトークン、不要な呼び出しまで段階的に点検するために役立ちます。
この研究の面白いところ
60億トークンの専用学習をしたモデルでも形式が出せず、少量の狙いを絞った追加学習で修復できた点です。修復は起動トークンの埋め込み自体の変更では説明されません。
どこまで分かった?
対象は構造を揃えた2つのモデルです。修復後も不要な呼び出しが多く、抑制へのデータ多様性の効果はシード依存で未確定です。評価上の成功と実際のツール実行の安全性を同一視できません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
キーワード照合型のベンチマークは、小型モデルが実際には行っていないツール利用を、実行できたものとして評価することがある。本研究は、構造を揃えたスペイン語のセキュリティ向け言語モデルの組で、このような偽陽性を記録し、厳格かつ低コストな段階的診断を提案する。6億6,160万パラメータのモデルは、データの約65%がコード・技術文書で、専用の教師ありファインチューニング(SFT)はない。11億900万パラメータのモデルは、ウェブ文書を多く含む多段階カリキュラムと60億トークンのツールSFTを用いる。両者はデコーダ、トークナイザ、特殊トークンを共有し、緩いツール利用指標ではほぼ同じ得点となる(B4は0.660対0.650)。 学習例をそのまま再現する検査では両者が完全に分かれる。600Mモデルは6例中6例で、引数を一般化した有効なツール呼び出しを出力するが、1Bモデルは複数のチェックポイントを通じて6例中0例である。最初のトークンを調べることで、1Bの失敗は事前傾向の欠落に位置付けられる。<|tool_call|>の確率は10⁻⁴〜10⁻⁵で、ウェブ文書主体の学習段階でその傾向が消去されていた。多様なコーパス、5倍高い学習率、2,202ステップ、約3.3 GPU時間を用いる対象を絞ったSFTで1Bを修復でき、使うトークンは失敗した段階より3桁少ない。 コーパス全269行では、有効な出力の割合が0.100から0.959へ増える(600Mは0.926)。未見の238プロンプトでは、修復した1Bの合格率は0.536で、600Mの0.428を上回る(p = 0.004)。埋め込みの変化を調べると、この修復で起動トークンの共有埋め込みは動いておらず、bf16の表の97.7%はビット単位で同一のままである。したがって、変化は周囲のネットワークにある。両モデルとも過剰に呼び出しを起動し、呼び出し不要のプロンプトに呼び出しなしで答えることはまれである(600Mは0.09、修復した1Bは0.17)。要因分析ではすべての修復設定で形式を習得することが確認されたが、多様なコーパスが呼び出し抑制に役立つという見方は、乱数シードへの感度があるため仮説にとどまる。この低コストな段階的診断はCPU時間で数分しか要せず、小型モデルのツール利用能力を主張する際の事前検査とすべきである。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-10-01(UTC)
- 最新改訂
- 2026-10-01 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-10-01 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Keyword-matching benchmarks can credit small models for tool use they never perform. We document such a false positive in a matched-architecture pair of Spanish security language models and propose a ladder of strict, cheap diagnostics. A 661.6M parameter model (approx. 65% code/technical text; no dedicated SFT) and a 1,109M model (web-heavy multi-phase curriculum; 6B-token tool-SFT) share decoder, tokenizer, and special tokens, scoring almost identically on lenient tool-use metrics (B4: 0.660 vs. 0.650). Verbatim-reproduction checks on training examples separate them completely: the 600M emits valid tool calls with generalized arguments on 6/6 examples; the 1B does so on 0/6 across checkpoints. A first-token probe localizes the 1B's failure to a missing prior (prob. $10^{-4}$--$10^{-5}$ on <|tool_call|>), which was erased by its web-heavy training phase. A targeted SFT recipe (diverse corpus, 5x higher learning rate, 2,202 steps, ~3.3 GPU-hours) repairs the 1B using three orders of magnitude fewer tokens than the failed phase. On all 269 corpus rows, valid emission rises from 0.100 to 0.959 (600M: 0.926). On 238 unseen prompts, the repaired 1B passes 0.536 vs. the 600M's 0.428 ($p = 0.004$). Embedding-drift checks show the repair did not move the trigger token's tied embedding (97.7% of the bf16 table remains bit-identical), meaning changes live in the surrounding network. Both models over-trigger, rarely answering negative prompts without a call (0.09 for 600M, 0.17 for repaired 1B). Factorial analyses confirm all repair configurations install the format, though suppression benefits from a diverse corpus remain a hypothesis due to seed sensitivity. This cheap diagnostic ladder costs minutes of CPU time and should gate tool-use claims on small models.
著者のコメント
24 pages, 12 tables, preprint
arXiv ID: 2610.02142 / 要約の誤りについて