再帰状態を保ちながら言語モデルの候補文を一括検証
GDN Tree-Scan: Served Tree Verification for Recurrent-Hybrid Language Models
この論文をやさしく読む
ひとことで言うと
複数の文章候補をまとめて検証する際、再帰型言語モデルの内部状態が候補ごとに正しくつながるようにした高速化手法です。
何に役立つ?
Gated-DeltaNet型モデルの配信で、内部状態の整合性を守りながらデコード処理を効率化するのに役立ちます。
この研究の面白いところ
注意マスクだけを正しくしても内部履歴が誤る問題に対応しています。採用された候補の連鎖だけを状態に反映する仕組みが、複数分岐の検証を支えます。
どこまで分かった?
27.0%は指定モデル・温度・バッチサイズでのトークン重み付きデコード指標です。リクエスト等重みのレイテンシ指標は+4.0%と別に報告され、処理全体はプリフィルの影響が大きいとされています。出力分布の完全な同等性証明もありません。
v1のアブストラクトに基づくAI解説。日本語訳とは別に、用途の解釈を含みます。
アブストラクトの日本語訳
木構造の投機的デコーディングは、複数の続きの候補をターゲットモデルの1回の順伝播で検証する。注意機構のみのTransformerでは、検証器に主として必要なのは祖先関係を表すマスクである。再帰機構を組み合わせた言語モデルでは、この前提は成り立たない。各候補の行には、根からそのノードまでの経路を通常の逐次デコードでたどった場合に生成される再帰状態も必要になる。そうでなければ、正しい注意マスクを使っていても、存在し得ない再帰履歴を条件にした検証が行われる可能性がある。 本研究では、vLLMに統合したGated-DeltaNetハイブリッド言語モデル用の配信時検証器、GDN Tree-Scanを提案する。このシステムは、FlashAttention-2による木構造バイアス付き注意、分岐ごとのGDN走査・再実行、デバイス側での複数ドラフトの確定、採用された連鎖だけの状態反映を組み合わせる。 公開チェックポイントQwen3.6-27B-FP8を用い、温度0.6、バッチサイズ1(B=1)のクリーンなSWE/Codexデコード評価条件で、根から分岐する6ノードの木は、検証順伝播の時間を通常実行とほぼ同じに保ちながら、イベントあたりの確定トークン数を17.2%増加させた。トークン数で重み付けしたデコード速度は、通常の5ステップMTP(E5)の毎秒18.80トークンに対して23.88トークンとなり、スループットが27.0%向上した。リクエストを等しく重み付けしたレイテンシの見方では+4.0%であり、タスク全体の実時間は依然としてプリフィルの影響が大きい。経験的な同等性の証拠は、観測された通常実行の反転の下限範囲内における、再帰状態オラクルを用いた確率再評価(p-rescore)の整合性に限定され、分布間距離の完全な証明ではない。
v1の要旨から自動生成。本文の精読・人による確認は未実施。
- 初稿
- 2026-09-20(UTC)
- 最新改訂
- 2026-09-20 · v1
- 査読・掲載
- 査読状況未確認
更新履歴
- v1 2026-09-20 この版を読む
取得できた版を表示。版の更新は査読済みを意味しません。過去版の本文差分は未解析です。
原文の要旨
Tree speculative decoding verifies multiple candidate continuations in one target forward pass. For attention-only transformers, the verifier mainly needs an ancestry mask. Recurrent-hybrid language models break this assumption: a candidate row must also carry the recurrent state that native sequential decode would have produced along its root-to-node path. Otherwise, a verifier can use a correct attention mask while still conditioning on an impossible recurrent history. We present GDN Tree-Scan, a served verifier for Gated-DeltaNet hybrid language models integrated into vLLM. The system combines FlashAttention-2 tree-bias attention, branch-local GDN scan/replay, device-side multidraft commitment, and accepted-chain-only state publication. On the public Qwen3.6-27B-FP8 checkpoint, in a clean batch-one (B=1) SWE/Codex decode gate at temperature 0.6, a six-node root-branch tree increases committed tokens/event by 17.2% at near-native verify-forward time and reaches 23.88 token-weighted decode tokens/s versus 18.80 for native five-step MTP (E5), a 27.0% token-weighted decode-throughput gain. The per-request-equal latency view is +4.0%, and end-to-end task wall time remains prefill-heavy. Empirical equivalence evidence is scoped to recurrent-oracle probability-rescore (p-rescore) closure within the observed native flip floor, not a full distribution-distance proof.
著者のコメント
9 pages
arXiv ID: 2609.23900 / 要約の誤りについて