Speculative Decoding 原始論文精讀
系列 · 1 篇
-
Speculative Decoding:用小模型打草稿、大模型一次驗,但 T5 加速比不代表所有推論堆疊
中階 先建立方法閱讀底座精讀 Leviathan et al. ICML 2023/arXiv:2211.17192:用小模型 M_q 自迴歸打草稿、目標模型 M_p 平行驗證並以 rejection sampling 保證輸出分佈與單獨解碼相同。T5-XXL 11B 在 T5X 上 2.3X–3.4X 牆鐘加速;這是 2023 無損推論演算法證據,不是 GPTQ、FlashAttention、vLLM、Medusa 或 EAGLE 契約。
90 秒掌握這篇論文
- 問題
- 大型自迴歸 Transformer 解碼 $K$ 個 token 需要 $K$ 次 序列 前向;每步常受 記憶體頻寬 限制而非純算力飽和,額外並行資源閒置(Section 1)。
- 核心洞見
- Speculative Decoding——小模型 $Mq$ 先自迴歸產生 $\gamma$ 個草稿 token,目標模型 $Mp$ 一次平行 計算 prefix 到各草稿位置的分佈 $p1,\ldots,p{\gamma+1}$,再用 speculative sampling(rejection sampling + 調整分佈)決定接受幾個草稿並補一個保證來自 $Mp$ 的 token。控制點是 無損平行驗證 對 逐步單模型解碼;輸出分佈與只用 $Mp$ 完全相同(Algorithm 1、Appendix A.1)。
- 最強證據
- T5-XXL 11B 作 $Mp$,現成 T5-small 77M 作 $Mq$,對 T5X baseline、batch=1、單顆 TPU-v4(Table 2):WMT EnDe 3.4X(temp=0,$\gamma=7$,$\alpha=0.75$)/2.6X(temp=1,$\alpha=0.62$);CNN/DM 3.1X/2.3X。摘要與 Section 4 亦報告相對 T5X 的 2X–3X 區間。
- 主要邊界
- 需要 符合任務的 draft model,硬體也必須能在一輪目標模型計算中平行驗證多個草稿位置;總 算術操作數可能上升(Section 3.4、6)。這是 2023 Google T5X 實作契約,不是 vLLM/TensorRT-LLM 產品 SLA、不是 GPTQ bitwidth、不是 Medusa/EAGLE 額外 head。InstructGPT 85±3% 勝率、Transformer WMT BLEU、YOLO mAP 不屬本 PDF。
歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。
演講與聯絡