← 返回論文精讀

  • Speculative Decoding:用小模型打草稿、大模型一次驗,但 T5 加速比不代表所有推論堆疊

    中階 先建立方法閱讀底座
    Speculative Decoding 原始論文精讀: Part 1 , 筆記: 2026年8月28日 , 論文: 2023 , NLP

    精讀 Leviathan et al. ICML 2023/arXiv:2211.17192:用小模型 M_q 自迴歸打草稿、目標模型 M_p 平行驗證並以 rejection sampling 保證輸出分佈與單獨解碼相同。T5-XXL 11B 在 T5X 上 2.3X–3.4X 牆鐘加速;這是 2023 無損推論演算法證據,不是 GPTQ、FlashAttention、vLLM、Medusa 或 EAGLE 契約。

    90 秒掌握這篇論文
    問題
    大型自迴歸 Transformer 解碼 $K$ 個 token 需要 $K$ 次 序列 前向;每步常受 記憶體頻寬 限制而非純算力飽和,額外並行資源閒置(Section 1)。
    核心洞見
    Speculative Decoding——小模型 $Mq$ 先自迴歸產生 $\gamma$ 個草稿 token,目標模型 $Mp$ 一次平行 計算 prefix 到各草稿位置的分佈 $p1,\ldots,p{\gamma+1}$,再用 speculative sampling(rejection sampling + 調整分佈)決定接受幾個草稿並補一個保證來自 $Mp$ 的 token。控制點是 無損平行驗證 對 逐步單模型解碼;輸出分佈與只用 $Mp$ 完全相同(Algorithm 1、Appendix A.1)。
    最強證據
    T5-XXL 11B 作 $Mp$,現成 T5-small 77M 作 $Mq$,對 T5X baseline、batch=1、單顆 TPU-v4(Table 2):WMT EnDe 3.4X(temp=0,$\gamma=7$,$\alpha=0.75$)/2.6X(temp=1,$\alpha=0.62$);CNN/DM 3.1X/2.3X。摘要與 Section 4 亦報告相對 T5X 的 2X–3X 區間。
    主要邊界
    需要 符合任務的 draft model,硬體也必須能在一輪目標模型計算中平行驗證多個草稿位置;總 算術操作數可能上升(Section 3.4、6)。這是 2023 Google T5X 實作契約,不是 vLLM/TensorRT-LLM 產品 SLA、不是 GPTQ bitwidth、不是 Medusa/EAGLE 額外 head。InstructGPT 85±3% 勝率、Transformer WMT BLEU、YOLO mAP 不屬本 PDF。
    進入完整精讀

歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。

演講與聯絡