讀法可搭配 三遍掃描法。在本站的基礎方法主線中,本篇接在 InstructGPT 之後。InstructGPT 處理 post-pretraining 對齊;Speculative Decoding 則在凍結目標模型權重的前提下,用「草稿+平行驗證」加速推論,並以牆鐘加速比與接受率 作為核心證據。
YOLO 同樣把延遲視為一級指標,但兩篇的實驗不能混用:本篇證據來自 T5-XXL 解碼,不是 VOC mAP。更早的基礎篇章可由 AlexNet、ResNet 與 Transformer 依序讀起。
90 秒掌握論文 / The paper in 90 seconds
- 問題:大型自迴歸 Transformer 解碼 個 token 需要 次 序列 前向;每步常受 記憶體頻寬 限制而非純算力飽和,額外並行資源閒置(Section 1)。
- 核心洞見:Speculative Decoding——小模型 先自迴歸產生 個草稿 token,目標模型 一次平行 計算 prefix 到各草稿位置的分佈 ,再用 speculative sampling(rejection sampling + 調整分佈)決定接受幾個草稿並補一個保證來自 的 token。控制點是 無損平行驗證 對 逐步單模型解碼;輸出分佈與只用 完全相同(Algorithm 1、Appendix A.1)。
- 最強證據:T5-XXL 11B 作 ,現成 T5-small 77M 作 ,對 T5X baseline、batch=1、單顆 TPU-v4(Table 2):WMT EnDe 3.4X(temp=0,,)/2.6X(temp=1,);CNN/DM 3.1X/2.3X。摘要與 Section 4 亦報告相對 T5X 的 2X–3X 區間。
- 主要邊界:需要 符合任務的 draft model,硬體也必須能在一輪目標模型計算中平行驗證多個草稿位置;總 算術操作數可能上升(Section 3.4、6)。這是 2023 Google T5X 實作契約,不是 vLLM/TensorRT-LLM 產品 SLA、不是 GPTQ bitwidth、不是 Medusa/EAGLE 額外 head。InstructGPT 85±3% 勝率、Transformer WMT BLEU、YOLO mAP 不屬本 PDF。
我的結論是:Speculative Decoding 最值得保留的貢獻,是在不改變目標分佈的前提下,用草稿模型降低實際解碼時間。Table 2 的 3.4X 只適用於論文設定,不能當成 2026 任意 LLM serving 堆疊的效能保證。
版本與閱讀範圍 / Version and reading scope
本文讀的是 Leviathan et al., ICML 2023 對應的 arXiv:2211.17192 v2(2023-05-18 修訂)。PDF 標示 arXiv.org perpetual non-exclusive license。作者順序以 v2 為準:Yaniv Leviathan、Matan Kalman、Yossi Matias(Leviathan 與 Kalman 同等貢獻)。
除摘要外,本文核對 Section 2 演算法與 speculative sampling、Section 3 接受率/牆鐘分析(Theorem 3.8、Figure 2–5、Table 1)、Section 4 T5-XXL 實驗(Table 2–3)、Section 6 限制,以及截至 2026-08-28 的論文 PDF 可讀性。GPTQ/AWQ、FlashAttention TFLOPS、vLLM、Medusa、EAGLE、Lookahead 數字,都不回填。
讀者真正要回答的問題
當你已有一個訓練好的大型自迴歸模型 ,解碼延遲是產品瓶頸時,該繼續 逐步用 取樣,還是用 較小 打草稿再讓 平行驗證?Leviathan et al. 選後者,並用 分佈等價證明 與 T5-XXL 牆鐘表 同時報告取捨。
比較精確的讀法不是「這是不是 2026 最快的 LLM 推論」。真正的問題是:rejection sampling 如何保證無損、 與 如何換算成每輪產出幾個 token、Table 2 支持什麼硬體契約、以及哪些後來 serving/量化/draft-head 數字不能寫回這篇。
證據地圖 / Evidence map
| 層次 | 本文採用的說法 |
|---|---|
| 論文直接支持 | Figure 1 無條件生成示意(綠=接受草稿、紅=拒絕、藍=修正);Algorithm 1;Equation (1) 期望產出 token 數;Theorem 3.5 、Corollary 3.6 ;Theorem 3.8 牆鐘加速公式;Table 1 理論 speed/ops;Table 2 T5-XXL 實測;Table 3 多任務 ;Figure 5 encoder-decoder trace。 |
| 作者主張 | 大模型解碼可透過 speculative execution 加速且 不改輸出分佈;記憶體頻寬瓶頸下額外並行划算;現成小 Transformer 作 即可 2X–3X;n-gram 等 negligible-cost draft 仍有非零 。 |
| 論文未證明 | 任意硬體上的 vLLM/TensorRT-LLM SLA;GPTQ/AWQ 量化品質;Medusa/EAGLE 學習式 draft head;FlashAttention 核心優化;需重訓或改架構的 adaptive computation 在 相同分佈 下的優勢。 |
| Bloss0m 工程判斷 | 把本篇放在基礎方法主線的無損推論效率段落,接在 InstructGPT 之後。延遲的比較方式可參考 YOLO;模型架構與後續程序的差異則可對照 InstructGPT。GPTQ WikiText、vLLM tokens/s 與 Medusa 接受率不屬於 Table 2。 |
先前方法為何不足 / Why the previous approach is insufficient
Section 1 與 Section 5 把脈絡寫清楚。標準自迴歸解碼 每產生一個 token 就呼叫一次 , token 需要 次序列前向——即使每步 FLOPs 不大,權重與 KV cache 的記憶體讀取 常主導延遲。
常見加速路線與本篇差異:
- 蒸餾/量化/改架構(Hinton et al.、Hubara et al.、So et al.):通常 改模型或重訓,輸出分佈 不保證 與原 相同。
- Adaptive computation / early exit(Han et al.、Schwartz et al.):用啟發式跳步,不保證 與 相同分佈。
- Blockwise Parallel Decoding、SAD(Stern et al.、Sun et al.):需 額外訓練 或限制於 greedy/複製輸入,非一般 stochastic 無損設定。
- 只用 的 greedy/nucleus 解碼:分佈正確但 無法 把多 token 驗證併到一次 呼叫。
InstructGPT 解的是 對齊訓練;Transformer 解的是 序列轉換架構——它們都沒處理 不改權重的解碼牆鐘。
核心直覺 / Core intuition
先不要背 Algorithm 1。想像目標模型 正在續寫一段英文摘要:
標準解碼: 算一步 → 取樣 token → 再算一步 → → … 每步都要等 完整前向。
Speculative Decoding:便宜得多的 (例如 T5-small)先 連猜 個 token ;接著把整段草稿交給 ,在 一次可平行化的目標模型計算 中取得各位置的分佈 。再對每個 做 rejection test:以機率 接受;第一個被拒的 處,從調整分佈 再抽一個 符合 分佈 的 token。全接受則再從 抽一個額外 token。
對照三種容易混在一起的下一步:
- 只用 逐步解碼(baseline):分佈正確,牆鐘 = 次序列 。
- Speculative Decoding(本篇):分佈仍正確(Appendix A.1),牆鐘取決於每輪 接受幾個草稿。
- 蒸餾成小模型單獨部署:可能更快,但 不再是 的分佈;與本篇問題定義不同。
用一個例子走完整個方法 / Walk one example through the method
以下用簡化 T5 英→德翻譯 走 Algorithm 1 一輪(Bloss0m 教學例,非 Table 2 列號)。
- Input:encoder 已編碼英文句;decoder prefix 為
<s> Die(已生成部分德文)。 - Intermediate representation:=T5-small 自迴歸產生 個草稿,例如
Katze / schläft / gut;同時準備好各步 。 - Model or system decision:=T5-XXL 平行 計算 。假設
Katze、schläft通過 rejection test(),第三個gut被拒;從 抽得修正 tokenfriedlich。 - Output:新 prefix
<s> Die Katze schläft friedlich(本輪 2 個接受的草稿 + 1 個修正 token)。 - Likely failure point:若 與 分佈差太遠( 低),幾乎每輪只產 1 個 token,還要付 的 次成本——比 baseline 更慢(Corollary 3.9:需 才有淨加速)。draft 與 target 任務/tokenizer 不對齊 也會壓低 。
技術機制 / Technical mechanism
Speculative sampling(Section 2.3)
要從 取樣,改從 提案 :若 則接受;若 則以機率 拒絕,並從 重抽。Appendix A.1 證明邊際分佈仍為 。
Algorithm 1:一輪解碼(Section 2.1–2.3)
- 輸入:。
- 自迴歸產生 與 。
- 平行 計算 。
- 令 表示這一輪連續接受的草稿數:若第 個草稿首先被拒,則 ;若全部通過,則 。
- 若 ,從調整後的 抽修正 token ;否則從 抽 。
- 輸出:prefix + 接受的 + (至少 1 個來自 鏈上的新 token)。
接受率與期望產出(Section 3.1–3.2)
接受率 ;。在 i.i.d. 簡化下,每輪期望產出 token 數:
Theorem 3.5:,其中 是對稱散度。Corollary 3.6:—— 越貼近 , 越高。
牆鐘加速(Theorem 3.8,Section 3.3)
設 = 單次 步驟時間/單次 步驟時間。每輪 Algorithm 1 成本 ,期望產出上式 token 數,得牆鐘改善因子:
論文實驗中 常比 小 兩個數量級, 且常接近 0(Section 3.3)。

Figure 1,論文 Section 1:speculative decoding 示意(綠=接受、紅=拒絕、藍=修正)。原圖見 arXiv PDF Figure 1。圖檔自 ICML 2023 camera-ready PDF 擷取;arXiv.org perpetual non-exclusive license。本頁擷取含周邊正文,細節以 PDF 為準。

Figure 2,論文 Section 3.1: vs (Equation 1)。原圖見 arXiv PDF Figure 2。擷取與授權說明同 Figure 1。
實驗如何讀 / How to read the evidence
Table 2:T5-XXL 牆鐘(Section 4.1)
問題:相對 T5X baseline,現成小 T5 作 能否 2X–3X 加速且輸出相同?控制:=T5-XXL 11B;任務 WMT EnDe 與 CNN/DM 摘要;batch=1;單顆 TPU-v4;既有 checkpoint;argmax(temp=0)與標準取樣(temp=1)。觀察:T5-small(77M)整體最佳——EnDe 3.4X()/2.6X();CNNDM 3.1X()/2.3X()。T5-large 更高但 更大,speedup 反而較低(1.4X–1.7X)。邊界:Google 內部 T5X 實作;不是開源 vLLM 預設;LaMDA 137B 僅報 (Table 3),非 Table 2 牆鐘。

Table 2,論文 Section 4.1:T5-XXL empirical walltime。原表見 arXiv PDF Table 2。擷取含表頭與部分列;完整數字以 PDF 為準。授權說明同 Figure 1。
Table 3 與 Figure 1 小模型實驗
問題: 如何隨 大小與取樣溫度變化?觀察:GPT-like 97M + 6M 在 lm1b 上 –0.89(Table 3);Figure 1 例句 38 token 僅 9 次 序列呼叫。邊界:lm1b 無條件生成 不等於 生產對話 SLA。
Figure 5:encoder-decoder trace(Section 3.5)
問題: 如何改寫 牆鐘結構?觀察:相對標準解碼(整段紫色 ),/ 以多段藍色 換較少的紫色 區塊。邊界:示意圖,不是 benchmark 表。

Figure 5,論文 Section 3.5:簡化 trace diagram。原圖見 arXiv PDF Figure 5。擷取含周邊說明文字。授權說明同 Figure 1。
Table 1:理論 speed vs ops(Section 3.5)
問題:高 與大 的 代價?觀察:例如 理論 speed 6.86X 但 ops 1.60X。邊界:假設 ;實機需代入 Theorem 3.8。
消融與設計選擇 / Ablations
- 大小(Table 2–3): 隨 變大而升,但 亦升;T5-small 在 T5-XXL 上 balance 最佳。
- (Figure 3、Section 3.5):依 數值最佳化; 高時可用更大 。
- 取樣溫度(Table 2):temp=0(argmax) 的 與 speedup 高於 temp=1——分佈越尖銳,草稿越易與 一致。
- Negligible-cost draft(Section 3.6):EnDe bigram 仍有 ,理論 1.25X()——低但 非零。
限制、威脅與不該過度推導的話 / Limitations and threats to validity
- 算力前提:硬體需能在一輪 計算中 平行驗證 個位置;若系統已受算力而非記憶體頻寬限制,額外工作可能無法換得牆鐘加速(Section 6)。
- 總操作數:低 時 浪費 平行計算與 草稿(Theorem 3.11)。
- Draft 品質: 必須使用相容的 token 空間,並在目標任務上近似 的分佈;演算法不要求兩者同一架構,但論文主要測試同一家族模型,跨模態或跨任務未驗證。
- 硬體年代:單顆 TPU-v4、T5X——2026 GPU 叢集需重測。
- 不要混入後續結果:vLLM、TensorRT-LLM、GPTQ、Medusa、EAGLE、FlashAttention 的 benchmark 不屬於本 PDF。
- 與對齊/CV 分開:InstructGPT 勝率、WMT BLEU(Transformer)、YOLO mAP 不能 寫進 Table 2。
工程判斷與不適用條件 / Engineering decision and when not to use it
何時借用本篇? 當 (a) 你必須保留 的 確切取樣分佈,(b) 解碼受 記憶體頻寬 限制而算力有餘,(c) 有 同族小 checkpoint 可作 ,且延遲是產品指標(呼應 YOLO 把成本放上表)。
何時不要照搬?
- 可以接受 近似分佈(蒸餾、量化)且更在意 記憶體佔用——走不同路線。
- 沒有合適 或 估計過低。
- GPU 已受算力限制,無法從多位置平行驗證取得牆鐘收益。
- 把 3.4X EnDe 寫進 2026 任意 LLM API 的 p99 延遲 SLA。
- 混淆 Medusa/EAGLE 學習式 draft 與本篇 rejection-sampling 無損契約。
Artifact 與可重現性 / Artifacts and reproducibility
截至 2026-08-28:
- 論文:arXiv abs、PDF v2、ICML 2023 proceedings 可讀。
- 程式:論文實作於 Google T5X 內部管線(Section 4.1);未釋出獨立開源 repo 一鍵復現 Table 2。後續社群實作(如 2023 獨立 speculative sampling 工作)為 downstream ports。
- 模型:T5 v1.1 checkpoint 可從公開 T5 生態取得;T5-XXL 11B 需相應資源。
最小有用 reproduction:在 小 GPT/T5 上實作 Algorithm 1 一輪,量測 接受長度 的分佈 與 單步 平行 forward 是否可行——驗證機制,不是復現 3.4X。
三個記憶點 / Three things to remember
- 技術想法: 打草稿、 平行驗證、speculative sampling 保證 與 相同分佈;控制點是 無損推論加速,不是新架構。
- 證據:Table 2——T5-XXL + T5-small,EnDe 3.4X/2.6X、CNNDM 3.1X/2.3X;Figure 2 與 Theorem 3.8 解釋 權衡。
- 邊界:方法需要 draft model 與並行算力,且不是 GPTQ/vLLM/Medusa。基礎方法主線從 CV、序列轉換、對齊走到本篇,這裡處理的是推論效率。
延伸閱讀
若尚未讀過對齊節點,回到 Transformer 與 InstructGPT。讀法見 三遍掃描法。若要對照 把延遲寫進證據表 的 CV 類比,讀 YOLO。GPTQ、FlashAttention、vLLM、Medusa、EAGLE 葉子刻意不展開。