Transformer 原始論文精讀
系列 · 1 篇
-
Transformer:用 self-attention 拿掉 recurrence,但 WMT 2017 BLEU 不能代表後來的 LLM
中階 先建立方法閱讀底座精讀 Vaswani et al. NeurIPS 2017/arXiv:1706.03762:用 stacked encoder–decoder、multi-head self-attention 與 positional encoding 取代 RNN/CNN 做機器翻譯。WMT 2014 上 big 模型 EN-DE 28.4 BLEU、EN-FR 41.8 BLEU;這是 2017 序列轉換證據,不是 BERT、GPT-3 或 ViT 契約。
90 秒掌握這篇論文
- 問題
- 2017 年前 SOTA 序列轉換(seq2seq)多靠 RNN/LSTM/GRU encoder–decoder,計算沿時間步序列展開,難以在長序列上充分並行;Bahdanau 等雖已把 attention 接到 RNN 上,但 recurrence 仍是骨幹(Section 1–2)。
- 核心洞見
- 提出 Transformer:encoder 與 decoder 皆由 multi-head self-attention 與 position-wise FFN 堆疊而成,以 sinusoidal positional encoding 注入順序,完全拿掉 recurrence 與 convolution。控制點是 可並行的 global attention 對 循序 hidden state;路徑長度對遠距依賴為 $O(1)$(Table 1)。
- 最強證據
- WMT 2014 newstest2014(Table 2):Transformer (big) EN-DE 28.4 BLEU(超越先前含 ensemble 的最佳結果)、EN-FR 41.8 BLEU;big 在 8×P100 上訓練 3.5 天(300K steps)。Base 模型 EN-DE 27.3 BLEU,訓練 FLOPs $3.3\times10^{18}$,低於 GNMT+RL 的 $2.3\times10^{19}$。硬體段落:base 12 小時/100K steps、每 step 0.4 秒(Section 5.2)。
- 主要邊界
- 任務是 監督式 MT encoder–decoder,不是預訓練語言模型、不是 BERT 雙向編碼、不是 decoder-only GPT、不是 ViT。BERT/GPT-2/3/T5/LLaMA/ChatGPT 的 benchmark 不屬本 PDF;YOLO VOC mAP、ResNet ImageNet 4.49% 亦不是 MT 契約。
歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。
演講與聯絡