AlexNet 精讀
系列 · 2 篇
-
AlexNet(上):先用證據讀懂它為何改變 ImageNet
入門 先建立方法閱讀底座以論文可定位證據重讀 AlexNet 的問題、評測與歷史性結果:它證明了什麼,也沒有證明什麼。
90 秒掌握這篇論文
- 問題
- 在 2012 年,用百萬級高解析影像訓練深 CNN 同時受限於優化速度、GPU 記憶體與過擬合。
- 核心想法
- AlexNet 不是單一「大網路」技巧,而是將卷積的局部歸納偏好、ReLU、兩張 GPU 的受限分割與可擴大的八層架構組成可訓練系統。
- 最強證據
- ILSVRC-2010 的 top-1/top-5 error 為 37.5%/17.0%;2012 competition top-5 為 15.3%,次名為 26.2%(Section 6、Table 1)。
- 邊界
- LRN、雙 GPU split 與部分 kernel 設計是當年硬體折衷;這篇不主張它們在現代 accelerator 或所有視覺任務仍是最佳選擇。
-
AlexNet(下):把可訓練化配方拆成可驗證的設計
中階 先建立方法閱讀底座從 Figure 1–3、Sections 3–6 重讀 ReLU、多 GPU、overlapping pooling、資料增強與 dropout 的證據。
90 秒掌握這篇論文
- 問題
- 60M-parameter CNN 即使有 1.2M images 仍會過擬合;也需要把訓練 recipe 與 competition result 分開解讀。
- 核心想法
- 以 random crop/flip、RGB PCA lighting jitter 與 dropout 擴增或正規化有效訓練分布,再用 SGD、momentum、weight decay 和 learning-rate schedule 讓 Part 1 的架構收斂。
- 最強證據
- color augmentation 讓 top-1 error 降超過 1%,overlapping pooling 降 0.4/0.3 points;最終 ILSVRC-2010 37.5/17.0,2012 top-5 15.3(Section 4–6、Table 1)。
- 邊界
- 這些 ablation 多在當年的 architecture/data/compute 組合;不代表每個 modern vision model 都需要 ten-crop、LRN 或相同 learning-rate heuristic。
歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。
演講與聯絡