← 返回論文精讀

  • AlexNet(上):先用證據讀懂它為何改變 ImageNet

    入門 先建立方法閱讀底座
    AlexNet 精讀 · Part 1 · 筆記 · 2026年3月18日 · 論文 · 2012 · CV

    以論文可定位證據重讀 AlexNet 的問題、評測與歷史性結果:它證明了什麼,也沒有證明什麼。

    90 秒掌握這篇論文
    問題
    在 2012 年,用百萬級高解析影像訓練深 CNN 同時受限於優化速度、GPU 記憶體與過擬合。
    核心想法
    AlexNet 不是單一「大網路」技巧,而是將卷積的局部歸納偏好、ReLU、兩張 GPU 的受限分割與可擴大的八層架構組成可訓練系統。
    最強證據
    ILSVRC-2010 的 top-1/top-5 error 為 37.5%/17.0%;2012 competition top-5 為 15.3%,次名為 26.2%(Section 6、Table 1)。
    邊界
    LRN、雙 GPU split 與部分 kernel 設計是當年硬體折衷;這篇不主張它們在現代 accelerator 或所有視覺任務仍是最佳選擇。
    進入完整精讀
  • AlexNet(下):把可訓練化配方拆成可驗證的設計

    中階 先建立方法閱讀底座
    AlexNet 精讀 · Part 2 · 筆記 · 2026年3月19日 · 論文 · 2012 · CV

    從 Figure 1–3、Sections 3–6 重讀 ReLU、多 GPU、overlapping pooling、資料增強與 dropout 的證據。

    90 秒掌握這篇論文
    問題
    60M-parameter CNN 即使有 1.2M images 仍會過擬合;也需要把訓練 recipe 與 competition result 分開解讀。
    核心想法
    以 random crop/flip、RGB PCA lighting jitter 與 dropout 擴增或正規化有效訓練分布,再用 SGD、momentum、weight decay 和 learning-rate schedule 讓 Part 1 的架構收斂。
    最強證據
    color augmentation 讓 top-1 error 降超過 1%,overlapping pooling 降 0.4/0.3 points;最終 ILSVRC-2010 37.5/17.0,2012 top-5 15.3(Section 4–6、Table 1)。
    邊界
    這些 ablation 多在當年的 architecture/data/compute 組合;不代表每個 modern vision model 都需要 ten-crop、LRN 或相同 learning-rate heuristic。
    進入完整精讀

歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。

演講與聯絡