ResNet 深度精讀
系列 · 1 篇
-
ResNet:殘差讓深度可訓,但不能把 ImageNet 2015 當成現成的偵測或 ViT 契約
中階 先建立方法閱讀底座精讀 He et al. CVPR 2016/arXiv:1512.03385:用恆等捷徑讓堆疊層學殘差 F(x)+x,解決 plain 深網的 degradation。ImageNet 上 ResNet-152 單模型 top-5 驗證誤差 4.49%;這是 2015 分類證據,不是 YOLO、ViT 或現代 ConvNet 排行榜契約。
90 秒掌握這篇論文
- 問題
- 在 BN 與良好初始化已讓「幾十層」能收斂之後,繼續堆深 plain 卷積層會出現 degradation——更深模型的 training error 反而更高(Figure 1、Figure 4 左),這不是典型 overfitting。
- 核心洞見
- 把目標映射改寫成殘差學習。若希望底層輸出為 $\mathcal{H}(\mathbf{x})$,不讓堆疊非線性層直接擬合 $\mathcal{H}$,而讓它們擬合 $\mathcal{F}(\mathbf{x}):=\mathcal{H}(\mathbf{x})-\mathbf{x}$,再以恆等捷徑輸出 $\mathbf{y}=\mathcal{F}(\mathbf{x})+\mathbf{x}$(Equation 1)。控制點是「優化器被要求從零擬合 $H(x)$,還是在 identity 上學修正量 $F(x)$」。
- 最強證據
- ImageNet 上同參數量的 plain-34 top-1 28.54% 差於 plain-18 27.94%;ResNet-34 25.03% 則優於 ResNet-18 27.88%(Table 2,10-crop validation)。CIFAR-10 上 plain-56 training error 超過 60% 不顯示,ResNet 家族隨深度降至 ResNet-110 6.43%(Table 6、Figure 6)。單模型 ResNet-152 top-5 validation 4.49%;ensemble test top-5 3.57%(Table 4–5)。
- 主要邊界
- 證據核心是 2012 ImageNet 分類 與 CIFAR-10 深度診斷;PASCAL/COCO 偵測只是 Faster R-CNN 換 backbone 的轉移表(Table 7–8),不是 YOLO 契約,也不是 ViT、ConvNeXt 或 ResNet-RS 的現代 leaderboard。
歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。
演講與聯絡