YOLO 原始論文精讀
系列 · 1 篇
-
YOLO:一次看完整張圖做偵測,但 VOC 2016 不能代表後來的 YOLO 家族
中階 先建立方法閱讀底座精讀 Redmon et al. CVPR 2016/arXiv:1506.02640:把物件偵測改寫成單次前向傳播的迴歸——S×S 網格、B 個框、C 類機率一次輸出。VOC 2007 上 YOLO 63.4% mAP/45 FPS;這是 2016 統一偵測證據,不是 YOLOv3 COCO 或 Ultralytics 產品數字。
90 秒掌握這篇論文
- 問題
- 2016 年前主流偵測器(DPM、R-CNN、Fast/Faster R-CNN)把分類器或區域提議、特徵、分數、後處理拆成多段管線,難以端到端優化,測試也慢(例如 R-CNN 逾 40 秒/張、Fast R-CNN 約 0.5 FPS)。
- 核心洞見
- 把偵測改寫成 單一迴歸:輸入整張圖,單一 CNN 直接輸出空間上分散的邊界框與類別機率。控制點是 one-shot global reasoning 對 two-stage propose-then-classify;整個管線是一個網路,可端到端以偵測損失訓練(Section 1–2、Figure 1–2)。
- 最強證據
- PASCAL VOC 2007(Table 1,train 2007+2012):YOLO 63.4% mAP、45 FPS(Titan X、無 batch);Fast YOLO 52.7% mAP、155 FPS。同表對照 Fast R-CNN 70.0% mAP、0.5 FPS;Faster R-CNN VGG-16 73.2% mAP、7 FPS。Figure 4:YOLO 定位錯誤 19.0% 為主,背景誤報 4.75% 遠低於 Fast R-CNN 13.6%。
- 主要邊界
- 粗網格(每格僅 2 框、1 類)、VOC 20 類、非 instance segmentation;VOC 2012 test 57.9% mAP 低於當時 leaderboard 頂端。YOLOv2/v3/v8、COCO 2017、Ultralytics 產品 mAP 不屬本 PDF;ResNet-152 ImageNet 4.49% 亦不是偵測契約。
歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。
演講與聯絡