← 返回論文精讀

  • CoT:讓模型把推理寫出來,但不要當成會動的 Agent

    中階 Agent Runtime、安全與評測
    CoT 深度精讀: Part 1 , 筆記: 2026年8月27日 , 論文: 2022 , NLP

    精讀 Wei et al. NeurIPS 2022:few-shot 示範中間推理步驟,能在夠大的凍結模型上引出多步推理。GSM8K 上 PaLM 540B 從 17.9 到 56.9;這仍是 prompt,不是工具、環境或記憶分頁。

    90 秒掌握這篇論文
    問題
    標準 few-shot prompting 只給 $\langle$題目, 答案$\rangle$,多步算術、常識與符號推理表現差;只把模型放大也填不平這條曲線。
    核心洞見
    把 exemplar 改成 $\langle$題目, 中間推理, 答案$\rangle$。決策點從「直接答」改成「先把推理寫出來再答」。模型權重凍結;這仍是 prompt,不是 agent。
    最強證據
    PaLM 540B 在 GSM8K 上 17.9 → 56.9,對當時 Cobbe et al. finetuned GPT-3 + verifier 的 55(Table 1、Figure 2)。Figure 4/Table 2 顯示增益大約在 100B 才出現。
    主要邊界
    沒有環境、沒有工具、沒有記憶分頁。小模型常更差;鏈可以不通、也可以碰巧答對。Self-consistency(Wang et al., 2022a)是後來的論文,本文主結果用 greedy decoding。
    進入完整精讀

歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。

演講與聯絡