CoT 深度精讀
系列 · 1 篇
-
CoT:讓模型把推理寫出來,但不要當成會動的 Agent
中階 Agent Runtime、安全與評測精讀 Wei et al. NeurIPS 2022:few-shot 示範中間推理步驟,能在夠大的凍結模型上引出多步推理。GSM8K 上 PaLM 540B 從 17.9 到 56.9;這仍是 prompt,不是工具、環境或記憶分頁。
90 秒掌握這篇論文
- 問題
- 標準 few-shot prompting 只給 $\langle$題目, 答案$\rangle$,多步算術、常識與符號推理表現差;只把模型放大也填不平這條曲線。
- 核心洞見
- 把 exemplar 改成 $\langle$題目, 中間推理, 答案$\rangle$。決策點從「直接答」改成「先把推理寫出來再答」。模型權重凍結;這仍是 prompt,不是 agent。
- 最強證據
- PaLM 540B 在 GSM8K 上 17.9 → 56.9,對當時 Cobbe et al. finetuned GPT-3 + verifier 的 55(Table 1、Figure 2)。Figure 4/Table 2 顯示增益大約在 100B 才出現。
- 主要邊界
- 沒有環境、沒有工具、沒有記憶分頁。小模型常更差;鏈可以不通、也可以碰巧答對。Self-consistency(Wang et al., 2022a)是後來的論文,本文主結果用 greedy decoding。
歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。
演講與聯絡