ReAct 深度精讀
系列 · 1 篇
-
ReAct:交錯思考與行動,但不能把 few-shot 迴圈當成 Agent runtime
中階 Agent Runtime、安全與評測精讀 Yao et al. ICLR 2023:把 language thought 加進 action space,在 HotpotQA、FEVER、ALFWorld 與 WebShop 上分開讀 hallucination、搜尋失敗與 abstract 的 +34%/+10%。
90 秒掌握這篇論文
- 問題
- LLM 的推理(Chain-of-Thought)與行動(WebGPT、SayCan)被當成兩條分開的線。CoT 不接觸環境;Act-only 能查外部,卻沒有高層計畫與例外處理。
- 核心洞見
- 把語言 thought 加進 action space。thought 不改環境、不產生環境 observation,只更新 context;再與環境動作交錯。決策點從「只想」或「只做」改成「同一條軌跡裡決定下一步是對自己說話,還是碰外部世界」。
- 最強證據
- ALFWorld best-of-6 ReAct 71% vs Act 45%、BUTLER best-of-8 37%;WebShop SR 40.0 vs IL+RL 28.7。HotpotQA 人工分析中,CoT 失敗案例有 56% 是幻覺,ReAct 為 0%(Table 2)。
- 主要邊界
- HotpotQA PaLM-540B 的純 ReAct EM 27.4,低於 CoT 29.4。35.1/64.6 是 ReAct↔CoT-SC 切換。few-shot prompt,Wikipedia API 只有 search/lookup/finish。這不是可部署 runtime。
歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。
演講與聯絡