Toolformer 深度精讀
系列 · 1 篇
-
Toolformer:自監督學會呼叫 API,但不能把 next-token 工具使用當成 Agent loop
中階 Agent Runtime、安全與評測精讀 Schick et al. NeurIPS 2023:用未來 token 損失當過濾器,讓 GPT-J 在 CCNet 上自監督學會呼叫 QA、Wikipedia、計算機、日曆與翻譯;LAMA 與數學明顯拉開,但這不是可串接的 Agent runtime。
90 秒掌握這篇論文
- 問題
- 語言模型在算術、事實查找、低資源語言與時間意識上明顯弱於更小的專用系統;當時的工具使用要嘛靠大量人工標註,要嘛綁在「已經知道該用哪個工具」的 task-specific few-shot。
- 核心洞見
- 把 API 呼叫插進 next-token 預測。少量人類示範只負責教格式;要不要留下這次呼叫,由「加上呼叫與結果後,未來 token 損失有沒有下降」決定。改動的控制點不是 thought–action 迴圈,而是何時把一次 API 呼叫寫進語言模型的訓練字串。
- 最強證據
- 同一套 GPT-J 6.7B、zero-shot。LAMA 的 SQuAD/Google-RE/T-REx 從 17.8/4.9/31.9 升到 33.8/11.5/53.5,並超過 OPT-66B 與 GPT-3-175B;數學 ASDiv/SVAMP/MAWPS 從 7.5/5.2/9.9 升到 40.4/29.4/44.0。QA 與計算機幾乎總是被選中(約 98.1%/97.9%)。
- 主要邊界
- 關掉 QA 工具後,Wikipedia 搜尋仍追不上 GPT-3。作者限制是不能串工具、不能互動翻搜尋結果、用詞敏感、評測最多一次 API 呼叫、計算機樣本極少、不計工具成本。這不是 production agent runtime。
歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。
演講與聯絡