← 返回論文精讀

  • Gorilla:把大規模 API 目錄變成可檢索的工具,但 APIBench 不代表 MCP 產品能力

    中階 Agent Runtime、安全與評測
    Gorilla 深度精讀: Part 1 , 筆記: 2026年8月27日 , 論文: 2024 , NLP

    精讀 Patil et al. NeurIPS 2024:在 APIBench(TorchHub/TensorHub/HuggingFace)上以 retriever-aware 微調 LLaMA-7B,讓目錄級 API 呼叫可檢索、可核對;zero-shot 整體準確率與幻覺率勝過當下的 GPT-4 提示,但這不是 ReAct 迴圈、不是 MidTool mid-training,也不是 RAG-MCP 產品路由。

    90 秒掌握這篇論文
    問題
    LLM 寫 API 呼叫時容易幻覺名稱、參數與用法;真實世界不是五個固定工具,而是會頻繁更新的巨大 API 目錄。
    核心洞見
    把工具使用做成 檢索+呼叫:用 self-instruct 在 APIBench 上生成指令—API 對,再以 retriever-aware 方式微調 LLaMA-7B(RAT),讓模型學會讀取「Use this API documentation for reference: …」後面的文件並發出正確呼叫。
    最強證據
    NeurIPS Table 1。Gorilla zero-shot 在 TorchHub/HuggingFace/TensorFlow Hub 的 overall 為 59.13%/71.68%/83.79%,hallu 為 6.98%/10.95%/5.40%;同表 GPT-4 zero-shot 為 38.70%/19.80%/18.20% overall,hallu 36.55%/37.16%/78.65%。Figure 6 顯示測時改文件時,RAT 模型會跟著改呼叫。
    主要邊界
    語料是 ML hub 的 model-card/API JSON,不是任意 REST 產品目錄;評測是單次 AST 子樹匹配,不是多步 agent loop;差的檢索器會拖垮表現(Table 2)。不要把 APIBench 數字寫進 MidTool 或 RAG-MCP。
    進入完整精讀

歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。

演講與聯絡