← 返回論文精讀

  • Tool Call 成功,Workflow 仍失敗:Agent–Tool Boundary 的外部效應異常

    進階
    Agent 工具邊界與效應可靠性: Part 1 , 筆記: 2026年9月16日 , 論文: 2026 , AI Systems

    深讀 Agent–Tool Boundary 的 effect-history 模型:為什麼單次 tool call 回傳成功,仍不足以保證長流程的外部世界狀態一致,以及 MCP annotation 與交易式工具契約究竟填補了哪些空白。

    90 秒掌握這篇論文
    問題
    一個 agent workflow 可能先建立訂位、再扣款、再寄送確認信。每一個 tool 都可能回傳成功、失敗或 timeout,但 workflow 真正關心的是外部世界發生了哪些不可逆 effect,以及這些 effect 是否仍然存活。若 runtime 只看最後一個 response,retry、speculation、併發與 crash 都會讓「call 成功」和「事情完成」脫鉤。
    核心洞見
    把 external effect history 與 runtime observation 分成兩層。一次 attempt 可能得到 unknown,而 externalize 可能已經發生;反過來,runtime 也可能看見成功,但之後的 commit、abort 或 compensation 沒有形成預期的世界狀態。workflow safety 要談的是 effect history,而不是單次 API response。
    最強證據
    Section 3 的 Table 2 將八種 anomaly 對到所需 boundary capabilities;Section 5 對 2026-07-27 MCP registry snapshot 做 98,291-tool census。74.0% 的 tool 至少有一個標準 annotation,61.7% 同時有四個,但 Table 4 顯示這些 hints 對 A2–A8 都沒有提供足夠的 transactional guarantee。
    主要邊界
    這是 effect-history vocabulary、coverage conjecture 與 runtime-contract 分析,不是八種 anomaly 已在所有 production agent 中測出的 prevalence study。對 ACRFence、RAC、Atomix、Cordon、CoAgent 與 Shepherd 的 coverage 是作者整理的 partial/stated comparison,不等於形式證明。
    進入完整精讀

歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。

演講與聯絡