Agent 工具契約與靜默失敗
系列 · 1 篇
-
SilentProbe:當 HTTP 200 沒有回答你問的問題
進階精讀 SilentProbe(arXiv:2609.00035 v1):從 OpenAPI constraint gap、live differential probe 到 agent 的 false negative,拆開 disclosure 與 machine-readability 如何共同決定工具是否會誠實失敗。
90 秒掌握這篇論文
- 問題
- Agent 呼叫第三方 API 時,空結果可能代表「真的沒有符合條件的資料」,也可能代表 server 沒看懂 filter、把它丟掉,卻照樣回傳 HTTP 200 與可解析的 JSON。兩者都沒有 exception、錯誤 status 或可供 branch 的欄位。
- 核心洞見
- 要拆成兩個獨立問題。Disclosure 問模型能否從說明中選出 vendor 接受的 vocabulary;machine-readability 問 validator 能否在 request 離開前拒絕錯值。只有後者能被通用基礎設施強制執行。
- 最強證據
- 公共 OpenAPI corpus 的 721,320 個 parameter leaves 中,只有 7.5% 宣告 enum、15.2% 宣告任一 machine-checkable constraint,40.1% 的文件至少有一個 prose constraint gap。219 個 live perturbations 則顯示 machine-checkable 組是 111/111 honest errors,prose-only 組有 44/61 silent failures(Section 4.1–4.2、Figure 5)。
- 主要邊界
- 在三個 parameter 的 agent experiment 中,description 只舉例 1/18 個 department 值時,12 個模型在 88/88 次都選到無效 vocabulary;把相同 vocabulary 提升成 enum 後是 0/89 silent failures。這是介面與測試 harness 下的證據,不是模型或所有 production API 的普遍定律。
歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。
演講與聯絡