Agent 安全與遺忘評測
系列 · 1 篇
-
K-Bench:Agent 部署中的 LLM 遺忘,不能只看最後答案
進階精讀 Yu 等人的 K-Bench(arXiv:2609.12808 v1):把 unlearning 從單一回答的證書改成跨六個可觀測通道、四種記憶 substrate 的 Agent 執行面測試,並用 OR-of-channels、collapse-aware K-Score 與預註冊統計拆開真正忘記、通道遷移與 Agent 崩潰。
90 秒掌握這篇論文
- 問題
- TOFU、MUSE 一類 unlearning benchmark 主要把 model 當成問答介面,讀一個 direct answer。這對只存在 weights、且只從該回答表面洩漏的測試有用,卻沒有覆蓋部署後的 context、RAG、database lookup、CoT scratchpad、tool call、tool return 或後續 summary。
- 核心洞見
- 把「秘密放在哪裡」與「Agent 從哪裡取到它」分開控制。K-Bench 每個 cell 只把同一類 PII 放進一個 substrate,再把同一個 Agent trace 暴露成六個 channel;每一 query 對六個 channel 做 logical OR。
- 最強證據
- 在 Llama-3.1-8B 的 no-intervention baseline,非參數 substrate 的 aggregate leakage 是 C = 0.223、R-text = 0.602、R-struct = 0.855;TOFU/MUSE 的 weight probes 在這些 substrate 看到的卻是沒有 target memorization。這是 coverage gap,不是 weight unlearning 不夠強。
- 主要邊界
- K-Bench 的結果只覆蓋它能觀測的六個文字 channel、四個純 substrate、英文 PII、固定 ReAct harness 與特定模型/注入方式。它不是「所有副本都刪除」的證明,也不是 production memory、log、external database 或 multi-agent message bus 的完整 deletion audit。
歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。
演講與聯絡