← 返回論文精讀

  • AgentS4D 論文精讀:任務完成了,Runtime 真的安全嗎?

    進階 Agent Runtime、安全與評測
    Agent 安全 · Part 1 · 筆記 · 2026年8月7日 · 論文 · 2026 · AI Agent

    拆解 AgentS4D 如何把 workspace agent 的風險入口、誘導策略、目標傷害與生命週期證據放進同一個 sandbox benchmark,並檢查完成率為什麼不能代表安全。

    90 秒掌握這篇論文
    問題
    workspace agent 即使完成任務,仍可能因 prompt、skill、file、web content、memory 或 user message 的風險載體產生不安全副作用。
    核心想法
    AgentS4D 將評估單位設為完整的 harness–LLM–task 環境,依風險來源、induction strategy、harm 與 execution lifecycle 檢查 completion 與 safety。
    最強證據
    328 個注入風險案例在 20 組 harness/backend configuration 中得到 6,560 runs;4,461 runs (68.0%) 觸發預先定義的 unsafe signal,4,344 runs(66.22%)同時 unsafe 且 complete(Section 4、Table 2)。
    邊界
    案例、資產與效果是 synthetic/controlled,且 v1 沒有 executable code 或 data;這些比例不是 production incident rate,也不是任一 harness 的通用安全排序。
    進入完整精讀
  • Agentic Configuration Management:把 Agent 系統當成可治理的組態,而不只是一次執行

    進階
    Agent 安全 · Part 2 · 筆記 · 2026年8月12日 · 論文 · 2026 · AI Agent

    深讀 ACM 如何用跨框架的 Configuration Graph、immutable revisions、dependency-aware impact propagation 與 runtime provenance,治理 LangGraph、CrewAI 與 OpenAI Agents SDK 的異質 Agent 組態。

    90 秒掌握這篇論文
    問題
    一個 agent system 的行為不只由程式碼決定,還取決於 prompt、model、tool、skill、workflow、policy、framework 與 runtime state;現有 framework 和 AgentOps 工具各自管理一部分,卻很難把「哪個完整組態產生了這次執行」固定下來。
    核心洞見
    ACM 把這些異質 artifact 正規化成 typed、independently versioned 的 Agentic Configuration Items(ACI),由四張互連的 Configuration、Evolution、Assurance、Runtime Graph 管理;執行 framework 只負責投影,治理 kernel 在共同表示上工作。
    最強證據
    27 個 controlled governance scenarios 跨 LangGraph、CrewAI 與 OpenAI Agents SDK,另有 9 個 quantitative impact cases;三個 framework 在受控範圍得到相同 governance outcomes,重複執行的 impact set 與 metrics 也一致(Section 7.2–7.6、Tables 8、10、12)。
    主要邊界
    這是 reference model 與 prototype 的 conformance/feasibility evidence;distributed execution、learning、long-term memory、MCP/A2A native protocol 與 large-scale industrial validation 都在目前範圍外(Table 13、Table 14、Sections 8.4、9)。
    進入完整精讀

歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。

演講與聯絡