← 返回論文精讀

從任務結果、軌跡、runtime 訊號到 benchmark,拆解 Agent 是否真的可靠。

讀者問題

除了最後答案,我們還要觀察與驗證哪些訊號,才能相信 Agent 完成了工作?

READING LIBRARY

深入讀這個議題

目前收錄在這個研究議題下的所有論文精讀。

  • 派對之後:病毒式 Agent Skill 生態留下的治理與安全掃描難題

    進階
    Agent Skill 生態治理: Part 1 , 筆記: 2026年9月17日 , 論文: 2026 , AI Safety

    深讀 After the Party 的 OpenClaw/ClawHub 生態研究:從 91 天的爆發式成長、下載集中與 reviewability gap,到 privilege evidence、掃描器分歧與可轉移的治理方法。

    90 秒掌握這篇論文
    研究問題
    當一個 agent-skill registry 在幾個月內快速擴張,下載量、stars、版本、留言、宣告的 capability 與實際可執行權限,哪些訊號還能支持治理決策?研究者以 OpenClaw 與 ClawHub 為案例,追蹤成長、關聯可攜性、reviewability 與 scanner agreement。
    核心洞見
    skill 不是只存在於文字內容裡。相同的 SKILL.md 或 package,在不同 host、tool visibility、execution context 與 policy 下,可能暴露完全不同的 privilege surface;registry metadata 也不能把 popularity、reviewability、static evidence 與 runtime behavior 合成一個信任分數。
    最強證據
    RQ1 重建 91.11 天的 stock 由 33,399 增到 65,175;前 10% 取得 46.93% downloads,Gini 為 0.528。RQ3 顯示 85.06% 的可評估 skill 至少有一項 privilege evidence;RQ4 的三個 scanner 只在 446 個項目上同時 flag,且人工 reference set 中 LLM scanner 的 sensitivity 61.06%、static scanner 為 21.67%。
    主要邊界
    這不是所有 registry 的 insecurity prevalence,也不是三個 scanner 的通用 benchmark。資料是單一生態、特定 snapshot、部分歷史資料重建;withdrawn data、缺失欄位與沒有 perfect ground truth,都會改變可解釋範圍。
    進入完整精讀
  • Predicting Partial Answer Quality:讓 Agentic RAG 在下一輪以前知道是否值得繼續

    進階
    Agentic RAG 的軌跡評估: Part 1 , 筆記: 2026年9月17日 , 論文: 2026 , Information Retrieval

    深讀 Predicting Partial Answer Quality and Utility in Agentic Retrieval-Augmented Generation:把每輪中間答案的 quality、utility 與 trajectory signals 變成 early-stopping controller,並檢查節省迭代的證據與轉移邊界。

    90 秒掌握這篇論文
    問題
    Agentic RAG 在多輪 query、retrieve、read、reasoning 之後才產生最終答案;如果每個 instance 都跑到自然停止,可能在答案已經足夠後繼續花成本,也可能在已經失敗時反覆搜尋。論文問的是:能不能在每一輪的 partial answer 出現時預測它的 quality 與 utility?
    核心洞見
    partial quality 與 incremental utility 是兩個不同 target。Quality 問「現在的 answer 有多接近 ground truth」,utility 問「從上一輪到現在增加了多少」;前者較可預測,後者的正負方向更受 trajectory、retrieval noise 與 task 影響。
    最強證據
    作者在 Search-R1 與 R1-Searcher 的 HotpotQA、2WikiMultiHopQA、MuSiQue 上測試 supervised 與 unsupervised predictors。Search-R1 的 quality Pearson 最高約 0.438、utility 最高約 0.321;controller 在 thetaP=0.3、thetaU=0.2 時將平均 iterations 由 3.21 降至 2.86,減少 10.89%,保留 97.60% 的自然停止品質。
    主要邊界
    partial answer 以 F1 against gold answer probe;它不等於 open-ended answer quality,也不代表 threshold 能直接轉移到新的 retriever、model、corpus、答案型態或 controller。probing 本身還需要 generation cost。
    進入完整精讀
  • SilentProbe:當 HTTP 200 沒有回答你問的問題

    進階
    Agent 工具契約與靜默失敗: Part 1 , 筆記: 2026年9月17日 , 論文: 2026 , AI Systems

    精讀 SilentProbe(arXiv:2609.00035 v1):從 OpenAPI constraint gap、live differential probe 到 agent 的 false negative,拆開 disclosure 與 machine-readability 如何共同決定工具是否會誠實失敗。

    90 秒掌握這篇論文
    問題
    Agent 呼叫第三方 API 時,空結果可能代表「真的沒有符合條件的資料」,也可能代表 server 沒看懂 filter、把它丟掉,卻照樣回傳 HTTP 200 與可解析的 JSON。兩者都沒有 exception、錯誤 status 或可供 branch 的欄位。
    核心洞見
    要拆成兩個獨立問題。Disclosure 問模型能否從說明中選出 vendor 接受的 vocabulary;machine-readability 問 validator 能否在 request 離開前拒絕錯值。只有後者能被通用基礎設施強制執行。
    最強證據
    公共 OpenAPI corpus 的 721,320 個 parameter leaves 中,只有 7.5% 宣告 enum、15.2% 宣告任一 machine-checkable constraint,40.1% 的文件至少有一個 prose constraint gap。219 個 live perturbations 則顯示 machine-checkable 組是 111/111 honest errors,prose-only 組有 44/61 silent failures(Section 4.1–4.2、Figure 5)。
    主要邊界
    在三個 parameter 的 agent experiment 中,description 只舉例 1/18 個 department 值時,12 個模型在 88/88 次都選到無效 vocabulary;把相同 vocabulary 提升成 enum 後是 0/89 silent failures。這是介面與測試 harness 下的證據,不是模型或所有 production API 的普遍定律。
    進入完整精讀
  • RAGSieve:用自我參照的局部對比,找出 RAG 知識投毒的排名推升

    進階
    RAG 檢索完整性與治理: Part 1 , 筆記: 2026年9月17日 , 論文: 2026 , Information Retrieval

    深讀 RAGSieve:以同一個檢索事件的 retrieval tail 與同一個語料鄰域作為局部對照,在 query-time 與 corpus-time 找出可疑的排名推升;同時釐清投毒偵測不是事實查核。

    90 秒掌握這篇論文
    問題
    RAG 把外部語料放進生成證據。攻擊者只要能透過公開頁面、共享儲存或 connector 讓少量文件進入 index,就可能讓特定錯誤答案在目標 query 的 top-5 被看見。難處是:被攻擊的 corpus 不是可信 reference,而不同主題的自然語意密度也不一樣。
    核心洞見
    不要以為有一份先驗乾淨資料集,也不要用一個跨語料的 global threshold。RSQ 以同一 query 的 top-5 與 ranks 6–20 做 query-local contrast;RSG 以每份文件自己的語意鄰居與 local floor 做 corpus-local contrast。兩者都讓 inspected system 自己提供 matched control。
    最強證據
    RSQ 在九個 dataset–retriever 組合、六種攻擊的 macro AUROC 為 95.2%,在最多移除 5% clean document 的 operating point 偵測 82.2% poison;RSG 對應為 93.3% 與 79.8%。串接 RSG 與 RSQ 後,六種攻擊的 ASR 從 67.4% 降至 14.0%,unpoisoned-retrieval F1 則由 42.1% 變為 41.3%(Table 1、Table 5、Table 9)。
    主要邊界
    這些數字是合成攻擊、三個 QA corpus、三個 dense retriever 與固定評測 protocol 的結果。它們支持「可疑 promotion pattern 可以被局部對照抓到」,不支持「被 flag 的文字一定是假的」、 「檢索到的 claim 已完成 truth verification」,也不支持 production-scale 多租戶延遲或 zero-poison guarantee。
    進入完整精讀
  • BTS-AgentBench:把只讀遙測編譯成可重播的 Agent 評測回合

    進階
    遙測資料到 Agent 評測: Part 1 , 筆記: 2026年9月17日 , 論文: 2026 , AI Engineering

    精讀 Jeong-Yoon Kim 的 BTS-AgentBench(arXiv:2608.27334 v1):從 BTS 建築遙測建立只讀工具、可執行任務、有限互動契約與證據化評測;精確重播很強,但不等於生產安全或任意領域的可攜性。

    90 秒掌握這篇論文
    問題
    建築現場累積了多年 sensor 與 equipment 的只讀遙測,但 raw history 不是可直接交給 Agent 的多回合任務。若逐筆手寫任務,既難保留站點的本地名稱與關係,也難維護來源答案、split 與 evidence 的一致性。
    核心洞見
    把 benchmark construction 當成一條可重播的編譯鏈:先將 metadata 與歷史資料放進只讀 tool store,再由固定規則建立 static task,最後把原本的計算包進 typed、有限的互動契約。互動表面可以增加澄清、目標修訂、nearest timestamp、品質決策與證據追問,但來源計算與 gold 必須一起重新執行。
    最強證據
    兩次獨立的 raw-to-episode build 對上 11 個 logical tool-store exports,也逐筆重現 BTS 的 356/87/89 train/dev/test release;公開的 532 筆 episode 通過 coded contract preflight。這是 construction consistency 的證據,不是 operator realism 或生產部署的證據(論文 Table 7、Appendix A.3)。
    主要邊界
    BTS-AgentBench 是只讀、離線、有限回合的 building-telemetry benchmark。它的零 controller success 是 construction-exclusion 條件,不是任務難度的獨立估計;XAI4HEAT 的 41/41 也只說明第二個遙測 corpus 上的執行可行性,不能外推到任意 event log 或物理控制。
    進入完整精讀
  • 失敗一旦傳播,還能找出起點嗎?Agentic RAG 的因果失敗歸因

    進階
    Agentic RAG 失敗診斷與歸因: Part 1 , 筆記: 2026年9月17日 , 論文: 2026 , Retrieval Systems

    深讀 When Failures Propagate:用介入式 benchmark、三跳 MuSiQue 與 certified content corruption,拆開 Agentic RAG 的失敗偵測、因果歸因、傳播與恢復。

    90 秒掌握這篇論文
    問題
    Agentic RAG 把 retrieval、reasoning 與回答拆成多個 hop。早期拿到錯誤 evidence,可能在後面變成 query drift、錯誤 bridge 或 wrong answer;但後續 retrieval 也可能把它修回來。只看 final answer 或最後一個 trace,無法直接知道最早哪一跳造成失敗。
    核心洞見
    AgenticRAG-FP 在指定 hop $h$ 先注入一個可認證的 fault,再從被改過的 prefix 重新執行 suffix。診斷器不是對一條靜態錯誤 trace 猜原因,而是拿預先知道的 injectedathop 檢驗 exact-hop attribution。
    最強證據
    strict dense Claude Haiku 4.5 sweep 取 80 題三跳 MuSiQue;在仍然失敗的案例中,coverage-based diagnosis 的 exact-hop accuracy 為 hop 1:0.91 [0.81, 0.98]、hop 2:0.00 [0.00, 0.00]、hop 3:0.00 [0.00, 0.00],分母分別是 43、36、21(Table 2,Section 7.1)。
    主要邊界
    這個結果支持「在這組 strict intervention 與後綴重跑裡,coverage 的 hop-level signal 會在較深 hop 消失」,不支持「所有自然發生的 Agentic RAG 失敗都不可歸因」。content study 的 hop 2 只有 18 個 failed cases,hop 3 只有 3 個,因此 method ranking 不能外推。
    進入完整精讀
  • ACE:讓簡報畫布 Agent 先理解結構,再用批評回饋修正

    進階
    Agent Canvas 編輯與評測: Part 1 , 筆記: 2026年9月17日 , 論文: 2026 , AI Engineering

    深讀 ACE(arXiv:2608.24103 v1):以 hierarchical scene graph、CARE 與 instruction-following judge 把多頁簡報編輯拆成可路由、可差分、可回溯的閉迴路,並釐清 benchmark、human rater、mock 與 live reproduction 的邊界。

    90 秒掌握這篇論文
    問題
    PowerPoint/HTML 一類 flat absolute-positioned 文件把物件位置寫成大量座標。Agent 若要在一個 element 新增內容或改 layout,常得重新計算其他物件;而不同但合理的設計可能被 reference-diff 指標誤判為錯。
    核心洞見
    ACE 以 hierarchical scene graph 保存 parent–child 關係、相對變換與 auto-layout,再用 98 個專用工具把意圖映射到結構化操作;CARE 只取與任務相關的 slide、節點或 design token。完成 edit 後,JsonDiff 對比原始與目前狀態,由不看 ground truth 的 instruction-following judge 提供下一輪 critique。
    最強證據
    完整 94-task benchmark 的 GPT IF 是 ACE 4.23、HTML baseline 3.81,paired p=.010;速度約 1.75 倍、成本約低 44%。但同一組的 VQ 是 3.66 對 3.57(p=.56),所以 headline 不是「所有視覺品質都提升」。
    主要邊界
    26 位 blind raters 在 ACE 對 HTML 的 overall decisive win rate 是 58.7%,self-corrected output 對 single-pass 是 81.5%;這些結果有小樣本、tie、低至中度一致性與 judge circularity 限制。它沒有證明 ACE 能改善所有 creative editing,也沒有證明 judge 能取代設計師。
    進入完整精讀
  • Tool Call 成功,Workflow 仍失敗:Agent–Tool Boundary 的外部效應異常

    進階
    Agent 工具邊界與效應可靠性: Part 1 , 筆記: 2026年9月16日 , 論文: 2026 , AI Systems

    深讀 Agent–Tool Boundary 的 effect-history 模型:為什麼單次 tool call 回傳成功,仍不足以保證長流程的外部世界狀態一致,以及 MCP annotation 與交易式工具契約究竟填補了哪些空白。

    90 秒掌握這篇論文
    問題
    一個 agent workflow 可能先建立訂位、再扣款、再寄送確認信。每一個 tool 都可能回傳成功、失敗或 timeout,但 workflow 真正關心的是外部世界發生了哪些不可逆 effect,以及這些 effect 是否仍然存活。若 runtime 只看最後一個 response,retry、speculation、併發與 crash 都會讓「call 成功」和「事情完成」脫鉤。
    核心洞見
    把 external effect history 與 runtime observation 分成兩層。一次 attempt 可能得到 unknown,而 externalize 可能已經發生;反過來,runtime 也可能看見成功,但之後的 commit、abort 或 compensation 沒有形成預期的世界狀態。workflow safety 要談的是 effect history,而不是單次 API response。
    最強證據
    Section 3 的 Table 2 將八種 anomaly 對到所需 boundary capabilities;Section 5 對 2026-07-27 MCP registry snapshot 做 98,291-tool census。74.0% 的 tool 至少有一個標準 annotation,61.7% 同時有四個,但 Table 4 顯示這些 hints 對 A2–A8 都沒有提供足夠的 transactional guarantee。
    主要邊界
    這是 effect-history vocabulary、coverage conjecture 與 runtime-contract 分析,不是八種 anomaly 已在所有 production agent 中測出的 prevalence study。對 ACRFence、RAC、Atomix、Cordon、CoAgent 與 Shepherd 的 coverage 是作者整理的 partial/stated comparison,不等於形式證明。
    進入完整精讀
  • EvoOntology:讓 Data Agent 的本體層從靜態說明變成可驗證的自演化介面

    進階
    Data Agent 的自演化本體層: Part 1 , 筆記: 2026年9月16日 , 論文: 2026 , Data Agents

    深讀 EvoOntology:把 heterogeneous data 的 ontology 封裝成 MCP server,由 builder agent 建立 evidence-grounded 初始層,再用 attribution-guided typed edits 與 backbone-conditional paired gate 持續演化。

    90 秒掌握這篇論文
    問題
    data agent 面對 tables、files、databases 時,不只是不知道欄位名稱,也不知道一個 domain concept 對應哪個 field、哪個 join、哪個 filter、哪個數值限制。Raw querying 讓 agent 自己反覆探索;static semantic layer 又可能太大、太舊,且要靠人工維護。這個 agent–data gap 會直接轉成錯誤的 query、冗長的 trajectory 與無法解釋的答案。
    核心洞見
    不要把 ontology 當成一份永遠不變的 prompt 文件,而是當成由 Content、Schema、Tool 組成、可被 agent 查詢的 versioned MCP service。Builder agent 用 probe 把語義接到真實資料;evolution agent 從失敗 trajectory 找出缺口,提出單層、typed、evidence-grounded patch,再以同一 backbone 的 paired validation 決定是否接受。
    最強證據
    Figure 2 描繪三層架構;Figure 4 顯示四個 backbone 在 accepted rounds 中逐步上升;Table 5–7 分別拆解 gate/attribution/diagnose、editable level 與 object family 的貢獻;Appendix B 的 Table 8 顯示 per-turn context 變大,但平均 turns/task 從 14.6 降到 8.4、total tokens/task 從 52.6K 降到 42.0K。
    主要邊界
    headline gain 需要把四-backbone analysis subset、六-backbone main tables、不同 benchmark metric 與 round-wise evolution 分開閱讀。作者的 repository 有可檢查的 framework code 與 demo,但 raw benchmark data、prebuilt ontology、模型 weights 與完整 provider credentials 不是隨 repo 一起交付。
    進入完整精讀
  • Corrupt Plans, Clean Traces:Plan Injection 為何能繞過 Chain-of-Thought Monitoring

    進階
    CoT Monitoring 與 Plan Injection: Part 1 , 筆記: 2026年9月16日 , 論文: 2026 , AI Safety

    深讀 Plan Injection:當 adversarial plan 被種進 context、actor 再把它改寫成看似自然的 Chain-of-Thought 時,monitor 看到的 clean trace 為何可能與真正的行為因果脫鉤,以及 APPS、BioMath 與 budget sweep 的證據邊界。

    90 秒掌握這篇論文
    問題
    CoT monitor 通常讀 actor 的 reasoning,判斷它是否在執行 harmful plan。若 harmful plan 先被放進 actor 的 context,actor 可能吸收它、改寫成一段看似自然的 reasoning,最後輸出有問題的 code 或答案;monitor 只看到後來的 trace,就可能看不到真正改變行為的來源。
    核心洞見
    plan injection 把「行為的因果來源」與「monitor 可見的文字 trace」拆開。攻擊者不必要求 actor 原文照抄,也不必讓 CoT 出現明顯 malicious intent;只要 injected plan 能 steer actor,而 actor 產生的 reasoning 不明確歸因於該 plan,monitor 的觀測面就可能失真。
    最強證據
    Figure 3 在 APPS 與 Bio-Math 顯示 injected plan 被採用的比例;Figures 4–5 將 actor-only 與 with-plan 的 monitor detection 並列;Table 8 的 end-to-end undetected attack success 在 APPS 為 33%–68%、Bio-Math 為 74%–82%;Figure 6 在 Qwen3-235B monitor 上顯示增加 budget 對 suspicion 不是單調改善。
    主要邊界
    這不是「所有 reasoning model 都能被同樣攻擊」的估計,也不是 CoT 本身必然不可信的形式證明。作者只測 Qwen3-8B、DeepSeek-R1-0528 兩個 actor、APPS/BioMath 兩種 scaling task,且只對一個 monitor 做 budget sweep;沒有 code、checkpoint 或完整可重跑的資料包。
    進入完整精讀
  • K-Bench:Agent 部署中的 LLM 遺忘,不能只看最後答案

    進階
    Agent 安全與遺忘評測: Part 1 , 筆記: 2026年9月15日 , 論文: 2026 , AI Security

    精讀 Yu 等人的 K-Bench(arXiv:2609.12808 v1):把 unlearning 從單一回答的證書改成跨六個可觀測通道、四種記憶 substrate 的 Agent 執行面測試,並用 OR-of-channels、collapse-aware K-Score 與預註冊統計拆開真正忘記、通道遷移與 Agent 崩潰。

    90 秒掌握這篇論文
    問題
    TOFU、MUSE 一類 unlearning benchmark 主要把 model 當成問答介面,讀一個 direct answer。這對只存在 weights、且只從該回答表面洩漏的測試有用,卻沒有覆蓋部署後的 context、RAG、database lookup、CoT scratchpad、tool call、tool return 或後續 summary。
    核心洞見
    把「秘密放在哪裡」與「Agent 從哪裡取到它」分開控制。K-Bench 每個 cell 只把同一類 PII 放進一個 substrate,再把同一個 Agent trace 暴露成六個 channel;每一 query 對六個 channel 做 logical OR。
    最強證據
    在 Llama-3.1-8B 的 no-intervention baseline,非參數 substrate 的 aggregate leakage 是 C = 0.223、R-text = 0.602、R-struct = 0.855;TOFU/MUSE 的 weight probes 在這些 substrate 看到的卻是沒有 target memorization。這是 coverage gap,不是 weight unlearning 不夠強。
    主要邊界
    K-Bench 的結果只覆蓋它能觀測的六個文字 channel、四個純 substrate、英文 PII、固定 ReAct harness 與特定模型/注入方式。它不是「所有副本都刪除」的證明,也不是 production memory、log、external database 或 multi-agent message bus 的完整 deletion audit。
    進入完整精讀
  • REVA:把 RAG 壓縮搬到可重用的 evidence view,而不是每次請求重新付費

    進階
    檢索系統:從證據到 Production RAG: Part 1 , 筆記: 2026年9月15日 , 論文: 2026 , NLP

    精讀 Nguyen 等人的 REVA(arXiv 2609.11209 v1):用 generator attention 的歷史軌跡建立 document-keyed score store,在離線評分與線上渲染之間切開 RAG 壓縮成本,並檢查 unseen-document fallback、local/global budget、品質與延遲邊界。

    90 秒掌握這篇論文
    問題
    post-retrieval compressor 如果在每個 request 上另外呼叫 model、做 token scoring 或生成式 rewriting,縮短 context 的收益可能被 compression latency 抵消;model-agnostic 的 selector 也可能保留模型本來就知道的內容,反而刪掉真正需要的 evidence。
    核心直覺
    歷史 RAG request 已經留下 generator 如何使用文件的訊號。把 query 與可用的 answer/response 對文件 token 的 attention 映射到可讀的 word units,再跨重複 document access 平均,就能得到一份可重用的 evidence prior。它不是 query-specific answer,而是文件層級的 retention tendency。
    最強證據
    在固定 top-10 retrieval cache、四個 QA benchmark 與三個 generator 上,B=512 full-split Table I 的 REVA-local 在 NQ、TriviaQA、HotpotQA、2Wiki 都比 Trunc-local 高;Table II 的 12 個 generator–dataset 設定平均為 37.83 F1、26.98 EM、27.5 ms online overhead。all-seen Table III 的 120 個 budget cells 則讓 REVA-global 達 43.72 F1、32.75 EM、49 ms。
    主要邊界
    all-seen 只保留所有 top-K 文件都有分數的 held-out query,不能代表正式環境 coverage;full-split 才含 prefix fallback。attention 也只是 evidence importance proxy,不是 citation correctness 的驗證器;報告的 online overhead 排除 score-store 建置與更新。
    進入完整精讀
  • VikingRAG:讓結構化文件的 Agentic RAG 少走幾輪、少吃幾千 token

    進階
    Production RAG 的結構化檢索: Part 1 , 筆記: 2026年9月15日 , 論文: 2026 , Information Retrieval

    深讀 VikingRAG:把文件階層保留在 URI 可定位的外部 storage,以 Search、List、Grep、Read 支援 evidence-gap retrieval,再用 experience edges 與 adaptive escalation 降低重複探索的 token 與延遲。

    90 秒掌握這篇論文
    問題
    企業手冊、課程 syllabus、論文、合約與財報不是一袋互不相干的 chunks。答案常需要先定位哪一份文件,再沿著 chapter、section 或 subsection 找到分散的事實。若把所有 directory 都序列化進 prompt,結構線索會很貴;若只做一次 flat top-k,又可能在第一輪就漏掉跨 section 的依賴。
    核心洞見
    把 hierarchy 從 prompt 移到可查詢的外部 semantic storage。每個 directory node、chunk 與多層 abstract 都有 URI,且 URI prefix 保留 ancestor–descendant 關係;向量結果因此不只是文字片段,也是一個可以繼續 List、Grep、Read 的 navigation handle(論文 Section 2.2、3.1)。
    最強證據
    六個結構化文件資料集、八個 baseline、固定的 K=10、L=1,000、B=15 設定下,作者以 end-to-end accuracy、latency、LLM token、ingestion 與 deletion 評估。Figure 3/Table 3 報告 VikingRAG 的 token ratio 為 11.6%–51.9%,VikingRAG-E+ 為 5.1%–32.5%;Figure 7 也在 VersionQA 上換用 GPT-5.5、Seed-2.0 與 GLM-4.7 做 robustness check。
    主要邊界
    accuracy 是 LLM-as-a-judge 加 expert verification 的 semantic consistency proxy,不是 retrieval recall 或獨立人工重做的 correctness proof。Experience edges 用同一文件語料產生的 1,000 個 synthetic historical questions warm up;evidence checker 的 false-no-escalation 在 QASPER 仍為 14.4%,FinanceBench 為 6.7%(Table 7)。
    進入完整精讀
  • DRACO:用 dynamic rubrics 把長程 Agent 的總分分回每一步

    進階 Agent Runtime、安全與評測
    Agent 訓練與獎勵: Part 1 , 筆記: 2026年9月9日 , 論文: 2026 , AI Engineering

    精讀 DRACO(arXiv:2609.04094):在沒有 ground-truth verifier 的長程工具任務中,動態產生每條 rollout 的 rubric,再把 trajectory-level advantage 依 judge 指出的步驟重新分配給 GRPO。

    90 秒掌握這篇論文
    問題
    沒有 verifier 時,如何取得可用的 reward;取得後,又如何避免把整條長 trajectory 當成不可分割的單一動作?
    核心洞見
    為每個 task 與 sampled group 動態生成、合併、去重並篩選 rubric;judge 不只回傳 pass/fail,也要指出哪些 steps 支持這個 verdict,讓一個 trajectory-level advantage 可以 closed-form 地分回 steps。
    最強證據
    Qwen3.6-27B 的 AppWorld test-normal TGC/SGC 從 base 的 69.4/41.1 到 DRACO 的 85.3/70.6;在相同 base 與 budget 的 outcome-reward reference 上,DRACO 高 5.3/11.3 個百分點(Table 2、Section 4.2)。零樣本 tau-bench Banking SR 也由 15.8 到 20.4。
    主要邊界
    這些是 benchmark 與 end-task evidence,不是 judge 正確性或 attribution 正確性的直接證明。作者明確承認沒有 human-rater calibration;同一個 judge 可能一致地錯,錯誤的 citation 也可能仍偶然帶來更好的 policy。
    進入完整精讀
  • CONTINUITY:讓 Agent 的 provenance、授權與 tool effect 穿過組合邊界

    進階 Agent Runtime、安全與評測
    Agent Runtime、安全與效應邊界: Part 1 , 筆記: 2026年9月9日 , 論文: 2026 , AI Security

    精讀 Zheng 與 Yang 的 CONTINUITY(arXiv:2609.05269 v1):用 security-context contract、field-level provenance、transformation witness 與 effect-bound permit,檢查 LLM Agent 從 instruction 到 external effect 的端到端連續性。

    90 秒掌握這篇論文
    問題
    一個 Agent 的安全路徑通常不只一個控制點。ingress 追 provenance、gateway 做 policy、adapter 改 protocol 表示法、tool server 產生 effect、final sink 再檢查 permit。每個點單獨看似合理,但 security-critical context 可能在邊界被截斷、放大、重新綁定,或以 stale/replayed credential 通過。
    核心洞見
    把每個 component 寫成 assume–guarantee contract,並讓每次 transition 都攜帶可驗證的 root、field provenance、release、role-bound receipt、transformation witness 與 current finality permit。安全性不是「最後一個簽章有效」,而是 effect 能否回溯到一條完整、授權、未過期且只使用一次的 witness chain(Section 1、5、6)。
    最強證據
    在作者的 deterministic conformance suite 中,4 個 domain、32 類 fault、每個 fault–domain 20 個 parameterized instances 形成 2,560 attack instances、128 fault–domain classes;完整 CONTINUITY 0/2,560 harmful effect、128/128 classes contained、700/700 benign completion、200/200 ambiguous escalation(Table 2、Figure 3)。
    主要邊界
    這些是由固定 fault schema 產生的 exact conformance counts,不是自然攻擊分布或 production attack rate。root、validator、context capture、finality sink 和 provider 的正確性被放在 TCB 或 deployment assumption 中;artifact 也沒有 production MCP、A2A、OWASP ACS、cloud IAM 整合(Section 3、8.1、12)。
    進入完整精讀
  • Parsing the Stream:長程 Agent 不只需要記憶,還需要一個可審計的 live state

    進階 Agent Runtime、安全與評測
    Agent Trace 可觀測性: Part 1 , 筆記: 2026年9月7日 , 論文: 2026 , AI Engineering

    精讀 Pakhomov 與 Nijkamp 的 Parsing the Stream(arXiv:2609.01466):把 append-only trace fold 成 typed RunState,再編譯成 observer 與 worker 兩種 view;它在特定累積任務中改善長程表現與監控成本,但不證明固定 aggregate 能取代所有 trace memory。

    90 秒掌握這篇論文
    問題
    長程 Agent 的 trace 會同時超過兩個消費者的能力。人類 observer 需要在執行中知道「現在做什麼、哪些事情已經確定、還缺什麼」;Agent worker 則必須把同一條不斷變長的 trace 放回有限的 context。只保留尾端會丟掉早期事實,直接把整條歷史塞回每一回合又會讓 token、成本與錯誤一起增長。
    核心洞見
    不要為 worker 與 observer 各自做一個彼此不一致的摘要器,而是把 trace 先寫成 append-only typed ledger,折疊成帶有來源與 coverage 的 RunState,再從這個 state 編譯出不同消費者需要的 view。
    最強證據
    在 12 份真實 transcript、每個 condition 70 個監控問題的 COMPREHEND 評估中,compiled view 的 Sonnet 5 accuracy 為 0.871、Haiku 4.5 為 0.850;raw tail 分別只有 0.479 與 0.476。CONTINUE 的 120-link clean protocol 則是 curated fold 30/30、scratchpad 30/30、full context 8/30(Table 1–2、Figure 2–3)。
    主要邊界
    這些結果是 schema coverage 與任務形狀的條件式證據。作者自己在 alternating-sign chain 上展示 fold 會失去優勢,也承認 benchmark–system co-evolution、單一 vendor、固定 schema、單 session,以及 prompt injection、secret redaction、多 Agent ledger 尚未被測試。
    進入完整精讀
  • Generative Agents:用觀察–反思–計畫模擬多人行為,但不能把沙盒記憶當成 MemGPT 的 OS 分頁

    中階 Agent Runtime、安全與評測
    Generative Agents 深度精讀: Part 1 , 筆記: 2026年8月28日 , 論文: 2023 , AI Engineering

    精讀 Park et al. UIST 2023/arXiv:2304.03442 v2:25 個 agent 在 Smallville 以 memory stream、週期反思與檢索式規劃互動。訪談消融 TrueSkill μ 29.89 對完全消融 21.21;兩天沙盒中資訊擴散與派對協調是定性證據,不是生產 runtime。

    90 秒掌握這篇論文
    問題
    LLM 能在單一時間點產生像人的行為,但長期連貫的 believable agent 需要隨互動增長的記憶、跨 agent 的社會動態,以及把過去經驗用來規劃下一步——只靠更長 prompt 或單次生成不夠。
    核心洞見
    把每個 agent 的完整經驗以自然語言寫進 memory stream,用 reflection 週期合成高階推論,再用 relevance/recency/importance 檢索相關記憶來 plan 與 react;25 個 agent 在 Smallville 沙盒中互動,記憶控制平面是「社交模擬的觀察–反思–計畫」,不是 MemGPT 對單一 agent 的 OS 式 context 分頁。
    最強證據
    訪談消融(Figure 8)上完整架構 TrueSkill μ 29.89(σ=0.72),優於無反思(26.88)、無反思+規劃(25.64)、眾包基線(22.95)、完全消融(21.21)。兩天開放模擬(Section 7.1):市長資訊持有者 4%→32%、派對資訊 4%→52%;關係網路密度 0.167→0.74;派對 12 人受邀、5 人到場。
    主要邊界
    沙盒+ChatGPT,模擬兩天遊戲時間成本「數千美元 token、多天運行」(Section 8.2);常見失效是檢索不到相關記憶、捏造 embellishment、instruction tuning 帶來過度正式語氣。不是生產 ACL 記憶、不是 Reflexion 的跨 trial 語言 credit assignment,也不是後來 Letta/xMemory 產品或 benchmark 數字。
    進入完整精讀
  • ReAct:交錯思考與行動,但不能把 few-shot 迴圈當成 Agent runtime

    中階 Agent Runtime、安全與評測
    ReAct 深度精讀: Part 1 , 筆記: 2026年8月27日 , 論文: 2023 , NLP

    精讀 Yao et al. ICLR 2023:把 language thought 加進 action space,在 HotpotQA、FEVER、ALFWorld 與 WebShop 上分開讀 hallucination、搜尋失敗與 abstract 的 +34%/+10%。

    90 秒掌握這篇論文
    問題
    LLM 的推理(Chain-of-Thought)與行動(WebGPT、SayCan)被當成兩條分開的線。CoT 不接觸環境;Act-only 能查外部,卻沒有高層計畫與例外處理。
    核心洞見
    把語言 thought 加進 action space。thought 不改環境、不產生環境 observation,只更新 context;再與環境動作交錯。決策點從「只想」或「只做」改成「同一條軌跡裡決定下一步是對自己說話,還是碰外部世界」。
    最強證據
    ALFWorld best-of-6 ReAct 71% vs Act 45%、BUTLER best-of-8 37%;WebShop SR 40.0 vs IL+RL 28.7。HotpotQA 人工分析中,CoT 失敗案例有 56% 是幻覺,ReAct 為 0%(Table 2)。
    主要邊界
    HotpotQA PaLM-540B 的純 ReAct EM 27.4,低於 CoT 29.4。35.1/64.6 是 ReAct↔CoT-SC 切換。few-shot prompt,Wikipedia API 只有 search/lookup/finish。這不是可部署 runtime。
    進入完整精讀
  • Toolformer:自監督學會呼叫 API,但不能把 next-token 工具使用當成 Agent loop

    中階 Agent Runtime、安全與評測
    Toolformer 深度精讀: Part 1 , 筆記: 2026年8月27日 , 論文: 2023 , NLP

    精讀 Schick et al. NeurIPS 2023:用未來 token 損失當過濾器,讓 GPT-J 在 CCNet 上自監督學會呼叫 QA、Wikipedia、計算機、日曆與翻譯;LAMA 與數學明顯拉開,但這不是可串接的 Agent runtime。

    90 秒掌握這篇論文
    問題
    語言模型在算術、事實查找、低資源語言與時間意識上明顯弱於更小的專用系統;當時的工具使用要嘛靠大量人工標註,要嘛綁在「已經知道該用哪個工具」的 task-specific few-shot。
    核心洞見
    把 API 呼叫插進 next-token 預測。少量人類示範只負責教格式;要不要留下這次呼叫,由「加上呼叫與結果後,未來 token 損失有沒有下降」決定。改動的控制點不是 thought–action 迴圈,而是何時把一次 API 呼叫寫進語言模型的訓練字串。
    最強證據
    同一套 GPT-J 6.7B、zero-shot。LAMA 的 SQuAD/Google-RE/T-REx 從 17.8/4.9/31.9 升到 33.8/11.5/53.5,並超過 OPT-66B 與 GPT-3-175B;數學 ASDiv/SVAMP/MAWPS 從 7.5/5.2/9.9 升到 40.4/29.4/44.0。QA 與計算機幾乎總是被選中(約 98.1%/97.9%)。
    主要邊界
    關掉 QA 工具後,Wikipedia 搜尋仍追不上 GPT-3。作者限制是不能串工具、不能互動翻搜尋結果、用詞敏感、評測最多一次 API 呼叫、計算機樣本極少、不計工具成本。這不是 production agent runtime。
    進入完整精讀
  • SWE-bench:用真實 GitHub issue 評測,但不能把 1.96% 讀成模型能力的終點

    中階 Agent Runtime、安全與評測
    SWE-bench 深度精讀: Part 1 , 筆記: 2026年8月27日 , 論文: 2024 , AI Engineering

    精讀 Jimenez et al. ICLR 2024 Oral:把評測單位改成真實 GitHub issue、完整 Python 倉庫與測試。Claude 2 在 BM25 下只解 1.96%;這個分數是協議,不是模型排行榜。

    90 秒掌握這篇論文
    問題
    HumanEval 這類 coding benchmark 把成功壓成「寫一個自包含函式」。真實軟體工程是:讀一份 GitHub issue、在數千檔的倉庫裡改程式,再用測試判定有沒有修好。既有分數測不到這件事。
    核心洞見
    把評測單位改成「真實 issue + 完整 Python 倉庫 + 測試」。模型產出 patch;unix patch 套用後,fail-to-pass 與 pass-to-pass 測試必須全部通過才算 resolve。改動的控制點不是新的 agent 架構,而是什麼算成功。
    最強證據
    BM25 檢索、13k context 下,Claude 2 resolve 1.96%(abstract、Section 1、Table 2)。同一協議的 Table 5 列 Claude 2 為 1.97%,並另外列入 Claude 3 Opus 3.79%。Oracle 檢索時 Claude 2 升到 4.80%(Table 18)。SWE-Llama 在 BM25 只有 0.70%,仍多半只解最簡單的題。
    主要邊界
    Python、issue-fix、binary 測試。Resolve 不測可維護性、未覆蓋行為或 review。BM25 與 oracle 是不同檢索條件。後續 SWE-bench Verified、SWE-agent 與 ProMax 採用不同設定,其分數不屬於本文表格。
    進入完整精讀
  • CoT:讓模型把推理寫出來,但不要當成會動的 Agent

    中階 Agent Runtime、安全與評測
    CoT 深度精讀: Part 1 , 筆記: 2026年8月27日 , 論文: 2022 , NLP

    精讀 Wei et al. NeurIPS 2022:few-shot 示範中間推理步驟,能在夠大的凍結模型上引出多步推理。GSM8K 上 PaLM 540B 從 17.9 到 56.9;這仍是 prompt,不是工具、環境或記憶分頁。

    90 秒掌握這篇論文
    問題
    標準 few-shot prompting 只給 $\langle$題目, 答案$\rangle$,多步算術、常識與符號推理表現差;只把模型放大也填不平這條曲線。
    核心洞見
    把 exemplar 改成 $\langle$題目, 中間推理, 答案$\rangle$。決策點從「直接答」改成「先把推理寫出來再答」。模型權重凍結;這仍是 prompt,不是 agent。
    最強證據
    PaLM 540B 在 GSM8K 上 17.9 → 56.9,對當時 Cobbe et al. finetuned GPT-3 + verifier 的 55(Table 1、Figure 2)。Figure 4/Table 2 顯示增益大約在 100B 才出現。
    主要邊界
    沒有環境、沒有工具、沒有記憶分頁。小模型常更差;鏈可以不通、也可以碰巧答對。Self-consistency(Wang et al., 2022a)是後來的論文,本文主結果用 greedy decoding。
    進入完整精讀
  • WebGPT:讓模型用瀏覽器找答案,但不要當成會推理的 Agent 迴圈

    中階 Agent Runtime、安全與評測
    WebGPT 深度精讀: Part 1 , 筆記: 2026年8月27日 , 論文: 2021 , NLP

    精讀 Nakano et al. arXiv:2112.09332 v3:給 GPT-3 一個文字瀏覽器,用人類示範與偏好/reward model 訓練它搜尋、引用再回答。175B best-of-64 對示範者 56%、對 Reddit 69%;這是瀏覽式 QA,不是 ReAct 的 thought–action–observation。

    90 秒掌握這篇論文
    問題
    長文問答落後人類;檢索與綜合被拆開做。沒有引用時,人類很難核對段落級事實。
    核心洞見
    把搜尋引擎外包給 Bing,把綜合交給微調後的 GPT-3,中間接一個文字瀏覽器。模型只能發 Table 1 的指令(search、click、quote、scroll、end),瀏覽中收集引用,再寫答案。訓練是人類示範的行為複製,加上人類偏好的 reward model,再用 rejection sampling 選答案。
    最強證據
    175B best-of-64 對示範者整體偏好 56%,對 ELI5 最高票答案 69%(Section 4.1、Figure 2)。best-of-64 對純 BC 偏好 68%;RL 對 BC 58%,但與 rejection sampling 疊加幾乎沒有好處(Section 5.1、Figure 4、Figure 5)。
    主要邊界
    沒有獨立 thought 動作。文字瀏覽器是受限 action space,不是通用工具迴圈。答案仍可能改寫錯或挑對 labeler 有說服力的引用。這是 2021 的 OpenAI 技術報告/arXiv preprint,不是後來的產品瀏覽功能。
    進入完整精讀
  • Gorilla:把大規模 API 目錄變成可檢索的工具,但 APIBench 不代表 MCP 產品能力

    中階 Agent Runtime、安全與評測
    Gorilla 深度精讀: Part 1 , 筆記: 2026年8月27日 , 論文: 2024 , NLP

    精讀 Patil et al. NeurIPS 2024:在 APIBench(TorchHub/TensorHub/HuggingFace)上以 retriever-aware 微調 LLaMA-7B,讓目錄級 API 呼叫可檢索、可核對;zero-shot 整體準確率與幻覺率勝過當下的 GPT-4 提示,但這不是 ReAct 迴圈、不是 MidTool mid-training,也不是 RAG-MCP 產品路由。

    90 秒掌握這篇論文
    問題
    LLM 寫 API 呼叫時容易幻覺名稱、參數與用法;真實世界不是五個固定工具,而是會頻繁更新的巨大 API 目錄。
    核心洞見
    把工具使用做成 檢索+呼叫:用 self-instruct 在 APIBench 上生成指令—API 對,再以 retriever-aware 方式微調 LLaMA-7B(RAT),讓模型學會讀取「Use this API documentation for reference: …」後面的文件並發出正確呼叫。
    最強證據
    NeurIPS Table 1。Gorilla zero-shot 在 TorchHub/HuggingFace/TensorFlow Hub 的 overall 為 59.13%/71.68%/83.79%,hallu 為 6.98%/10.95%/5.40%;同表 GPT-4 zero-shot 為 38.70%/19.80%/18.20% overall,hallu 36.55%/37.16%/78.65%。Figure 6 顯示測時改文件時,RAT 模型會跟著改呼叫。
    主要邊界
    語料是 ML hub 的 model-card/API JSON,不是任意 REST 產品目錄;評測是單次 AST 子樹匹配,不是多步 agent loop;差的檢索器會拖垮表現(Table 2)。不要把 APIBench 數字寫進 MidTool 或 RAG-MCP。
    進入完整精讀
  • SWE-Bench ProMax:大型多語言重構,真的能測出 coding agent 的長程協作嗎?

    進階 Agent Runtime、安全與評測
    筆記: 2026年8月13日 , 論文: 2026 , AI Engineering

    深讀 SWE-Bench ProMax:以 170 個跨檔案、多語言、行為保持的程式重構任務,檢驗 coding agent 是否能完成大型變更,而不只修好一個測試。

    90 秒掌握這篇論文
    問題
    既有 coding-agent benchmark 多半以 Python、單一 issue 或 bug fix 為中心;agent 可能修好可見測試,卻漏掉跨檔案的呼叫點、設定、文件與測試。這無法回答「它能否完成大型、行為保持的重構」這個更接近真實維護工作的問題。
    核心設計
    從 GitHub 的 refactoring commits 挖掘候選,經 Docker 環境驗證、專家與 LLM 輔助標註、人工複核,最後保留 170 個任務,涵蓋 Python、Java、TypeScript、Go、C、C++、Rust 七種語言。
    最強結果
    在論文固定的 mini-SWE-agent 與 OpenHands scaffold、每題最多 300 steps/$10 的設定下,OpenHands + GPT-5.2 的 resolve rate 為 41.2%,但同一模型在 mini-SWE-agent 只有 21.8%。這首先是 scaffold 與 agent loop 的結果,不是單純的模型排行榜。
    主要邊界
    resolve 是「所有測試通過」的 binary outcome,不評估 patch 的可維護性、未被測試的行為、review 品質或 action trace。TypeScript 任務集中在兩個 repository、其中 Angular 有 25 題;跨語言比較不能當作獨立且均衡的語言難度實驗。
    進入完整精讀
  • Agentic Configuration Management:把 Agent 系統當成可治理的組態,而不只是一次執行

    進階 Agent Runtime、安全與評測
    Agent 安全: Part 2 , 筆記: 2026年8月12日 , 論文: 2026 , AI Agent

    深讀 ACM 如何用跨框架的 Configuration Graph、immutable revisions、dependency-aware impact propagation 與 runtime provenance,治理 LangGraph、CrewAI 與 OpenAI Agents SDK 的異質 Agent 組態。

    90 秒掌握這篇論文
    問題
    一個 agent system 的行為不只由程式碼決定,還取決於 prompt、model、tool、skill、workflow、policy、framework 與 runtime state;現有 framework 和 AgentOps 工具各自管理一部分,卻很難把「哪個完整組態產生了這次執行」固定下來。
    核心洞見
    ACM 把這些異質 artifact 正規化成 typed、independently versioned 的 Agentic Configuration Items(ACI),由四張互連的 Configuration、Evolution、Assurance、Runtime Graph 管理;執行 framework 只負責投影,治理 kernel 在共同表示上工作。
    最強證據
    27 個 controlled governance scenarios 跨 LangGraph、CrewAI 與 OpenAI Agents SDK,另有 9 個 quantitative impact cases;三個 framework 在受控範圍得到相同 governance outcomes,重複執行的 impact set 與 metrics 也一致(Section 7.2–7.6、Tables 8、10、12)。
    主要邊界
    這是 reference model 與 prototype 的 conformance/feasibility evidence;distributed execution、learning、long-term memory、MCP/A2A native protocol 與 large-scale industrial validation 都在目前範圍外(Table 13、Table 14、Sections 8.4、9)。
    進入完整精讀
  • ADIAS:把 Agent 自我改良改寫成可追蹤的問題修復

    進階 Agent Runtime、安全與評測
    筆記: 2026年8月12日 , 論文: 2026 , AI Engineering

    深讀 ADIAS:以持續的 issue state 組織跨回合失敗證據,讓 full-code agent optimization 能記住修過什麼、哪些介入失效,以及何時真的修好。

    90 秒掌握這篇論文
    問題
    自動化 agent design 通常以 candidate 為中心保存歷史。每一回合都重新閱讀候選程式、分數與 trajectory,卻沒有明確記住「同一個失敗是否已經修過、哪個介入有效、哪個改動造成 regression」。
    核心直覺
    把被修復的 issue,而不是 candidate agent,變成跨回合的控制狀態。每個 issue 擁有穩定身份、priority、supporting evidence、lifecycle status 與 intervention-outcome history。
    最強證據
    論文在 Tau-Bench、ALFWorld、TextCraft、WebShop、ScienceWorld 五個互動式環境比較 ADIAS 與五種 baseline;Table 1 的平均分數為 78.4,最強 baseline DGM-H 為 62.6。這些方法共用 task split、wrapper、action interface、scoring script、十回合 optimization budget 與每回合 15 個 training episodes(論文 Section 4、Table 1)。
    主要邊界
    論文把 trajectory diagnosis 與 issue association 固定下來,沒有獨立測量診斷正確率;評估也限於文字型互動 benchmark。GitHub repository 的 README 仍是 Coming Soon,因此本文不把「paper 說有 code」等同於「讀者現在可重現」。
    進入完整精讀
  • DocMemo:讓長文件 RAG 在找錯證據後仍能回頭

    進階 理解檢索、記憶與 Production RAG
    筆記: 2026年8月12日 , 論文: 2026 , AI Engineering

    深讀 DocMemo:用 document schema、page belief 與 question episodic memory 保存跨回合 retrieval state,再以 Bayesian update、Thompson sampling 與 adaptive granularity 找回遺漏證據。

    90 秒掌握這篇論文
    問題
    長文件的答案可能分散在數十頁、表格、圖與跨頁線索中。static retrieval 一開始就固定 top-k pages;若第一輪漏掉 evidence,後續 reasoner 沒有狀態可以解釋「哪一頁可能有用、哪些頁面已被排除、還缺什麼」。
    核心直覺
    把 retrieval 做成 dynamic evidence exploration。Document Schema Memory 保存文件結構,Page Belief Memory 更新頁面相關性信念,Question Episodic Memory 記住當前問題的發現與 query refinement。
    最強證據
    在 MMLongBench-Doc、LongDocURL、PaperTab 三個 long-document DocVQA benchmark 上,DocMemo 的 accuracy 為 71.3、81.1、80.4,平均 77.6;Table 4 的 ablation 也顯示移除 memory 或 Bayesian update 會使 MMLongBench-Doc accuracy 從 71.3 降到 68.5 或 68.8。
    主要邊界
    評估依賴 GPT-4.1 binary judge、PDF rendering、Qwen3.5-VL-9B、ColQwen2.5、MinerU 與三個 benchmark 的 annotation;它沒有證明任意企業 corpus 的 citation faithfulness、access-control correctness、freshness 或總成本。
    進入完整精讀
  • A²E:把 Agent 評測變成可追蹤、可重評的稽核引擎

    中階 Agent Runtime、安全與評測
    Agent Auditing: Part 1 , 筆記: 2026年8月11日 , 論文: 2026 , AI Engineering

    精讀 A²E:以 ATP 統一 benchmark 與 agent harness,用 span-based trace 保存執行因果,再以 lifecycle-aligned metrics 分析正確性、工具行為、成本與安全。

    90 秒掌握這篇論文
    問題
    Agent 最後答對,不代表它走了可靠、便宜或安全的路徑;最後答錯,也不代表你知道問題出在 planning、tool use、memory、judge 或 runtime。若每個 harness 自己存一份文字 log,就很難跨 framework 比較,也很難在新 metric 出現時重評既有 trajectory。
    核心想法
    A²E 將 Task、Monitor、Evaluation 分成三層。Agent Task Protocol(ATP)把 benchmark 的 task 與 harness 的執行介面分開;Monitor 將 model calls、tool calls、state 與錯誤組成有 parent-child 關係的 trace;Evaluation 用 lifecycle-aligned taxonomy 把 process、outcome 與 runtime 指標放在一起。
    最重要證據
    實驗涵蓋 23 個 benchmark、9 個 harness、每個 cell 5 個 task,共 1,035 次 scored runs;同一個 DeepSeek-V4-pro FP4 backbone、inference config、tool setup、step limit 與 timeout 被固定。Section 6.2/6.3 報告 harness 間的 success-rate gap 可達 GDPVal 0.20、MMLU-Pro 0.30、tau³-bench 0.66。
    主要邊界
    這是平台架構與診斷框架的 demonstration,不是對九個 harness 的普遍排名。Table 2 的 prose 與顯示的 tasksucceeded/correctness 數值互相矛盾;paper commit、judge calibration、API 變動與 component-level ablation 也不足以支持強因果結論。
    進入完整精讀
  • ContextWeave 論文精讀:記憶真的讓 Agent 更會做事嗎?

    進階 Agent Runtime、安全與評測
    Agent 評測: Part 2 , 筆記: 2026年8月7日 , 論文: 2026 , AI Agent

    拆解 ContextWeave 如何把多月工作流重建成可執行 benchmark,並檢驗記憶對工作區結果、偏好一致性、連續性與誤導風險的真實影響。

    90 秒掌握這篇論文
    問題
    記憶 benchmark 常把「找得到歷史」當成成功,卻沒有測試它是否讓下一個可執行工作真的做得更好。
    核心想法
    把多月工作流重建成固定、可執行的任務串,對同一 target task 只切換是否提供過去軌跡;用結果品質與偏好遵循,而非 retrieval hit,量出記憶造成的差值。
    最強證據
    在 14 位參與者、1,005 個重建任務(568 個核心評測任務)的設定中,作者報告最強 memory component 將 Workspace Score 由 68.08 提升至 78.20、Preference Score 由 41.50 提升至 70.60(Section 5.2、Table 2)。
    邊界
    重建的 Docker/模擬 API 與 LLM 型評分器使結果可比較,卻不能直接代表真實企業資料、真實工具漂移或所有 memory 實作的 production uplift。
    進入完整精讀
  • Argus 論文精讀:長期 Agent 需要的是 Runtime,不是更長的 Prompt

    進階 Agent Runtime、安全與評測
    Multi-Agent Coordination: Part 1 , 筆記: 2026年8月7日 , 論文: 2026 , AI Agent

    拆解 Argus 的 Manager–Planner–Engineer–Reviewer runtime、持久狀態、驗證式演化與 rollback,並區分 benchmark 結果、作者自營案例與尚未證明的自我學習主張。

    90 秒掌握這篇論文
    問題
    長時程 agent 失敗時,單一長 prompt 沒有清楚的任務 authority、可稽核狀態、驗證關卡或可回復邊界。
    核心想法
    Argus 以 Manager、Planner、Engineer、Reviewer 在 durable project state 上循環;只有經 role-owned review 的 memory、skill、routing 與 procedure 才能成為下一輪狀態。
    最強證據
    報告在七個 task-native arena 中展示廣度,並在 SWE-Bench Pro 報告 GPT-5.5 條件下 Argus 78% 對 Direct Copilot 59%、約 1.41 倍 aggregate tokens(Figure 1、Section 5)。
    邊界
    這是 arXiv v1 technical report;實作、prompt、trace、checkpoint 與完整 benchmark package 尚未公開,不能把結果當成可重現的 runtime 採用證明。
    進入完整精讀
  • AgentS4D 論文精讀:任務完成了,Runtime 真的安全嗎?

    進階 Agent Runtime、安全與評測
    Agent 安全: Part 1 , 筆記: 2026年8月7日 , 論文: 2026 , AI Agent

    拆解 AgentS4D 如何把 workspace agent 的風險入口、誘導策略、目標傷害與生命週期證據放進同一個 sandbox benchmark,並檢查完成率為什麼不能代表安全。

    90 秒掌握這篇論文
    問題
    workspace agent 即使完成任務,仍可能因 prompt、skill、file、web content、memory 或 user message 的風險載體產生不安全副作用。
    核心想法
    AgentS4D 將評估單位設為完整的 harness–LLM–task 環境,依風險來源、induction strategy、harm 與 execution lifecycle 檢查 completion 與 safety。
    最強證據
    328 個注入風險案例在 20 組 harness/backend configuration 中得到 6,560 runs;4,461 runs (68.0%) 觸發預先定義的 unsafe signal,4,344 runs(66.22%)同時 unsafe 且 complete(Section 4、Table 2)。
    邊界
    案例、資產與效果是 synthetic/controlled,且 v1 沒有 executable code 或 data;這些比例不是 production incident rate,也不是任一 harness 的通用安全排序。
    進入完整精讀
  • Real-Time Detection and Repair of LLM Agent Failures:Agent 失敗的即時偵測與修復

    進階 Agent Runtime、安全與評測
    Agent 評測: Part 3 , 筆記: 2026年8月7日 , 論文: 2026 , AI Agent

    精讀 AgentTrajectorySentinel 如何用健康軌跡訓練的低成本時間監控器、決定性驗證與 rollback-and-retry,在不逐步呼叫 LLM judge 的情況下提早攔截失敗;同時拆開它的校準依賴、內容盲點、修復實驗與可重現性邊界。

    90 秒掌握這篇論文
    問題
    agent failure 往往在最後答案以前發生;每步用 LLM judge 又可能太慢、太貴。
    核心想法
    以 healthy trajectory 訓練 temporal monitor,配合 deterministic verification;異常時 rollback 到可信 checkpoint 並定向 retry。
    最強證據
    作者在 2,823 committed episodes、三個框架與多種模型上比較 monitor、verifier 與 repair policy,修復研究報告 success 由 52% 到 73%(Section 5、Table 4)。
    邊界
    healthy-only calibration、短軌跡、injected failures 與文字型 hallucination 的偵測弱點,限制新 production stack 的轉移。
    進入完整精讀
  • 推理之前就可能失敗:Agentic RAG 的證據前程序性失敗

    進階 理解檢索、記憶與 Production RAG
    Production RAG 控制: Part 1 , 筆記: 2026年8月7日 , 論文: 2026 , Retrieval Systems

    精讀 Before Reasoning Can Fail 如何把『搜尋後沒有讀證據就回答』拆成可觀測的軌跡失敗,並檢驗 Read-Gate 是否真的改善多跳問答。

    90 秒掌握這篇論文
    問題
    agentic RAG 可 search 到 snippets 卻在 read 前 final;這是 evidence-conditioned reasoning 開始前的程序失敗,不應與讀過 gold evidence 後仍答錯混為一談。
    核心想法
    以 saved tool traces、retrieved/read passages 和 final answer 定義 discipline 與 post-gold-read failure;Read-Gate 強制「search 後、final 前至少 read 一段」,不改模型、retriever 或 reasoning budget。
    最強證據
    12,000 個 paired trajectories 跨 HotpotQA、2WikiMultiHopQA、MuSiQue;zero-read subset forced reading 的 LLM-Acc 增加 14.9–19.9 points,完整 minimal-reasoning cells 增加 3.2–9.4(Table 1、Section 5.2)。
    邊界
    適用於可觀察 search/read/final action 的 multi-hop QA;read 不保證已讀對或推理正確,MuSiQue 缺完整 gold chunk annotation 也限制 post-gold-read 分析。
    進入完整精讀
  • PAST-Bench:Persistent Agent 真的從過去學會了什麼嗎?

    進階 Agent Runtime、安全與評測
    Agent 評測: Part 4 , 筆記: 2026年8月7日 , 論文: 2026 , AI Agent

    深讀 PAST-Bench 如何用 fresh-session task families、matched persistence controls 與 trace-level mechanism evidence,分辨 Agent 變好是因為保留經驗,還是只是分數變高。

    90 秒掌握這篇論文
    問題
    持久 agent 後續得分提高,可能來自模型、prompt、任務難度或殘留 context,而不是正確使用先前經驗。
    核心想法
    PAST-Bench 在 fresh-session task families 中,固定 prompt、grader、tool stack,只切換 persistence-on/off;同時量 task-score gap 與 write/read/artifact 的 mechanism evidence。
    最強證據
    26 個 scenario、204 個 episode、四種能力、七個模型與四個框架;Hermes+ 報告 overall gap 從 +0.13 到 +0.15、Mech 從 0.64 到 0.73(Table 2、Section 4.3)。
    邊界
    overall gap 差異小於 run-to-run variation,任務由提案團隊設計,matched ablation 是強控制而不是完整因果證明。
    進入完整精讀
  • RubricRanker 論文精讀:RAG 需要的不是最相關文件,而是對的文件集合

    進階 理解檢索、記憶與 Production RAG
    檢索系統: Part 3 , 筆記: 2026年8月7日 , 論文: 2026 , Retrieval Systems

    拆解 RubricRanker 如何用 query-specific search rubrics、SFT 與 GRPO 訓練文件 reranker,並檢查它在 deep research 與 RAG benchmark 上真正改善了什麼。

    90 秒掌握這篇論文
    問題
    傳統 reranker 逐份文件評 relevance,卻不保證 top-k 合起來完整、精簡、一致且權威。
    核心洞見
    把輸出目標從「文件排名」改成「共同支撐答案的 evidence set」,並用 query-specific rubrics 產生集合標籤與 reward。
    最強證據
    Table 1--3 顯示下游分數提升,且 ablation 指向 rubric labels 與 cold-start SFT,而不是 RL 單獨創造效果。
    主要邊界
    最終答案仍由 Agent 與 LLM judge 評分;較好的 evidence set 不等於引用、推理或事實都正確。
    進入完整精讀
  • OSReward 論文精讀:為什麼 Agent 的成功不能只交給另一個模型判斷?

    進階 Agent Runtime、安全與評測
    Agent 評測: Part 1 , 筆記: 2026年8月2日 , 論文: 2026 , AI Agent

    完整拆解 OSReward 的資料建構、27 個 VLM judges、Hard/Multi 子集、錯誤與成本分析、OS-Shepherd-100K 訓練,並延伸成可部署的混合驗證架構。

    90 秒掌握這篇論文
    核心洞見
    先用人工 gold benchmark 拆出 false-success 偏誤,再把可驗證狀態、model judge 與人工仲裁放進不同證據層。
    最強證據
    Table 1 與 Figure 5--7 顯示完整集接近 90% 的 judge 到 Hard set 只剩約 70%,錯誤集中在 failure recall 與跨平台失敗類型。
    主要邊界
    OS-Shepherd 改善成本與部分準確率,但資料標籤仍來自 strong-judge agreement,完整 artifact 與 production verifier 都未齊備。
    Accuracy
    整體 verdict 正確率。
    進入完整精讀

歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。

演講與聯絡