Agent 評測
系列 · 4 篇
-
OSReward 論文精讀:電腦操作 Agent 的獎勵模型評估
進階 Agent Runtime、安全與評測完整拆解 OSReward 的資料建構、27 個 VLM judges、Hard/Multi 子集、錯誤與成本分析、OS-Shepherd-100K 訓練,並延伸成可部署的混合驗證架構。
90 秒掌握這篇論文
-
ContextWeave 論文精讀:長期 Agent 的工作流程與記憶評測
進階 Agent Runtime、安全與評測拆解 ContextWeave 如何把多月工作流重建成可執行 benchmark,並檢驗記憶對工作區結果、偏好一致性、連續性與誤導風險的真實影響。
90 秒掌握這篇論文
-
AgentTrajectorySentinel 論文精讀:LLM Agent 失敗的即時偵測與修復
進階 Agent Runtime、安全與評測精讀 AgentTrajectorySentinel 如何用健康軌跡訓練的低成本時間監控器、決定性驗證與 rollback-and-retry,在不逐步呼叫 LLM judge 的情況下提早攔截失敗;同時拆開它的校準依賴、內容盲點、修復實驗與可重現性邊界。
90 秒掌握這篇論文
-
PAST-Bench 論文精讀:個人 Agent 的遞迴自我改進評測
進階 Agent Runtime、安全與評測深讀 PAST-Bench 如何用 fresh-session task families、matched persistence controls 與 trace-level mechanism evidence,分辨 Agent 變好是因為保留經驗,還是只是分數變高。
90 秒掌握這篇論文
歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。
演講與聯絡