標籤: Evaluation
此標籤的文章
- Holo4:一個 Agent 跨 GUI、程式與工具,授權卻不相同
拆解 H Company Holo4 的跨介面 Agent 與長流程 harness,並核對 benchmark、公開軌跡資料和兩個 checkpoint 的授權差異。
- Target 零售商品搜尋:讓語意召回服從精確度與線上實驗
拆解 Target 如何以詞彙與向量雙路檢索、屬性精確度控制和加權交錯,改善商品搜尋,並檢視其離線與線上證據的邊界。
- AI Agent 風險如何變成 Runtime Policy:ASSERT 評估與 ACS 執行閘門
拆解 Microsoft run-assert-eval 如何串接 Clarity 風險探索、ASSERT 行為測試與 ACS runtime policy,並以 unsafe behavior 和 over-refusal 兩組指標檢視治理效果。
- Project Swap:Agent 會交易,不代表懂得委託人的偏好
Anthropic 的低風險員工書籍交換研究顯示,偏好估計比議價機制更限制市場結果;部署代理人之前,先測它是否理解這個人。
- AI Agent 不該只會聽話:XY 問題如何讓修錯走錯路
XYEval 顯示,當使用者把一個看似合理、其實偏離根因的建議加進任務,Agent 可能照做而降低成功率;工程解法是先驗證目標,再用證據解釋修正方向。
- AI Agent 漏洞回報要附上什麼證據?MobileCybench 用可執行 Probe 重播驗證
MobileCybench 將 Android Agent 找到的漏洞主張交給隔離環境重播,再用可信狀態上的安全性 Probe 判斷哪些性質確實遭到違反。
- RSIAgent:模型權重不變,Agent 真的能自我改進嗎?
拆解 RSIAgent 如何用 Curriculum、Actor、Verifier 與 broad-to-deep exploration 建立可重用的 frozen experience,並檢查其 benchmark 證據與重現限制。
- AI 開始做 AI 研究後,要量測什麼?Anthropic 的三個研發儀表板
拆解 Anthropic 用來觀察 AI-led R&D 的三組量測:AI 自動化程度、Agent oversight 與 safety compute,並把內部自報、方法邊界與跨實驗室不可比性放回工程決策。
- GitHub Agentic Workflows:把可執行的 Agent CI 寫成 Runtime 契約
從 gh-aw v0.89.17 與其官方變更紀錄拆解:日誌稽核、MCP Gateway/防火牆、grading、模型成本訊號與 incident loop 如何把 Agentic CI 從 demo 推向可營運的契約。
- Pydantic AI v2.45:把耐久 Agent 的可靠性寫進 Session 與 Trace 契約
拆解 Pydantic AI v2.45.0 如何對齊 durable run 的 DynamicToolset、MCP session、tool history 與 usage spans,並說明 TypeSafeModel 與 Bedrock effort 修正的採用邊界。
- Gemini Antigravity Agent 09-2026:一次 Agent Runtime 的 Protocol Migration
拆解 Antigravity Agent 09-2026 的 remote/local 相容性邊界、內建工具契約變更、adapter 設計與 contract tests,並整理 05-2026 在 2026-10-05 退場前的遷移風險。
- Amazon SageMaker HyperPod Inference Gateway:GPU-aware routing 的價值與邊界
拆解 Amazon SageMaker HyperPod Inference Gateway 如何用 KV cache、queue depth、LoRA 與 prefix cache 訊號做 Kubernetes-native 路由,並核對 EKS add-on、CRD、失敗行為與 AWS benchmark 的證據邊界。
- Claude 如何把生物分子模型跑得更快:從 FlashPairformer 到可回退的 Inference Kits
拆解 Anthropic 讓 Claude 優化 30 多個生物分子與基因組模型的工程方法,從 FlashPairformer、Big mode、stock/exact/fast 契約,到 GPU 成本與可驗證性邊界。
- TypeSafe AI 與 Jev:把 AI 變成可校準的決策元件
拆解 TypeSafe AI 的 System One 模型與 Jev,理解 typed decisions、機率信心、workflow evals,以及它和一般 LLM structured output 的差異。
- Jev 實戰架構:把 Confidence-Gated Routing 放進 Agent Runtime
不再重述 Jev 的基本介紹,改從 confidence-gated routing、speculative fan-out、composite scoring 與社群實驗,拆解如何把 AI 判斷放在 Agent、工具與人工審查之間。
- Gemini 3.8 Flash Coding Agent 工作流:以不確定性路由規劃與執行
以 Astra 規劃、Flash 執行為例,說明如何在 Coding Agent 工作流加入 SPEC 查核、升級條件與成本評估。
- Unified Knowledge Graph RAG:GraphRAG 與 LightRAG 是 Query Policy,不是全域開關
拆解 AWS 的 Unified Knowledge Graph RAG 參考架構:GraphRAG 與 LightRAG 如何共用入庫、圖譜、Hybrid Retrieval 與 lineage,再按問題選擇查詢策略,並解讀品質、成本與延遲取捨。
- Automated Alignment Researchers:Agentic Post-Training 為何需要 Integrity Gates
拆解 Anthropic 的 automated alignment researcher 實驗:Agent 可以搜尋、訓練與迭代 post-training 方法,但 benchmark、能力門檻、資料隔離與完整性審查必須由外部 gate 固定。
- LLM 推論成本怎麼算?從 DeepSeek-R1 實測到 GPU 租價
以 DeepSeek-R1 的 MLPerf 公開紀錄對照 8 張 B200/B300 的吞吐與延遲,再用有來源的 GPU 租價試算成本,分清實測、算術推導與 API 售價。
- AI Agent 論文怎麼讀:從 CoT、WebGPT 到 ReAct
用一張圖說明 CoT、WebGPT 如何匯入 ReAct,再沿工具、記憶、評測與安全等方向延伸,並與論文庫的 agent-systems 閱讀順序對齊。
- RAG 論文怎麼讀:從向量檢索 DPR 到 Lewis RAG
用一張圖說明 DPR 與 Lewis RAG 如何接到站上已有的檢索論文。
- TREC RAG 2026:RAG 評測為何開始加入 Agent
用 TREC RAG 2026 說明 RAG 評測從文件問答走到 Agent-in-the-loop,這篇講方向與題目設計,不講企業 harness 怎麼實作。
- 企業 RAG 評測 Harness 怎麼做(TREC RAG 2026)
以 TREC RAG 2026 與 RAGDoll 為參考,設計可重播的企業 RAG 評測 harness:資料模型、citation、Agent trace、judge 校準與上線門檻。
- Anthropic Agent Memory 是什麼:跨會話記憶與 Dreaming
拆 Anthropic 的 Agent Memory 與 Dreaming:哪個管跨會話記憶、哪個是夜間批次,兩者不要當成同一件事。
- 小型語言模型做強化學習為何容易崩潰
70M–500M SLM 在 PPO 對齊時常見的梯度凍結、數值溢出與策略崩潰,以及 PPL 能力空間假說能解釋什麼。這篇講失敗模式,不是口號式「邁向穩健」。
- AgentEscapeBench 是什麼:評測 Agent 域外工具推理
讀 AgentEscapeBench:Agent 在領域外、長鏈條工具圖上為何會崩,以及這份評測能說明什麼、不能說明什麼。
- GPT-5.6 Prompting 規則清單:從精簡提示到工具編排
把 GPT-5.6 官方 prompting 收成可勾選規則:精簡、工具編排、何時不要把政策寫進 prompt。這篇是清單,不是 15% 那篇導讀。
- Agent 寫程式的 Self-Scaffolding:Ornith 1.0 的訓練與評測邊界
讀 Ornith 1.0 的 self-scaffolding:Agent 寫程式時自己搭鷹架解決什麼、評測能說明什麼、信任邊界在哪。Ornith 是案例,不是搜尋入口。
- AI Agent 完整指南:架構、工具、評測與企業落地
從 Agent 與工作流的差異開始,系統整理單一與多 Agent 架構、工具與 MCP、狀態記憶、評測、安全治理,以及從 PoC 推進正式環境的決策方法。
- Enterprise RAG 完整指南:檢索架構、評估與企業落地
系統整理企業 RAG 的資料管線、Hybrid Search、重排、GraphRAG、Agentic RAG、評估、權限治理與失敗診斷,建立從知識來源到正式營運的決策框架。
- GPT-5.6 Sol 提示詞指引:為什麼精簡 prompt 反而比較準
讀 OpenAI GPT-5.6 Sol 官方提示指引:精簡 prompt 的 15% 數字能說明什麼、不能說明什麼。這篇講「為什麼少寫」,不是規則清單。
- GPT-5.6 Sol 是什麼:路由、價格與評測
產品向判讀 GPT-5.6 Sol:分層定價、模型路由與評測怎麼看。這不是架構論文那篇。
- OpenAI 部署模擬:發布前怎麼預測 LLM 安全
讀 OpenAI Deployment Simulation:離線評測和真實部署為什麼會落差,以及這套模擬能預測什麼、不能預測什麼。
- Phil Schmid:2026 年 Agent Harness 為何比模型排行榜更重要
深讀 2026 年 1 月長文:durability、OS 類比、系統評測缺口、Bitter Lesson 下的輕量 Harness,以及 hill climbing 與訓練—推理收斂。
- 長時間 AI 工程的 Harness 設計:生成、評估與驗證鏈
根據 Anthropic《Harness design for long-running application development》整理:用生成-評估分工、外部評測與 QA 合約,提升長任務的可靠性與可控性。
- 推理模型為何「無法控制自己的思路」——反而是 AI 安全的好消息
OpenAI 最新研究發現,現有前沿推理模型幾乎無法依指令隱藏或改變自身的思維鏈(Chain of Thought),可控性最高僅 15.4%。這個「缺陷」不只不是問題,更是當前 CoT 監控機制值得信賴的關鍵理由。
歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。
演講與聯絡