標籤: Evaluation
此標籤的文章
- TREC RAG 2026:當 RAG 評測開始把 Agent 放進流程裡
用 TREC RAG 2026、ClimbMix-400b 與 RAGDoll 先理解 Agent-first 評測的方向,再延伸到企業 RAG 的實作 harness。
- TREC RAG 2026 技術深讀:從 Evidence Lineage 到可重播的 RAG Evaluation Harness
以 TREC RAG 2026 與 RAGDoll 為參考,逐步設計企業 RAG evaluation harness 的資料模型、執行管線、citation support、Agent trace、judge 校準與 production gates。
- Anthropic 推出新一代 AI 代理記憶機制與 Dreaming 功能:實現持續自我學習
探討 Anthropic 為 Claude 代理導入的底層記憶機制 (Memory) 與夜間批次 Dreaming 功能,解決多代理系統中的上下文管理與學習難題。
- 邁向穩健的小型語言模型強化學習:架構解析與實務判斷
探討 70M–500M 參數級別的 SLM 在 PPO 強化學習對齊中常見的三大崩潰模式(梯度凍結、數值溢出、策略崩潰),並解析 PPL < 20 的能力空間假說(Capacity-Headroom Hypothesis)。
- 精讀 AgentEscapeBench:評測 LLM Agent 的域外長鏈條工具推理能力
深度解析最新 arXiv:2605.07926 論文《AgentEscapeBench》。論文揭示現有 AI Agent 在領域外 (OOD) 密室逃脫型 DAG 工具鏈上的實證表現:模型表現隨圖深度呈急劇崩塌,並暴露中繼結果傳遞(Clue Adherence)與狀態追蹤瓶頸。
- OpenAI 官方 GPT-5.6 Prompting 指南實戰:從提示詞精簡到程式化工具編排
解讀 OpenAI 官方最新發布的 GPT-5.6 Model Guidance。剖析精簡 Prompt 如何提升 15% 任務品質並降低 67% 成本、劃分自主權邊界、設定 text.verbosity、運用 Programmatic Tool Calling 與 Pro Mode 最佳實踐。
- Ornith 1.0 與 Self-Scaffolding:Agentic Coding 的訓練、評測與信任邊界
整理 Ornith-1.0 的 Self-Scaffolding、Reward Hacking 防線與 Pipeline-RL 設計,並說明 Agentic Coding 系統在評測與部署時應保留的信任邊界。
- AI Agent 完整指南:架構、工具、評測與企業落地
從 Agent 與工作流的差異開始,系統整理單一與多 Agent 架構、工具與 MCP、狀態記憶、評測、安全治理,以及從 PoC 推進正式環境的決策方法。
- Enterprise RAG 完整指南:檢索架構、評估與企業落地
系統整理企業 RAG 的資料管線、Hybrid Search、重排、GraphRAG、Agentic RAG、評估、權限治理與失敗診斷,建立從知識來源到正式營運的決策框架。
- 實務判斷與架構!OpenAI 官方發布 GPT-5.6 Sol 提示詞指引:精簡提示反獲 15% 效能提升
深度剖析 OpenAI 官方發布的最新《GPT-5.6 Sol Prompting Guidance》。官方首次證實:刪除冗長規則與範例、精簡 System Prompt 不僅能降低 67% 的成本,更能提升 10-15% 的任務評估分數。本文將拆解全新的 Model + Harness 實務、Programmatic Tool Calling 與驗證工作流。
- GPT-5.6 Sol 已正式推出:模型路由、價格與評測判讀
更新 GPT-5.6 從有限預覽轉為正式供應後的 Sol、Terra、Luna 定位、API 規格與價格,並整理 benchmark 限制和企業導入決策。
- OpenAI 發表「部署模擬」(Deployment Simulation):解決評估覺醒,更真實地在發布前預測 LLM 安全性
深度解讀 OpenAI 提出的最新大語言模型安全性評估方法「部署模擬」(Deployment Simulation)。剖析如何透過重播歷史真實用戶對話前綴,擺脫傳統紅隊測試中模型的「評估覺醒」與應試行為,對 GPT-5 系列模型實現高精度的風險預測,並使用簡潔的流程圖與預估圖表進行完整說明。
- Phil Schmid:2026 年 Agent Harness 為何比模型排行榜更重要
深讀 2026 年 1 月長文:durability、OS 類比、系統評測缺口、Bitter Lesson 下的輕量 Harness,以及 hill climbing 與訓練—推理收斂。
- 長時間 AI 工程的 Harness 設計:生成、評估與驗證鏈
根據 Anthropic《Harness design for long-running application development》整理:用生成-評估分工、外部評測與 QA 合約,提升長任務的可靠性與可控性。
- 推理模型為何「無法控制自己的思路」——反而是 AI 安全的好消息
OpenAI 最新研究發現,現有前沿推理模型幾乎無法依指令隱藏或改變自身的思維鏈(Chain of Thought),可控性最高僅 15.4%。這個「缺陷」不只不是問題,更是當前 CoT 監控機制值得信賴的關鍵理由。
歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。
演講與聯絡