AI 前沿研究與工程實作
追蹤新技術、拆解系統架構,也公開真正動手做過的評測與實作。
文章封存|第 3 頁
- AI Agent 論文怎麼讀:從 CoT、WebGPT 到 ReAct
用一張圖說明 CoT、WebGPT 如何匯入 ReAct,再沿工具、記憶、評測與安全等方向延伸,並與論文庫的 agent-systems 閱讀順序對齊。
- RAG 論文怎麼讀:從向量檢索 DPR 到 Lewis RAG
用一張圖說明 DPR 與 Lewis RAG 如何接到站上已有的檢索論文。
- Agentic AI 平台契約:上線前必須接上的控制面
把 Agentic 控制面收成可複製平台契約:提供什麼、必須接 E·P·J·T、七條不准繞過,以及 IT 100 題驗證口徑停在哪裡。
- AIPOCH Open Science:把科研 Agent 做成可治理工作台
拆 AIPOCH Open Science v0.19.0:Skills、Notebook 依賴、OAuth 與 artifact provenance。版本號放進正文,搜尋入口是產品名與科研 Agent。
- AI 軟體開發環境選型:從 Vibe Coding 到可驗證的 Agent Workflow
InfoWorld 盤點 GitHub Copilot、Google Antigravity、JetBrains Air、Kiro、Zed 與 Zenflow;本文進一步用自主權、上下文、隔離與驗證四個控制面整理 AI 開發環境的選型方法。
- GitHub Copilot MCP 企業治理:從 Allowlist 語義到 Agent 採用遙測
GitHub 把 MCP server allowlist、denylist 與第三方 agent activity 放進企業管理面;本文拆解政策語義、遙測邊界與可落地的 rollout 方法。
- Claude Managed Agents 走向受治理的 Runtime:預算、委派、地域與 Inference Hooks
Anthropic 的 Managed Agents 把 session budget、advisor、inference geography、repository skills 與 inference hooks 變成 runtime 控制面;本文拆解它們能治理什麼,以及仍然未知的邊界。
- TREC RAG 2026:RAG 評測為何開始加入 Agent
用 TREC RAG 2026 說明 RAG 評測從文件問答走到 Agent-in-the-loop,這篇講方向與題目設計,不講企業 harness 怎麼實作。
- 企業 RAG 評測 Harness 怎麼做(TREC RAG 2026)
以 TREC RAG 2026 與 RAGDoll 為參考,設計可重播的企業 RAG 評測 harness:資料模型、citation、Agent trace、judge 校準與上線門檻。
- Cloudflare 發布 Open Agentic Internet 藍圖:可讀、可搜尋、可呼叫、可付費的 Agent Web 架構
深度剖析 Cloudflare 提出的 Agentic Internet 基礎架構。從 Web Bot Auth 身份驗證、Markdown for Agents、WebMCP 前端工具暴露到 x402 微支付協定,全方位解析網頁如何從人類 UI 轉型為 AI Agent 友善的開放網路。
- 斯坦福 CS 教授 Chris Piech:當 AI 已經會寫程式,為什麼我們更需要學習編程?
斯坦福大學電腦科學教授 Chris Piech 解構 AI 時代的軟體工程教育:語法可以交給模型,但問題拆解、架構思維與真實人類需求的連結,才是放大 AI 效能的關鍵能力。
- Claude Dreaming:Agent 如何在離線階段整理長期記憶
釐清 Anthropic Dreaming 的產品範圍,並拆解非同步記憶整理能解決什麼、不能解決什麼,以及如何設計可審核的本地 Dream Gate。
- Anthropic Agent Memory 是什麼:跨會話記憶與 Dreaming
拆 Anthropic 的 Agent Memory 與 Dreaming:哪個管跨會話記憶、哪個是夜間批次,兩者不要當成同一件事。
- OKF 0.2 改了什麼:Provenance 與可驗證計算
對照 OKF v0.1 與 v0.2:provenance、attested computation、sources 聲譽與 verified 家族。這篇講改了什麼,不是 OKF 入門。
- Kimi-K3 企業私有化要花多少:GPU、電費與 TCO
拆解 Kimi-K3 2.8T MoE 企業機房私有化部署的 GPU 顯存拓撲、伺服器預算、三相電力、液冷需求,以及五階段 TCO 估算框架。聚焦資料中心級採購與機房配套,不是 80 張 RTX 5090 消費級叢集方案。
- 80 張 RTX 5090 跑 Kimi-K3:消費級顯卡的硬體帳本
拆解以 80 張 RTX 5090 消費級顯卡組叢集推論 Kimi-K3 2.8T MoE 的硬體拓撲、為什麼不能只用 44 張顯卡,以及建置成本與電費試算。聚焦消費級 GPU 拼裝實測,企業機房 TCO 請見姊妹文。
- GPT-5.6 架構解析:Frontier Intelligence 與每 Token 智慧
讀 GPT-5.6 技術文件的架構層:Frontier Intelligence、每 token 智慧、kernel 與 harness 路由。這篇講架構,不是 Sol 價目表。
- 小型語言模型做強化學習為何容易崩潰
70M–500M SLM 在 PPO 對齊時常見的梯度凍結、數值溢出與策略崩潰,以及 PPL 能力空間假說能解釋什麼。這篇講失敗模式,不是口號式「邁向穩健」。
歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。
演講與聯絡