標籤: AI Agent
此標籤的文章
- AI 軟體開發環境選型:從 Vibe Coding 到可驗證的 Agent Workflow
InfoWorld 盤點 GitHub Copilot、Google Antigravity、JetBrains Air、Kiro、Zed 與 Zenflow;本文進一步用自主權、上下文、隔離與驗證四個控制面整理 AI 開發環境的選型方法。
- GitHub Copilot MCP 企業治理:從 Allowlist 語義到 Agent 採用遙測
GitHub 把 MCP server allowlist、denylist 與第三方 agent activity 放進企業管理面;本文拆解政策語義、遙測邊界與可落地的 rollout 方法。
- Claude Managed Agents 走向受治理的 Runtime:預算、委派、地域與 Inference Hooks
Anthropic 的 Managed Agents 把 session budget、advisor、inference geography、repository skills 與 inference hooks 變成 runtime 控制面;本文拆解它們能治理什麼,以及仍然未知的邊界。
- TREC RAG 2026:當 RAG 評測開始把 Agent 放進流程裡
用 TREC RAG 2026、ClimbMix-400b 與 RAGDoll 先理解 Agent-first 評測的方向,再延伸到企業 RAG 的實作 harness。
- TREC RAG 2026 技術深讀:從 Evidence Lineage 到可重播的 RAG Evaluation Harness
以 TREC RAG 2026 與 RAGDoll 為參考,逐步設計企業 RAG evaluation harness 的資料模型、執行管線、citation support、Agent trace、judge 校準與 production gates。
- Cloudflare 發布 Open Agentic Internet 藍圖:可讀、可搜尋、可呼叫、可付費的 Agent Web 架構
深度剖析 Cloudflare 提出的 Agentic Internet 基礎架構。從 Web Bot Auth 身份驗證、Markdown for Agents、WebMCP 前端工具暴露到 x402 微支付協定,全方位解析網頁如何從人類 UI 轉型為 AI Agent 友善的開放網路。
- 斯坦福 CS 教授 Chris Piech:當 AI 已經會寫程式,為什麼我們更需要學習編程?
斯坦福大學電腦科學教授 Chris Piech 解構 AI 時代的軟體工程教育:語法可以交給模型,但問題拆解、架構思維與真實人類需求的連結,才是放大 AI 效能的關鍵能力。
- Andrej Karpathy 解決了 Claude Code 的最大弱點:讓 AI 學會「作夢」(Dreaming)
Anthropic 正式推出 Claude Code 的 Dreaming 功能,解決 AI 代理在「同步寫入記憶」時遭遇的上下文斷層與注意力分散問題,讓 AI 代理能夠像人類大腦一樣在夜間自動梳理、沉澱與進化。
- Anthropic 推出新一代 AI 代理記憶機制與 Dreaming 功能:實現持續自我學習
探討 Anthropic 為 Claude 代理導入的底層記憶機制 (Memory) 與夜間批次 Dreaming 功能,解決多代理系統中的上下文管理與學習難題。
- Google Cloud 推出 OKF v0.2 規範:從 Provenance 到 Attested Computation 的 AI 知識庫升級全解析
深度比較 Google Cloud Open Knowledge Format (OKF) v0.2 與 v0.1 的核心差異。解析全新的 Attested Computation(可驗證計算)、sources 聲譽訊號、verified 驗證家族與生命週期控制,為 AI Agent 建構無幻覺、高度可信的企業知識底座。
- Kimi-K3 企業私有化部署成本全解析:2.8T MoE 的 GPU 算力、機房電費與 TCO 實務評估
完整拆解 Moonshot Kimi-K3 2.8T MoE 模型私有化部署所需的 GPU 顯存拓撲、伺服器預算、機房三相電力與液冷需求,並提供企業導入 5 階段估算框架。
- 80 張 RTX 5090 真的跑起 Kimi-K3:消費級顯卡推論 2.8T MoE 的硬體帳本與工程代價
完整拆解 AI 開發者以 80 張 RTX 5090 消費級顯卡成功部署 Moonshot Kimi-K3 2.8T MoE 模型的硬體拓撲、為什麼不能只用 44 張顯卡、千萬級建置成本與三相電費試算。
- OpenAI GPT-5.6 技術解析:Frontier Intelligence 與「每 Token 智慧」的架構轉折
深入解析 OpenAI 官方發布的 GPT-5.6 論文與規格,完整拆解 Sol/Terra/Luna 三階定價、Coding Agent 基準測試、Triton 自研 Kernel 與 Agentic Harness 動態路由最佳化。
- 邁向穩健的小型語言模型強化學習:架構解析與實務判斷
探討 70M–500M 參數級別的 SLM 在 PPO 強化學習對齊中常見的三大崩潰模式(梯度凍結、數值溢出、策略崩潰),並解析 PPL < 20 的能力空間假說(Capacity-Headroom Hypothesis)。
- 精讀 AgentEscapeBench:評測 LLM Agent 的域外長鏈條工具推理能力
深度解析最新 arXiv:2605.07926 論文《AgentEscapeBench》。論文揭示現有 AI Agent 在領域外 (OOD) 密室逃脫型 DAG 工具鏈上的實證表現:模型表現隨圖深度呈急劇崩塌,並暴露中繼結果傳遞(Clue Adherence)與狀態追蹤瓶頸。
- Claude 5 世代的 Context Engineering 新法則:刪除 80% System Prompt 後的 AI Agent 設計學
Anthropic 團隊在 Claude Opus 5 與 Claude Fable 5 專案中精簡超過 80% 的 Claude Code 系統提示詞。本文深入剖析從「僵化規則約束」轉向「信賴模型判斷」的 Context Engineering 典範轉移,以及漸進式揭露、自動記憶與動態 Harness 的工程實踐。
- OpenAI 官方 GPT-5.6 Prompting 指南實戰:從提示詞精簡到程式化工具編排
解讀 OpenAI 官方最新發布的 GPT-5.6 Model Guidance。剖析精簡 Prompt 如何提升 15% 任務品質並降低 67% 成本、劃分自主權邊界、設定 text.verbosity、運用 Programmatic Tool Calling 與 Pro Mode 最佳實踐。
- OpenAI 發表 OpenAI Presence:重塑企業級 AI Agent 治理與高風險工作流
解讀 OpenAI 於 2026 年 7 月發布的託管式企業 AI Agent 平台 OpenAI Presence。剖析其 Job-scoped 單一職責設計、護欄與人類審批機制、基於 Codex 的線上對話持續優化環路,以及 OpenAI 自身 AI Phone Support 的 dogfooding 實踐。
- TAKT 深度剖析:利用 YAML 工作流 topology 統籌多模型 AI Coding Agent
解析 open-source 工具 TAKT 如何透過 YAML 定義 Persona、評測迴圈與 Git Worktree 隔離,將 AI 程式開發從點對點 Prompt 轉變為可稽核的大型工程協調拓撲。
- Ornith 1.0 與 Self-Scaffolding:Agentic Coding 的訓練、評測與信任邊界
整理 Ornith-1.0 的 Self-Scaffolding、Reward Hacking 防線與 Pipeline-RL 設計,並說明 Agentic Coding 系統在評測與部署時應保留的信任邊界。
- 深入解析 Gemini 3.6 Flash、3.5 Flash-Lite 與 3.5 Flash Cyber:為 Agentic 應用打造的全新模型架構
Google 推出全新 Gemini 模型陣容,包含在效能與效率全面進化的 3.6 Flash、專為高吞吐量打造的 3.5 Flash-Lite,以及專攻資安漏洞防禦的 3.5 Flash Cyber,全面迎戰 AI Agent 大規模應用時代。
- Gemini Enterprise Agent Platform:Google Cloud 的 Build、Scale、Govern、Optimize 架構
整理 Gemini Enterprise Agent Platform 的開發、執行、治理與評估能力,並從企業部署角度檢視其架構承諾、整合邊界與採用條件。
- AI Agent 完整指南:架構、工具、評測與企業落地
從 Agent 與工作流的差異開始,系統整理單一與多 Agent 架構、工具與 MCP、狀態記憶、評測、安全治理,以及從 PoC 推進正式環境的決策方法。
- 在 AWS 上打造企業級 AI Agent:Bedrock AgentCore 與 HoyaBit 從 POC 到 Production 實戰
整理 AWS × HoyaBit 議程:企業 Agentic AI 四大痛點、Amazon Bedrock AgentCore(Runtime/Memory/Gateway/治理)技術棧,以及台灣金管會合規交易所如何把語音交易 Agent 與企業大腦平台推上正式環境。
- AI Agent 時代的企業治理新課題:FinOps × Agent 治理的雙平台路徑(OmiFin 與 MAIAH)
整理 eCloudvalley 企業解決方案架構師 Elmer 的演講:AI 應用成本指數成長下,如何以 FinOps(OmiFin)與 AI Agent 治理(MAIAH Platform)兼顧創新與可控營運;涵蓋治理/合規概念、PPT(People/Process/Cloud & Platform)雲端治理模型、FOCUS 帳單標準與 BYOA/Guardrails/Token 控管。
- 從 Multi-Agent 架構到兩分鐘招募 AI 員工:AWS × Super 8(ORRA)企業落地實戰
整理 AWS 與 Super 8(雲發互動科技)ORRA 的議程:單一 Agent 決策循環、多代理人 Graph/Swarm/Workflow 三大協調模式、A2A 溝通、Amazon Bedrock AgentCore 核心組件,以及 ORRA 如何讓業務人員以 Job Description 方式在兩分鐘內建立並部署 AI 員工。
- 在 AWS EKS 上安全落地多租戶 AI Agent:從沙箱隔離到幣託 BitoClaw 實戰
整理 AWS 解決方案架構師 HC 與幣託運維經理 Michael 的沙龍分享:OWASP LLM Top 10 安全紅線、runC / gVisor / Kata 沙箱對比、Kubernetes 多租戶隔離層級,以及 BitoClaw 如何以 EKS、KEDA Scale-to-Zero、Pod Identity 與 Network Policy 打造合規低成本 AI Agent 平台。
- 從 Alexa for Shopping 到 Agentic Commerce:Amazon × TapPay 如何讓 AI 真正幫你結帳
整理 Amazon 與 TapPay 副總經理 Joseph 的演講:Alexa for Shopping(原 Rufus)如何以單 Agent 架構拿下 120 億美元營收、Agentic Commerce 與傳統導購差異、以及單次虛擬卡、意圖核對與限額管理等 AI 自動購物安全防線。
- Siri AI 實測體驗:它對我們使用 iPhone 日常方式的影響與實務判斷
深度解析 The Verge 對 iOS 27 首個公測版 (Public Beta) 中 Siri AI 的一手評測。從全新的螢幕感知能力、行事曆智慧解析,到開發者必須實作的 Entities 與 Intents 架構,全面剖析 Apple 語音智能的未來。
- 轉化率提升 24%!DoorDash 揭秘 Ask Assistant 智能購物助理底層架構
深度剖析外送龍頭 DoorDash 如何結合大型語言模型、專屬 AI Agent、Model Context Protocol (MCP) 以及三層記憶體系統,打造出日均執行 2,000 次自動化評估的企業級 AI 購物助理系統。
- 從 Vibe Coding 走向 Harness Engineering:50 頁 Google 最新 SDLC 白皮書完整導讀與實戰指南
深度導讀 Google 2026 年最新發布的 50 頁重磅白皮書《The New SDLC With Vibe Coding》。本文將為您拆解 AI 時代下軟體開發生命週期的變革、Model + Harness 框架、自動化反饋迴圈,以及開發者轉型「品質仲裁者」的關鍵技能。
- Grok 4.5 是什麼?SpaceXAI 程式開發模型的能力、評測與導入判斷
根據 SpaceXAI 官方發布與模型文件,釐清 Grok 4.5 的 API 規格、程式開發評測、可用管道,以及團隊導入前應自行驗證的限制。
- GPT-5.6 Sol 已正式推出:模型路由、價格與評測判讀
更新 GPT-5.6 從有限預覽轉為正式供應後的 Sol、Terra、Luna 定位、API 規格與價格,並整理 benchmark 限制和企業導入決策。
- 2026 Google Cloud Day Taipei:開發者技術專場精華總結,全面邁向 Agentic AI 時代
直擊 Google Cloud Day Taipei 技術專場!從底層 TPU 硬體、多樣化的 Gemini 模型陣容,到為開發者量身打造的 Anti Gravity 2.0 平台與 MCP 協定,一探 Google 如何建構完整的 Agent 開發生態系。
- Google Cloud 與訊連科技:生成式 AI 對多媒體創作市場的影響與實務判斷
探討 Google Cloud 最新的多媒體 AI 技術(Imagen 3、Veo 等),以及訊連科技如何透過 Promeo 將這些強大的底層技術轉化為貼近使用者的 AI Agent,為創作者與中小企業帶來前所未有的商業競爭優勢。
- Google ADK 2.0:Workflow Graph、Task Collaboration 與 HITL 邊界
根據 Google 官方發布與 ADK repository,解析 ADK 2.0 如何分離 deterministic routing 與 LLM reasoning,並評估 workflow、task、HITL 與 production runtime 的責任邊界。
- 企業 AI Agent 安全架構:Threat Model、控制面與上線檢查表
以 Prompt Injection、工具授權、資料外洩、記憶與身分、供應鏈及可觀測性為邊界,建立可驗證的企業 AI Agent 縱深防禦架構。
- Google Cloud Data Agent Kit:Skills、MCP 與資料工作流導入指南
釐清 Data Agent Kit 的 preview 定位、開源 artifact、Skills/MCP/plugins 架構,以及企業資料團隊在權限、成本、驗證與 incident recovery 上的責任。
- 終極雲端算力解放:Google Colab CLI 正式推出,AI 代理與開發者的最強輔助
Google 宣布推出全新的 Colab CLI 工具!打破本地端與雲端 GPU 之間的隔閡,只要透過簡單的終端機指令,即可瞬間調用強大算力,更是次世代 AI Agent 自動化執行的完美利器。
- GPT-Live 語音架構解析:全雙工互動、模型委派與 API 邊界
釐清 OpenAI GPT-Live 在 ChatGPT Voice 的全雙工與背景委派架構、它和 Realtime API 的產品邊界,以及語音系統上線前應驗證的失敗模式。
- LangChain OpenWiki:專為 AI Agent 打造的自動化程式碼文件管家
深入探討 LangChain 最新開源工具 OpenWiki。從底層的 Git Diffs 追蹤機制到全新的「OpenWiki Brains」主動記憶體,全面解析如何為 AI Coding Agent 打造降低 Token 消耗的專屬 codebase 文件系統。
- MCP 2026-07-28 規格:無狀態核心、Tasks、Apps 與遷移判斷
解讀 Model Context Protocol 2026-07-28 正式規格的 breaking changes、Tasks 與 Apps 擴充,並整理企業升級、相容性與安全控制清單。
- GitLab Orbit 深度解析:為 AI 時代打造的軟體生命週期知識圖譜
GitLab Orbit 是一個軟體生命週期的上下文圖譜,專為 AI Agent 與人類開發者提供統一、可查詢的開發數據。本文將帶您了解 Orbit 的底層圖譜 Schema、ClickHouse/DuckDB 部署選項,以及如何結合 MCP 提供強大的 AI 開發體驗。
- Anthropic 推出 Claude Tag:讓 Claude 成為團隊的常駐 AI 隊友
Anthropic 發布了專為團隊協作打造的 Claude Tag。透過在 Slack 中標註 @Claude,讓 AI 成為能主動參與討論、執行非同步任務並不斷學習的虛擬隊友。本文將詳細介紹其核心功能、使用方式、目標受眾及計費模式。
- 走入 Agent 時代:拆解 Cursor / Claude Code / Codex 的四大核心基石
深度解析現代 AI 編輯器的四大 Harness 機制——Skills、Subagents、Commands 與 Hooks。釐清各平台實際設定格式、觸發時機與協作關係,從「提示詞工程」進化到「AI 工作流架構師」。
- Google 發布 Agentic Resource Discovery 規範:AI Agent 時代的「能力黃頁」
深度解讀 Google 於 2026 年 6 月發布的開放規範 Agentic Resource Discovery(ARD)。這套規範旨在標準化 AI Agent 在分散式系統中尋找、驗證、並連接工具、技能與其他 Agent 的方式,解決多 Agent 協作的核心痛點:「我要怎麼找到可信的合作夥伴?」
- Anthropic 最新研究:代理寫程式 (Agentic Coding) 的現狀與領域專業的持續價值
Anthropic 發布對 40 萬次 Claude Code 互動數據的隱私保護分析。研究揭示了 AI 程式碼代理的真實分工:人類決定「做什麼」,AI 決定「怎麼做」。更重要的是,成功並非取決於「寫程式能力」,而是「領域專業知識」。這對未來的知識工作有著深遠的啟發。
- PixelRAG:Web 截圖擊敗文本檢索!百萬級像素原生 RAG 系統深度剖析
解讀 UC Berkeley 等機構提出的 PixelRAG 系統,剖析其定制 Chromium 渲染、GPU 加速預處理、LoRA 雙塔視覺嵌入與 Text Warmup 訓練配方,並教你如何將其實現為 Claude Code 的網頁視覺閱讀技能。
- Google Cloud 推出 Open Knowledge Format (OKF):讓 AI Agent 讀懂企業知識的開放標準
深度解讀 Google Cloud 提出的 Open Knowledge Format (OKF) 規範。剖析如何將傳統 LLM-wiki 模式標準化,透過簡潔的 Markdown、YAML 前置屬性與互聯結構,打破企業知識孤島,為 AI Agent 提供可攜式、高互操作性的知識底座。
- Harness Engineering 導覽
本站 Harness Engineering 專區的起點:概念、全系列文章索引,以及依角色與情境的閱讀路徑。
- Martin Fowler 談 Harness:如何用控制迴路建立對 Coding Agent 的信任
深讀 Thoughtworks 評析文:guides/sensors、computational/inferential、三類 regulation 與行為 harness 缺口,並對照 OpenAI 實戰與常見 Agent 失敗模式,整理可落地的 Harness 盤點表。
- LangChain 解剖 Agent Harness:從模型能力到可交付的工作引擎
深讀 LangChain 長文:Harness 的正式定義、由期望行為反推的元件鏈(檔案、Bash、沙箱、記憶、Context Rot、Ralph Loop),以及模型–Harness 共訓與 Terminal Bench 的啟示。
- Mitchell Hashimoto 的 AI 採用六階段:從丟掉 Chatbot 到 Harness Engineering
深讀 Hashimoto 親筆歷程:三階段工具採用、重做 commit 練功、離峰與 slam dunk 委派、AGENTS.md 與可驗證工具,以及「總有一個 Agent 在跑」的現狀與限制。
- 16 個平行 Claude 建 C 編譯器:Anthropic 的 Agent Teams 與長程 Harness 實驗
深讀 Nicholas Carlini 實驗文:近 2000 次 session、約兩萬美元 API、十萬行 Rust 編譯器能編 Linux 6.9——鎖任務、測試 Harness、GCC oracle、多角色分工與能力邊界。
- Phil Schmid:2026 年 Agent Harness 為何比模型排行榜更重要
深讀 2026 年 1 月長文:durability、OS 類比、系統評測缺口、Bitter Lesson 下的輕量 Harness,以及 hill climbing 與訓練—推理收斂。
- Parallel.ai 科普:Agent Harness 是模型以外的整條生命週期
深讀 Parallel 長文:從意圖擷取、工具執行、context 編譯到驗證與持久化,釐清 Harness 與 orchestrator、framework 的差異,並對照 Anthropic/LangChain 實例。
- Ignorance.ai Playbook:OpenAI、Stripe、OpenClaw 收斂的 Harness 實踐
深讀 2026 年 2 月橫向整理:工程師工作分裂為「建環境」與「管 Agent」、架構當護欄、工具即回饋、AGENTS.md 當系統紀錄,以及規劃與執行分離。
- HumanLayer:Coding Agent 的 Skill Issue——五類 Harness 設定面實戰
深讀 HumanLayer 長文:失敗常是配置而非模型;釐清 AGENTS.md、MCP、Skills、Sub-agents、Hooks 與 back-pressure,並回應 ETH 研究與 post-training 過擬合爭論。
- 2026 創業新規則:為什麼「建構能力」已不再是核心競爭力
站在 2026 年的創業現場,我們正目睹一場前所未有的範式轉移。在 AI 原生時代,開發成本與時間被極度壓縮,創業的瓶頸不再是「建構能力」,而是「選擇能力」。本文揭示 AI 驅動創業生態中最具顛覆性的核心洞察。
- Agentic RAG:向量搜尋遇上代理推理
整理我在《RAG 2026:當向量搜尋遇上代理推理》報告中的核心觀點:為什麼純向量 RAG 會卡在上下文盲視、為什麼 2026 的方向是向量粗篩加代理精讀,以及企業該如何落地可驗證、可治理的混合架構。
- 長時間 AI 工程的 Harness 設計:生成、評估與驗證鏈
根據 Anthropic《Harness design for long-running application development》整理:用生成-評估分工、外部評測與 QA 合約,提升長任務的可靠性與可控性。
- 長時間 Agent Harness:跨 Context 交接、驗證與恢復設計
根據 Anthropic 的長時間 Agent 實驗,拆解 initializer、進度檔、feature inventory、Git 與端到端驗證如何讓工作跨 context 穩定延續。
- 打造有效的 AI Agent:架構模式與實作策略總覽
根據 Anthropic《Building Effective AI Agents》整理:從單一 Agent 到多 Agent 協作、常見架構模式、工作流設計,以及如何依控制需求、問題複雜度與資源選擇合適架構。
歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。
演講與聯絡