標籤: AI Agent
此標籤的文章
- Holo4:一個 Agent 跨 GUI、程式與工具,授權卻不相同
拆解 H Company Holo4 的跨介面 Agent 與長流程 harness,並核對 benchmark、公開軌跡資料和兩個 checkpoint 的授權差異。
- NVIDIA Open Agent Safety Platform:把可執行控制和外部觀測分開驗證
拆解 OpenShell 可檢查的 Agent runtime 控制,以及 NVIDIA 所提出的 BlueField-4/Sentry 參考設計,釐清兩層各自能做什麼、仍缺哪些成效證據。
- AI Agent 風險如何變成 Runtime Policy:ASSERT 評估與 ACS 執行閘門
拆解 Microsoft run-assert-eval 如何串接 Clarity 風險探索、ASSERT 行為測試與 ACS runtime policy,並以 unsafe behavior 和 over-refusal 兩組指標檢視治理效果。
- Docker Sandbox Kit:把 Agent 權限請求和軟體一起版本化
拆解 Docker Sandbox Kit v3 如何把 Agent 的網路、憑證與 mixin 宣告放進 OCI artifact,並說明 descriptor 仍是 request、enforcement 仍取決於 runtime。
- Project Swap:Agent 會交易,不代表懂得委託人的偏好
Anthropic 的低風險員工書籍交換研究顯示,偏好估計比議價機制更限制市場結果;部署代理人之前,先測它是否理解這個人。
- Google AlloyDB 如何隔離 Agent 突發查詢:微型 VM、MCP 與專用儲存分段
拆解 AlloyDB for agents 的唯讀 agent nodes、專用 Colossus segments 與彈性計算池,並檢視隔離、資料新鮮度、冷啟動、成本和交易邊界。
- Turnstile Spin:讓 Agent 安裝 CAPTCHA,也把驗證留在真正的安全邊界
拆解 Cloudflare Turnstile Spin 如何在人工核准下安裝、修復或遷移 widget,並以 Siteverify、憑證隔離與可重播驗收形成後端安全閉環。
- Benchling 如何用 AgentCore、STS 與 DNS Firewall 隔離多租戶程式執行
拆解 Benchling 在獨立 AWS 帳戶執行 AI 產生程式碼的分層設計:每工作臨時憑證、S3 endpoint policy、DNS allow-list 與持續外洩測試。
- AI Agent 不該只會聽話:XY 問題如何讓修錯走錯路
XYEval 顯示,當使用者把一個看似合理、其實偏離根因的建議加進任務,Agent 可能照做而降低成功率;工程解法是先驗證目標,再用證據解釋修正方向。
- AI Agent 漏洞回報要附上什麼證據?MobileCybench 用可執行 Probe 重播驗證
MobileCybench 將 Android Agent 找到的漏洞主張交給隔離環境重播,再用可信狀態上的安全性 Probe 判斷哪些性質確實遭到違反。
- AWS AgentCore Gateway 跨帳號 MCP:資料留在 LOB,授權留在 Gateway
拆解 AWS 的 AgentCore Gateway 多帳號參考架構,追蹤使用者 JWT、Cedar 授權與下游 M2M OAuth 如何分工,並指出 sample 尚未跨過的 production 門檻。
- 自我修改 Agent 如何在部署前留下可查的發布 provenance?以 Ouroboros v7.4.4 為例
從 Ouroboros v7.4.4 拆解自我修改 Agent 的發布證據鏈:把身分、記憶、程式演化與受管理的子 Agent,綁到 SHA256、SBOM、GitHub build provenance 與 smoke receipts。
- RSIAgent:模型權重不變,Agent 真的能自我改進嗎?
拆解 RSIAgent 如何用 Curriculum、Actor、Verifier 與 broad-to-deep exploration 建立可重用的 frozen experience,並檢查其 benchmark 證據與重現限制。
- AI 開始做 AI 研究後,要量測什麼?Anthropic 的三個研發儀表板
拆解 Anthropic 用來觀察 AI-led R&D 的三組量測:AI 自動化程度、Agent oversight 與 safety compute,並把內部自報、方法邊界與跨實驗室不可比性放回工程決策。
- GitHub Agentic Workflows:把可執行的 Agent CI 寫成 Runtime 契約
從 gh-aw v0.89.17 與其官方變更紀錄拆解:日誌稽核、MCP Gateway/防火牆、grading、模型成本訊號與 incident loop 如何把 Agentic CI 從 demo 推向可營運的契約。
- Pydantic AI v2.45:把耐久 Agent 的可靠性寫進 Session 與 Trace 契約
拆解 Pydantic AI v2.45.0 如何對齊 durable run 的 DynamicToolset、MCP session、tool history 與 usage spans,並說明 TypeSafeModel 與 Bedrock effort 修正的採用邊界。
- Gemini Antigravity Agent 09-2026:一次 Agent Runtime 的 Protocol Migration
拆解 Antigravity Agent 09-2026 的 remote/local 相容性邊界、內建工具契約變更、adapter 設計與 contract tests,並整理 05-2026 在 2026-10-05 退場前的遷移風險。
- AWS Bedrock AgentCore 解決文件漂移:把 Code、RAG 與 MCP 寫入邊界分開
拆解 AWS 與 Corley 為 Eutelsat 展示的文件同步 Agent:以程式碼作為 source of truth,用 RAG 補上領域語言,並把 MCP 寫入與人工審查留在可治理的發布邊界。
- Claude 如何把生物分子模型跑得更快:從 FlashPairformer 到可回退的 Inference Kits
拆解 Anthropic 讓 Claude 優化 30 多個生物分子與基因組模型的工程方法,從 FlashPairformer、Big mode、stock/exact/fast 契約,到 GPU 成本與可驗證性邊界。
- TypeSafe AI 與 Jev:把 AI 變成可校準的決策元件
拆解 TypeSafe AI 的 System One 模型與 Jev,理解 typed decisions、機率信心、workflow evals,以及它和一般 LLM structured output 的差異。
- Jev 實戰架構:把 Confidence-Gated Routing 放進 Agent Runtime
不再重述 Jev 的基本介紹,改從 confidence-gated routing、speculative fan-out、composite scoring 與社群實驗,拆解如何把 AI 判斷放在 Agent、工具與人工審查之間。
- AWS Bedrock AgentCore Consent Portal:Agent 的 OAuth 不只是按下 Connect
拆解 Amazon Bedrock AgentCore Consent Portal 的 end-user OAuth flow:如何分開 corporate IdP、Gateway、GitHub/Slack outbound provider、callback、session binding、token vault 與 CloudTrail,並標出 AWS reference walkthrough 沒有證明的安全邊界。
- Redpanda Agentic Data Plane v0.2.61:把憑證、Context 與寫入權限推到 Agent 邊界
整理 Redpanda Agentic Data Plane v0.2.61/v0.2.60 的 credential passthrough、context estimate、activity filtering 與 Pylon capability gates,並回看 v0.2.58 的 audit semantics。
- Gemini 3.8 Flash Coding Agent 工作流:以不確定性路由規劃與執行
以 Astra 規劃、Flash 執行為例,說明如何在 Coding Agent 工作流加入 SPEC 查核、升級條件與成本評估。
- AWS Step Functions × Bedrock AgentCore:讓 Agent 提案先過驗證,再碰關鍵狀態
用 AWS Step Functions 編排 Bedrock AgentCore 多代理流程,把提案、確定性驗證、人工核准與執行拆成可重試、可稽核的控制邊界。
- GitSpawn:當 Repository 的 Git Config 先於 Coding Agent 的信任邊界執行
拆解 GitSpawn 如何透過 repository-local 的 core.fsmonitor 觸發背景命令,穿過 coding agent 的 workspace trust 與 approval 邊界,並整理 archive 交付條件、修補矩陣、安全重現界線與企業控制。
- Forge v0.18.1:開源多使用者 MCP Auth 與 Agent Governance
拆解 Forge v0.18.1 如何把多使用者 MCP 的身分、OAuth 同意、租戶、政策、出口與逐次稽核串成可檢查的 Agent runtime contract,並標出尚未被獨立驗證的邊界。
- AG2 v1.0.3:MCP 2.0 Migration 與確定性 Agent Governance
拆解 AG2 v1.0.3 的 MCP 2.0 breaking migration、TealTiger deterministic governance 與可驗證的 Agent runtime rollout 邊界。
- Model Hardware Standard:給實體裝置的 MCP 形狀介面
拆解 Anthropic Model Hardware Standard 研究預覽:它標準化 Agent 與可程式化硬體之間的驅動、探索與操作介面,但不取代平台的身分、授權、審批與實體安全控制。
- Automated Alignment Researchers:Agentic Post-Training 為何需要 Integrity Gates
拆解 Anthropic 的 automated alignment researcher 實驗:Agent 可以搜尋、訓練與迭代 post-training 方法,但 benchmark、能力門檻、資料隔離與完整性審查必須由外部 gate 固定。
- WeKnora 架構解析:從文件入庫到可治理的 Agent 知識平台
拆解 Tencent WeKnora 的三進程核心、文件解析與檢索資料流,並說明 Agent、MCP、sandbox、memory 與企業治理如何接在同一個控制面。
- LLM 推論成本怎麼算?從 DeepSeek-R1 實測到 GPU 租價
以 DeepSeek-R1 的 MLPerf 公開紀錄對照 8 張 B200/B300 的吞吐與延遲,再用有來源的 GPU 租價試算成本,分清實測、算術推導與 API 售價。
- AI Agent 論文怎麼讀:從 CoT、WebGPT 到 ReAct
用一張圖說明 CoT、WebGPT 如何匯入 ReAct,再沿工具、記憶、評測與安全等方向延伸,並與論文庫的 agent-systems 閱讀順序對齊。
- AIPOCH Open Science:把科研 Agent 做成可治理工作台
拆 AIPOCH Open Science v0.19.0:Skills、Notebook 依賴、OAuth 與 artifact provenance。版本號放進正文,搜尋入口是產品名與科研 Agent。
- AI 軟體開發環境選型:從 Vibe Coding 到可驗證的 Agent Workflow
InfoWorld 盤點 GitHub Copilot、Google Antigravity、JetBrains Air、Kiro、Zed 與 Zenflow;本文進一步用自主權、上下文、隔離與驗證四個控制面整理 AI 開發環境的選型方法。
- GitHub Copilot MCP 企業治理:從 Allowlist 語義到 Agent 採用遙測
GitHub 把 MCP server allowlist、denylist 與第三方 agent activity 放進企業管理面;本文拆解政策語義、遙測邊界與可落地的 rollout 方法。
- Claude Managed Agents 走向受治理的 Runtime:預算、委派、地域與 Inference Hooks
Anthropic 的 Managed Agents 把 session budget、advisor、inference geography、repository skills 與 inference hooks 變成 runtime 控制面;本文拆解它們能治理什麼,以及仍然未知的邊界。
- TREC RAG 2026:RAG 評測為何開始加入 Agent
用 TREC RAG 2026 說明 RAG 評測從文件問答走到 Agent-in-the-loop,這篇講方向與題目設計,不講企業 harness 怎麼實作。
- 企業 RAG 評測 Harness 怎麼做(TREC RAG 2026)
以 TREC RAG 2026 與 RAGDoll 為參考,設計可重播的企業 RAG 評測 harness:資料模型、citation、Agent trace、judge 校準與上線門檻。
- Cloudflare 發布 Open Agentic Internet 藍圖:可讀、可搜尋、可呼叫、可付費的 Agent Web 架構
深度剖析 Cloudflare 提出的 Agentic Internet 基礎架構。從 Web Bot Auth 身份驗證、Markdown for Agents、WebMCP 前端工具暴露到 x402 微支付協定,全方位解析網頁如何從人類 UI 轉型為 AI Agent 友善的開放網路。
- 斯坦福 CS 教授 Chris Piech:當 AI 已經會寫程式,為什麼我們更需要學習編程?
斯坦福大學電腦科學教授 Chris Piech 解構 AI 時代的軟體工程教育:語法可以交給模型,但問題拆解、架構思維與真實人類需求的連結,才是放大 AI 效能的關鍵能力。
- Claude Dreaming:Agent 如何在離線階段整理長期記憶
釐清 Anthropic Dreaming 的產品範圍,並拆解非同步記憶整理能解決什麼、不能解決什麼,以及如何設計可審核的本地 Dream Gate。
- Anthropic Agent Memory 是什麼:跨會話記憶與 Dreaming
拆 Anthropic 的 Agent Memory 與 Dreaming:哪個管跨會話記憶、哪個是夜間批次,兩者不要當成同一件事。
- OKF 0.2 改了什麼:Provenance 與可驗證計算
對照 OKF v0.1 與 v0.2:provenance、attested computation、sources 聲譽與 verified 家族。這篇講改了什麼,不是 OKF 入門。
- Kimi-K3 企業私有化要花多少:GPU、電費與 TCO
拆解 Kimi-K3 2.8T MoE 企業機房私有化部署的 GPU 顯存拓撲、伺服器預算、三相電力、液冷需求,以及五階段 TCO 估算框架。聚焦資料中心級採購與機房配套,不是 80 張 RTX 5090 消費級叢集方案。
- 80 張 RTX 5090 跑 Kimi-K3:消費級顯卡的硬體帳本
拆解以 80 張 RTX 5090 消費級顯卡組叢集推論 Kimi-K3 2.8T MoE 的硬體拓撲、為什麼不能只用 44 張顯卡,以及建置成本與電費試算。聚焦消費級 GPU 拼裝實測,企業機房 TCO 請見姊妹文。
- GPT-5.6 架構解析:Frontier Intelligence 與每 Token 智慧
讀 GPT-5.6 技術文件的架構層:Frontier Intelligence、每 token 智慧、kernel 與 harness 路由。這篇講架構,不是 Sol 價目表。
- 小型語言模型做強化學習為何容易崩潰
70M–500M SLM 在 PPO 對齊時常見的梯度凍結、數值溢出與策略崩潰,以及 PPL 能力空間假說能解釋什麼。這篇講失敗模式,不是口號式「邁向穩健」。
- AgentEscapeBench 是什麼:評測 Agent 域外工具推理
讀 AgentEscapeBench:Agent 在領域外、長鏈條工具圖上為何會崩,以及這份評測能說明什麼、不能說明什麼。
- Claude 5 世代的 Context Engineering 新法則:刪除 80% System Prompt 後的 AI Agent 設計學
Anthropic 團隊在 Claude Opus 5 與 Claude Fable 5 專案中精簡超過 80% 的 Claude Code 系統提示詞。本文深入剖析從「僵化規則約束」轉向「信賴模型判斷」的 Context Engineering 典範轉移,以及漸進式揭露、自動記憶與動態 Harness 的工程實踐。
- GPT-5.6 Prompting 規則清單:從精簡提示到工具編排
把 GPT-5.6 官方 prompting 收成可勾選規則:精簡、工具編排、何時不要把政策寫進 prompt。這篇是清單,不是 15% 那篇導讀。
- OpenAI 發表 OpenAI Presence:重塑企業級 AI Agent 治理與高風險工作流
解讀 OpenAI 於 2026 年 7 月發布的託管式企業 AI Agent 平台 OpenAI Presence。剖析其 Job-scoped 單一職責設計、護欄與人類審批機制、基於 Codex 的線上對話持續優化環路,以及 OpenAI 自身 AI Phone Support 的 dogfooding 實踐。
- 多 Agent 怎麼協調:TAKT 的 YAML 工作流
TAKT 用 YAML 工作流 topology 排多個 coding agent。這篇講協調控制點,不是又一篇「深度剖析」。
- Agent 寫程式的 Self-Scaffolding:Ornith 1.0 的訓練與評測邊界
讀 Ornith 1.0 的 self-scaffolding:Agent 寫程式時自己搭鷹架解決什麼、評測能說明什麼、信任邊界在哪。Ornith 是案例,不是搜尋入口。
- Gemini 3.6 Flash、3.5 Flash-Lite 與 Flash Cyber:定位、價格與採用邊界
整理 Gemini 3.6 Flash、3.5 Flash-Lite 與 3.5 Flash Cyber 的官方定位、目前價格、發布方評測與可用性,並提出 Agent 模型路由與資安權限的驗證重點。
- Gemini Enterprise Agent Platform:Google Cloud 的 Build、Scale、Govern、Optimize 架構
整理 Gemini Enterprise Agent Platform 的開發、執行、治理與評估能力,並從企業部署角度檢視其架構承諾、整合邊界與採用條件。
- AI Agent 完整指南:架構、工具、評測與企業落地
從 Agent 與工作流的差異開始,系統整理單一與多 Agent 架構、工具與 MCP、狀態記憶、評測、安全治理,以及從 PoC 推進正式環境的決策方法。
- 在 AWS 上打造企業級 AI Agent:Bedrock AgentCore 與 HoyaBit 從 POC 到 Production 實戰
整理 AWS × HoyaBit 議程:企業 Agentic AI 四大痛點、Amazon Bedrock AgentCore(Runtime/Memory/Gateway/治理)技術棧,以及台灣金管會合規交易所如何把語音交易 Agent 與企業大腦平台推上正式環境。
- AI Agent 時代的企業治理新課題:FinOps × Agent 治理的雙平台路徑(OmiFin 與 MAIAH)
整理 eCloudvalley 演講中的 FinOps 與 Agent 治理路徑,並以 FOCUS、FinOps Framework、AWS 與 MAIAH 公開資料校正產品主張。
- 從 Multi-Agent 架構到兩分鐘招募 AI 員工:AWS × Super 8(ORRA)企業落地實戰
整理 AWS 與 Super 8(雲發互動科技)ORRA 的議程:單一 Agent 決策循環、多代理人 Graph/Swarm/Workflow 三大協調模式、A2A 溝通、Amazon Bedrock AgentCore 核心組件,以及 ORRA 如何讓業務人員以 Job Description 方式在兩分鐘內建立並部署 AI 員工。
- 在 AWS EKS 上安全落地多租戶 AI Agent:從沙箱隔離到幣託 BitoClaw 實戰
整理 AWS 解決方案架構師 HC 與幣託運維經理 Michael 的沙龍分享:OWASP LLM Top 10 安全紅線、runC / gVisor / Kata 沙箱對比、Kubernetes 多租戶隔離層級,以及 BitoClaw 如何以 EKS、KEDA Scale-to-Zero、Pod Identity 與 Network Policy 打造合規低成本 AI Agent 平台。
- 從 Alexa for Shopping 到 Agentic Commerce:Amazon × TapPay 如何讓 AI 真正幫你結帳
整理 Amazon × TapPay 議程中的低延遲導購與支付護欄,並以 Amazon、AWS 官方資料核對 Alexa for Shopping 規模及 AgentCore 的權限與付款邊界。
- Siri AI 實測怎麼讀:beta 能力、App Intents 與尚未確定的邊界
以 The Verge 實測與 Apple 官方資料交叉檢視 iOS 27 Siri AI:哪些能力已出現在開發者測試、第三方 App 要準備什麼,以及哪些結論仍需等待 beta 驗證。
- DoorDash Ask Assistant 架構:轉化率 24% 怎麼來的
拆 DoorDash Ask Assistant 的架構與評測口徑。24% 是他們公開的轉化數字,要連同實驗範圍一起讀,不是標題保證。
- 從 Vibe Coding 走向 Harness Engineering:50 頁 Google 最新 SDLC 白皮書完整導讀與實戰指南
深度導讀 Google 2026 年最新發布的 50 頁重磅白皮書《The New SDLC With Vibe Coding》。本文將為您拆解 AI 時代下軟體開發生命週期的變革、Model + Harness 框架、自動化反饋迴圈,以及開發者轉型「品質仲裁者」的關鍵技能。
- Grok 4.5 是什麼?SpaceXAI 程式開發模型的能力、評測與導入判斷
根據 SpaceXAI 官方發布與模型文件,釐清 Grok 4.5 的 API 規格、程式開發評測、可用管道,以及團隊導入前應自行驗證的限制。
- GPT-5.6 Sol 是什麼:路由、價格與評測
產品向判讀 GPT-5.6 Sol:分層定價、模型路由與評測怎麼看。這不是架構論文那篇。
- 2026 Google Cloud Day Taipei:開發者場的 Agentic AI 重點
整理 2026 Google Cloud Day Taipei 開發者場觀察,並以官方文件查核 ADK、Agent Runtime 與企業治理能力。
- Google Cloud × 訊連科技:多媒體生成式 AI 的產品化判斷
以 Google Cloud 官方案例重新檢視訊連科技的多媒體 AI 應用:哪些成果有公開依據,以及產品團隊仍需自行驗證什麼。
- Google ADK 2.0:Workflow Graph、Task Collaboration 與 HITL 邊界
根據 Google 官方發布與 ADK repository,解析 ADK 2.0 如何分離 deterministic routing 與 LLM reasoning,並評估 workflow、task、HITL 與 production runtime 的責任邊界。
- 企業 AI Agent 安全架構:Threat Model、控制面與上線檢查表
以 Prompt Injection、工具授權、資料外洩、記憶與身分、供應鏈及可觀測性為邊界,建立可驗證的企業 AI Agent 縱深防禦架構。
- Google Cloud Data Agent Kit:Skills、MCP 與資料工作流導入指南
釐清 Data Agent Kit 的 preview 定位、開源 artifact、Skills/MCP/plugins 架構,以及企業資料團隊在權限、成本、驗證與 incident recovery 上的責任。
- Google Colab CLI:給 AI Agent 用的雲端終端
Google Colab CLI 讓 Agent 與開發者在雲端跑終端指令。這篇講能做什麼、權限與限制,不是「解放算力」的發表稿。
- GPT-Live 語音架構解析:全雙工互動、模型委派與 API 邊界
釐清 OpenAI GPT-Live 在 ChatGPT Voice 的全雙工與背景委派架構、它和 Realtime API 的產品邊界,以及語音系統上線前應驗證的失敗模式。
- LangChain OpenWiki:專為 AI Agent 打造的自動化程式碼文件管家
深入探討 LangChain 最新開源工具 OpenWiki。從底層的 Git Diffs 追蹤機制到全新的「OpenWiki Brains」主動記憶體,全面解析如何為 AI Coding Agent 打造降低 Token 消耗的專屬 codebase 文件系統。
- Meta Muse Spark 到 1.2:多模態推理、平行 Agent 與版本邊界
從初代 Muse Spark 到 1.1、1.2,整理 Meta 已公開的多模態、平行 Agent、coding 與 API 能力,並區分官方宣稱和未公開的模型內部細節。
- MCP 規格更新:無狀態核心、Tasks 與 Apps
整理 2026-07-28 MCP 規格相對於舊版的控制點:無狀態核心、Tasks、Apps,以及要不要遷移。規格日期放在正文。
- GitLab Orbit:讓 AI Agent 查詢程式碼與 SDLC 關聯
GitLab Orbit 將程式碼與軟體生命週期資料建成可查詢圖譜;本文釐清 Remote、Local、MCP 介面與 Beta/Experiment 成熟度。
- Anthropic 推出 Claude Tag:讓 Claude 成為團隊的常駐 AI 隊友
Anthropic 發布了專為團隊協作打造的 Claude Tag。透過在 Slack 中標註 @Claude,讓 AI 成為能主動參與討論、執行非同步任務並不斷學習的虛擬隊友。本文將詳細介紹其核心功能、使用方式、目標受眾及計費模式。
- 走入 Agent 時代:拆解 Cursor / Claude Code / Codex 的四大核心基石
深度解析現代 AI 編輯器的四大 Harness 機制——Skills、Subagents、Commands 與 Hooks。釐清各平台實際設定格式、觸發時機與協作關係,從「提示詞工程」進化到「AI 工作流架構師」。
- Google 發布 Agentic Resource Discovery 規範:AI Agent 時代的「能力黃頁」
深度解讀 Google 於 2026 年 6 月發布的開放規範 Agentic Resource Discovery(ARD)。這套規範旨在標準化 AI Agent 在分散式系統中尋找、驗證、並連接工具、技能與其他 Agent 的方式,解決多 Agent 協作的核心痛點:「我要怎麼找到可信的合作夥伴?」
- Anthropic 最新研究:代理寫程式 (Agentic Coding) 的現狀與領域專業的持續價值
Anthropic 發布對 40 萬次 Claude Code 互動數據的隱私保護分析。研究揭示了 AI 程式碼代理的真實分工:人類決定「做什麼」,AI 決定「怎麼做」。更重要的是,成功並非取決於「寫程式能力」,而是「領域專業知識」。這對未來的知識工作有著深遠的啟發。
- PixelRAG 是什麼:用網頁截圖做 RAG
PixelRAG 把檢索對象從純文字改成網頁截圖像素。這篇講它解決什麼、證據停在哪,不是「截圖打敗文字」的口號。
- OKF 是什麼:Google 讓 AI Agent 讀懂企業知識的格式
介紹 Google Cloud Open Knowledge Format:為什麼要用檔案 + YAML 當 Agent 知識介面,以及它不是什麼。
- Harness Engineering 怎麼讀:長任務 Agent 的設定與驗證
用一張閱讀地圖說明長任務 Agent 的 Harness:設定、驗證、交接,以及站上相關筆記要怎麼讀。
- Harness Engineering 解釋:Martin Fowler 的 AI 寫碼工作流
依 Martin Fowler 的說法,Harness Engineering 是包在 coding agent 外層的控制迴路:前饋 guides 加上回饋 sensors;信任是可設計的控制,不是感覺。
- LangChain 解剖 Agent Harness:從模型能力到可交付的工作引擎
深讀 LangChain 長文:Harness 的正式定義、由期望行為反推的元件鏈(檔案、Bash、沙箱、記憶、Context Rot、Ralph Loop),以及模型–Harness 共訓與 Terminal Bench 的啟示。
- Mitchell Hashimoto 的 AI 採用六階段:從丟掉 Chatbot 到 Harness Engineering
深讀 Hashimoto 親筆歷程:三階段工具採用、重做 commit 練功、離峰與 slam dunk 委派、AGENTS.md 與可驗證工具,以及「總有一個 Agent 在跑」的現狀與限制。
- 16 個平行 Claude 建 C 編譯器:Anthropic 的 Agent Teams 與長程 Harness 實驗
深讀 Nicholas Carlini 實驗文:近 2000 次 session、約兩萬美元 API、十萬行 Rust 編譯器能編 Linux 6.9——鎖任務、測試 Harness、GCC oracle、多角色分工與能力邊界。
- Phil Schmid:2026 年 Agent Harness 為何比模型排行榜更重要
深讀 2026 年 1 月長文:durability、OS 類比、系統評測缺口、Bitter Lesson 下的輕量 Harness,以及 hill climbing 與訓練—推理收斂。
- Parallel.ai 科普:Agent Harness 是模型以外的整條生命週期
深讀 Parallel 長文:從意圖擷取、工具執行、context 編譯到驗證與持久化,釐清 Harness 與 orchestrator、framework 的差異,並對照 Anthropic/LangChain 實例。
- Ignorance.ai Playbook:OpenAI、Stripe、OpenClaw 收斂的 Harness 實踐
深讀 2026 年 2 月橫向整理:工程師工作分裂為「建環境」與「管 Agent」、架構當護欄、工具即回饋、AGENTS.md 當系統紀錄,以及規劃與執行分離。
- HumanLayer:Coding Agent 的 Skill Issue——五類 Harness 設定面實戰
深讀 HumanLayer 長文:失敗常是配置而非模型;釐清 AGENTS.md、MCP、Skills、Sub-agents、Hooks 與 back-pressure,並回應 ETH 研究與 post-training 過擬合爭論。
- 2026 創業新規則:為什麼「建構能力」已不再是核心競爭力
站在 2026 年的創業現場,我們正目睹一場前所未有的範式轉移。在 AI 原生時代,開發成本與時間被極度壓縮,創業的瓶頸不再是「建構能力」,而是「選擇能力」。本文揭示 AI 驅動創業生態中最具顛覆性的核心洞察。
- Agentic RAG:向量搜尋遇上代理推理
整理《RAG 2026:當向量搜尋遇上代理推理》報告的核心觀點,並附本站已交件的 IT 知識問答案例:混合檢索、上下文驗證、rule-first 路由,凍結 100 題加權 98%、0 不安全;2026 方向是向量粗篩加代理精讀。
- 長時間 AI 工程的 Harness 設計:生成、評估與驗證鏈
根據 Anthropic《Harness design for long-running application development》整理:用生成-評估分工、外部評測與 QA 合約,提升長任務的可靠性與可控性。
- 長時間 Agent Harness:跨 Context 交接、驗證與恢復設計
根據 Anthropic 的長時間 Agent 實驗,拆解 initializer、進度檔、feature inventory、Git 與端到端驗證如何讓工作跨 context 穩定延續。
- Anthropic 怎麼打造有效 AI Agent:架構模式與實作策略
對 Anthropic Building Effective Agents 的架構判讀:工作流、工具、評測與何時不該做成 Agent。這不是站上的 AI Agent 完整指南。
歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。
演講與聯絡