標籤: Harness Engineering
此標籤的文章
- AI 軟體開發環境選型:從 Vibe Coding 到可驗證的 Agent Workflow
InfoWorld 盤點 GitHub Copilot、Google Antigravity、JetBrains Air、Kiro、Zed 與 Zenflow;本文進一步用自主權、上下文、隔離與驗證四個控制面整理 AI 開發環境的選型方法。
- 精讀 AgentEscapeBench:評測 LLM Agent 的域外長鏈條工具推理能力
深度解析最新 arXiv:2605.07926 論文《AgentEscapeBench》。論文揭示現有 AI Agent 在領域外 (OOD) 密室逃脫型 DAG 工具鏈上的實證表現:模型表現隨圖深度呈急劇崩塌,並暴露中繼結果傳遞(Clue Adherence)與狀態追蹤瓶頸。
- Claude 5 世代的 Context Engineering 新法則:刪除 80% System Prompt 後的 AI Agent 設計學
Anthropic 團隊在 Claude Opus 5 與 Claude Fable 5 專案中精簡超過 80% 的 Claude Code 系統提示詞。本文深入剖析從「僵化規則約束」轉向「信賴模型判斷」的 Context Engineering 典範轉移,以及漸進式揭露、自動記憶與動態 Harness 的工程實踐。
- OpenAI 官方 GPT-5.6 Prompting 指南實戰:從提示詞精簡到程式化工具編排
解讀 OpenAI 官方最新發布的 GPT-5.6 Model Guidance。剖析精簡 Prompt 如何提升 15% 任務品質並降低 67% 成本、劃分自主權邊界、設定 text.verbosity、運用 Programmatic Tool Calling 與 Pro Mode 最佳實踐。
- TAKT 深度剖析:利用 YAML 工作流 topology 統籌多模型 AI Coding Agent
解析 open-source 工具 TAKT 如何透過 YAML 定義 Persona、評測迴圈與 Git Worktree 隔離,將 AI 程式開發從點對點 Prompt 轉變為可稽核的大型工程協調拓撲。
- Ornith 1.0 與 Self-Scaffolding:Agentic Coding 的訓練、評測與信任邊界
整理 Ornith-1.0 的 Self-Scaffolding、Reward Hacking 防線與 Pipeline-RL 設計,並說明 Agentic Coding 系統在評測與部署時應保留的信任邊界。
- 實務判斷與架構!OpenAI 官方發布 GPT-5.6 Sol 提示詞指引:精簡提示反獲 15% 效能提升
深度剖析 OpenAI 官方發布的最新《GPT-5.6 Sol Prompting Guidance》。官方首次證實:刪除冗長規則與範例、精簡 System Prompt 不僅能降低 67% 的成本,更能提升 10-15% 的任務評估分數。本文將拆解全新的 Model + Harness 實務、Programmatic Tool Calling 與驗證工作流。
- 從 Vibe Coding 走向 Harness Engineering:50 頁 Google 最新 SDLC 白皮書完整導讀與實戰指南
深度導讀 Google 2026 年最新發布的 50 頁重磅白皮書《The New SDLC With Vibe Coding》。本文將為您拆解 AI 時代下軟體開發生命週期的變革、Model + Harness 框架、自動化反饋迴圈,以及開發者轉型「品質仲裁者」的關鍵技能。
- 走入 Agent 時代:拆解 Cursor / Claude Code / Codex 的四大核心基石
深度解析現代 AI 編輯器的四大 Harness 機制——Skills、Subagents、Commands 與 Hooks。釐清各平台實際設定格式、觸發時機與協作關係,從「提示詞工程」進化到「AI 工作流架構師」。
- Harness Engineering 導覽
本站 Harness Engineering 專區的起點:概念、全系列文章索引,以及依角色與情境的閱讀路徑。
- Martin Fowler 談 Harness:如何用控制迴路建立對 Coding Agent 的信任
深讀 Thoughtworks 評析文:guides/sensors、computational/inferential、三類 regulation 與行為 harness 缺口,並對照 OpenAI 實戰與常見 Agent 失敗模式,整理可落地的 Harness 盤點表。
- LangChain 解剖 Agent Harness:從模型能力到可交付的工作引擎
深讀 LangChain 長文:Harness 的正式定義、由期望行為反推的元件鏈(檔案、Bash、沙箱、記憶、Context Rot、Ralph Loop),以及模型–Harness 共訓與 Terminal Bench 的啟示。
- Mitchell Hashimoto 的 AI 採用六階段:從丟掉 Chatbot 到 Harness Engineering
深讀 Hashimoto 親筆歷程:三階段工具採用、重做 commit 練功、離峰與 slam dunk 委派、AGENTS.md 與可驗證工具,以及「總有一個 Agent 在跑」的現狀與限制。
- 16 個平行 Claude 建 C 編譯器:Anthropic 的 Agent Teams 與長程 Harness 實驗
深讀 Nicholas Carlini 實驗文:近 2000 次 session、約兩萬美元 API、十萬行 Rust 編譯器能編 Linux 6.9——鎖任務、測試 Harness、GCC oracle、多角色分工與能力邊界。
- Phil Schmid:2026 年 Agent Harness 為何比模型排行榜更重要
深讀 2026 年 1 月長文:durability、OS 類比、系統評測缺口、Bitter Lesson 下的輕量 Harness,以及 hill climbing 與訓練—推理收斂。
- Parallel.ai 科普:Agent Harness 是模型以外的整條生命週期
深讀 Parallel 長文:從意圖擷取、工具執行、context 編譯到驗證與持久化,釐清 Harness 與 orchestrator、framework 的差異,並對照 Anthropic/LangChain 實例。
- Ignorance.ai Playbook:OpenAI、Stripe、OpenClaw 收斂的 Harness 實踐
深讀 2026 年 2 月橫向整理:工程師工作分裂為「建環境」與「管 Agent」、架構當護欄、工具即回饋、AGENTS.md 當系統紀錄,以及規劃與執行分離。
- HumanLayer:Coding Agent 的 Skill Issue——五類 Harness 設定面實戰
深讀 HumanLayer 長文:失敗常是配置而非模型;釐清 AGENTS.md、MCP、Skills、Sub-agents、Hooks 與 back-pressure,並回應 ETH 研究與 post-training 過擬合爭論。
- 長時間 AI 工程的 Harness 設計:生成、評估與驗證鏈
根據 Anthropic《Harness design for long-running application development》整理:用生成-評估分工、外部評測與 QA 合約,提升長任務的可靠性與可控性。
- 長時間 Agent Harness:跨 Context 交接、驗證與恢復設計
根據 Anthropic 的長時間 Agent 實驗,拆解 initializer、進度檔、feature inventory、Git 與端到端驗證如何讓工作跨 context 穩定延續。
- Harness Engineering:讓 Codex Repository 可讀、可驗證、可治理
解讀 OpenAI agent-first 工程實驗:如何用 repository knowledge、可觀測環境、架構 invariants 與持續清理,將人類注意力轉成可複利的控制系統。
歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。
演講與聯絡