AI 前沿研究與工程實作
追蹤新技術、拆解系統架構,也公開真正動手做過的評測與實作。
文章封存|第 7 頁
- Harness Engineering 怎麼讀:長任務 Agent 的設定與驗證
用一張閱讀地圖說明長任務 Agent 的 Harness:設定、驗證、交接,以及站上相關筆記要怎麼讀。
- Harness Engineering 解釋:Martin Fowler 的 AI 寫碼工作流
依 Martin Fowler 的說法,Harness Engineering 是包在 coding agent 外層的控制迴路:前饋 guides 加上回饋 sensors;信任是可設計的控制,不是感覺。
- LangChain 解剖 Agent Harness:從模型能力到可交付的工作引擎
深讀 LangChain 長文:Harness 的正式定義、由期望行為反推的元件鏈(檔案、Bash、沙箱、記憶、Context Rot、Ralph Loop),以及模型–Harness 共訓與 Terminal Bench 的啟示。
- Mitchell Hashimoto 的 AI 採用六階段:從丟掉 Chatbot 到 Harness Engineering
深讀 Hashimoto 親筆歷程:三階段工具採用、重做 commit 練功、離峰與 slam dunk 委派、AGENTS.md 與可驗證工具,以及「總有一個 Agent 在跑」的現狀與限制。
- 16 個平行 Claude 建 C 編譯器:Anthropic 的 Agent Teams 與長程 Harness 實驗
深讀 Nicholas Carlini 實驗文:近 2000 次 session、約兩萬美元 API、十萬行 Rust 編譯器能編 Linux 6.9——鎖任務、測試 Harness、GCC oracle、多角色分工與能力邊界。
- Phil Schmid:2026 年 Agent Harness 為何比模型排行榜更重要
深讀 2026 年 1 月長文:durability、OS 類比、系統評測缺口、Bitter Lesson 下的輕量 Harness,以及 hill climbing 與訓練—推理收斂。
- Parallel.ai 科普:Agent Harness 是模型以外的整條生命週期
深讀 Parallel 長文:從意圖擷取、工具執行、context 編譯到驗證與持久化,釐清 Harness 與 orchestrator、framework 的差異,並對照 Anthropic/LangChain 實例。
- Ignorance.ai Playbook:OpenAI、Stripe、OpenClaw 收斂的 Harness 實踐
深讀 2026 年 2 月橫向整理:工程師工作分裂為「建環境」與「管 Agent」、架構當護欄、工具即回饋、AGENTS.md 當系統紀錄,以及規劃與執行分離。
- HumanLayer:Coding Agent 的 Skill Issue——五類 Harness 設定面實戰
深讀 HumanLayer 長文:失敗常是配置而非模型;釐清 AGENTS.md、MCP、Skills、Sub-agents、Hooks 與 back-pressure,並回應 ETH 研究與 post-training 過擬合爭論。
- 2026 創業新規則:為什麼「建構能力」已不再是核心競爭力
站在 2026 年的創業現場,我們正目睹一場前所未有的範式轉移。在 AI 原生時代,開發成本與時間被極度壓縮,創業的瓶頸不再是「建構能力」,而是「選擇能力」。本文揭示 AI 驅動創業生態中最具顛覆性的核心洞察。
- Agentic RAG:向量搜尋遇上代理推理
整理《RAG 2026:當向量搜尋遇上代理推理》報告的核心觀點,並附本站已交件的 IT 知識問答案例:混合檢索、上下文驗證、rule-first 路由,凍結 100 題加權 98%、0 不安全;2026 方向是向量粗篩加代理精讀。
- 長時間 AI 工程的 Harness 設計:生成、評估與驗證鏈
根據 Anthropic《Harness design for long-running application development》整理:用生成-評估分工、外部評測與 QA 合約,提升長任務的可靠性與可控性。
- 長時間 Agent Harness:跨 Context 交接、驗證與恢復設計
根據 Anthropic 的長時間 Agent 實驗,拆解 initializer、進度檔、feature inventory、Git 與端到端驗證如何讓工作跨 context 穩定延續。
- Harness Engineering:讓 Codex Repository 可讀、可驗證、可治理
解讀 OpenAI agent-first 工程實驗:如何用 repository knowledge、可觀測環境、架構 invariants 與持續清理,將人類注意力轉成可複利的控制系統。
- 高效學術論文閱讀:三遍掃描法
把「三遍讀論文法」落地成可執行流程:用 5–10 分鐘做海選、用 1 小時抓住方法與證據、再用「虛擬重做一遍」吃透細節。本文整合 Keshav 的 three-pass 與李沐老師的實作要點,附檢查清單與文獻綜述讀法。
- AI 對勞動市場的衝擊:從「理論能力」到「實際使用」的新衡量方式
根據 Anthropic《Labor market impacts of AI: A new measure and early evidence》整理:介紹「觀察到的曝光度」指標,說明哪些職業最暴露在 AI 之下、與就業成長與失業率的關係,以及對政策、企業與個人職涯的啟示。
- 推理模型為何「無法控制自己的思路」——反而是 AI 安全的好消息
OpenAI 最新研究發現,現有前沿推理模型幾乎無法依指令隱藏或改變自身的思維鏈(Chain of Thought),可控性最高僅 15.4%。這個「缺陷」不只不是問題,更是當前 CoT 監控機制值得信賴的關鍵理由。
- LINE 貼圖怎麼上架:不會畫畫也能做
LINE 創作者貼圖上架流程:圖片規格、主圖/分頁圖、打包,以及不會畫畫時怎麼用現成圖與 AI 輔助完成。
歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。
演講與聯絡