• Raven 精讀:Harness of Harnesses 如何規劃多 Agent 協作
    論文閱讀, AI Systems · 2026年10月1日

    Raven 把可執行的模型與 harness 配成專才,再由 Host Agent 規劃合作 DAG。本文拆解 harness composition、MAOB 評測與 +10.4/+10.5 個百分點的真正分母:它衡量規劃圖匹配,不是 worker 執行成功率。

  • Holo4:一個 Agent 跨 GUI、程式與工具,授權卻不相同
    Blog, AI Engineering · 2026年9月30日

    拆解 H Company Holo4 的跨介面 Agent 與長流程 harness,並核對 benchmark、公開軌跡資料和兩個 checkpoint 的授權差異。

  • Kumo Tabular:用合成表格預訓練,讓新任務從範例開始
    Blog, AI Engineering · 2026年9月30日

    NVIDIA Kumo Tabular 把表格預測改成 in-context learning:模型先在合成表格上預訓練,再從標記列預測新資料;本文拆解方法、榜單主張與企業驗證條件。

  • EfficientAgent 精讀:並行 Agent 的 KV Cache Offloading
    論文閱讀, AI Systems · 2026年9月30日

    EfficientAgent 說明 KV cache 從 GPU 搬到 host memory 何時真的划算:關鍵不是單次請求,而是其他並行 Agent 在兩次重用之間形成的 reuse working set。本文拆解容量估算、寫入 admission、SWE-bench replay 結果與硬體邊界。

  • NVIDIA Open Agent Safety Platform:把可執行控制和外部觀測分開驗證
    Blog, AI Engineering · 2026年9月29日

    拆解 OpenShell 可檢查的 Agent runtime 控制,以及 NVIDIA 所提出的 BlueField-4/Sentry 參考設計,釐清兩層各自能做什麼、仍缺哪些成效證據。

  • Target 零售商品搜尋:讓語意召回服從精確度與線上實驗
    Blog, AI Engineering · 2026年9月29日

    拆解 Target 如何以詞彙與向量雙路檢索、屬性精確度控制和加權交錯,改善商品搜尋,並檢視其離線與線上證據的邊界。

  • Stale-Document Poisoning 精讀:RAG 如何辨識已失效的證據
    論文閱讀, NLP · 2026年9月29日

    真實、曾經正確的文件也可能讓 RAG 把模型原本答對的答案改錯。本文拆解 317 個跨領域知識反轉、日期與有效期間的差異、因果介入,以及依賴可信 metadata 的 reranker。

  • Completed Pairs Hide Capped Failures 精讀:配對評估的停止規則與未知結果
    論文閱讀, AI Systems · 2026年9月29日

    ReVerPi 的單次 source-reading campaign 揭示:第一個配對分支碰到 request cap 時,runner 會抑制 companion,讓 completed-pair summary 遺漏已知失敗與未知結果;有限 frame bounds 與分層成本分析說明結論能走多遠。

  • AI Agent 風險如何變成 Runtime Policy:ASSERT 評估與 ACS 執行閘門
    Blog, AI Engineering · 2026年9月28日

    拆解 Microsoft run-assert-eval 如何串接 Clarity 風險探索、ASSERT 行為測試與 ACS runtime policy,並以 unsafe behavior 和 over-refusal 兩組指標檢視治理效果。

  • Docker Sandbox Kit:把 Agent 權限請求和軟體一起版本化
    Blog, Cloud & Platform · 2026年9月28日

    拆解 Docker Sandbox Kit v3 如何把 Agent 的網路、憑證與 mixin 宣告放進 OCI artifact,並說明 descriptor 仍是 request、enforcement 仍取決於 runtime。

  • Project Swap:Agent 會交易,不代表懂得委託人的偏好
    Blog, Industry Pulse · 2026年9月28日

    Anthropic 的低風險員工書籍交換研究顯示,偏好估計比議價機制更限制市場結果;部署代理人之前,先測它是否理解這個人。

  • SpecHarness 論文精讀:以規格與證據判定 Agent 任務完成
    論文閱讀, AI Agent · 2026年9月28日

    精讀 SpecHarness 如何把 agent 可見的指示編成來源可追溯的義務,並以合格證據提交狀態;同時檢視 SkillsBench 與 GuideBench 結果、執行成本與完整 runtime 歸因限制。