跳過至主內容
Bloss0m
⌕
EN 繁中
  • 專案
  • 部落格
  • 論文精讀
  • Now
  • 關於與聯絡
  • 搜尋

搜尋

快速找到部落格、論文精讀與專案

共 129 筆結果,目前顯示 12 筆

  • SWE-Bench ProMax:大型多語言重構,真的能測出 coding agent 的長程協作嗎?
    論文閱讀 · AI Engineering · 2026年8月13日

    深讀 SWE-Bench ProMax:以 170 個跨檔案、多語言、行為保持的程式重構任務,檢驗 coding agent 是否能完成大型變更,而不只修好一個測試。

    • Paper Reading
    • Agent Systems
    • Evaluation
    • Software Engineering
  • AI 軟體開發環境選型:從 Vibe Coding 到可驗證的 Agent Workflow
    Blog · AI Engineering · 2026年8月12日

    InfoWorld 盤點 GitHub Copilot、Google Antigravity、JetBrains Air、Kiro、Zed 與 Zenflow;本文進一步用自主權、上下文、隔離與驗證四個控制面整理 AI 開發環境的選型方法。

    • AI Agent
    • Software Engineering
    • Vibe Coding
    • Developer Tools
  • Agentic Configuration Management:把 Agent 系統當成可治理的組態,而不只是一次執行
    論文閱讀 · AI Agent · 2026年8月12日

    深讀 ACM 如何用跨框架的 Configuration Graph、immutable revisions、dependency-aware impact propagation 與 runtime provenance,治理 LangGraph、CrewAI 與 OpenAI Agents SDK 的異質 Agent 組態。

    • Paper Reading
    • AI Agent
    • Agent Security
    • Governance
  • ADIAS:把 Agent 自我改良改寫成可追蹤的問題修復
    論文閱讀 · AI Engineering · 2026年8月12日

    深讀 ADIAS:以持續的 issue state 組織跨回合失敗證據,讓 full-code agent optimization 能記住修過什麼、哪些介入失效,以及何時真的修好。

    • Paper Reading
    • Agent Systems
    • Evaluation
    • AI Engineering
  • DocMemo:讓長文件 RAG 在找錯證據後仍能回頭
    論文閱讀 · AI Engineering · 2026年8月12日

    深讀 DocMemo:用 document schema、page belief 與 question episodic memory 保存跨回合 retrieval state,再以 Bayesian update、Thompson sampling 與 adaptive granularity 找回遺漏證據。

    • Paper Reading
    • RAG
    • Retrieval
    • Multimodal
  • GitHub Copilot MCP 企業治理:從 Allowlist 語義到 Agent 採用遙測
    Blog · Enterprise AI · 2026年8月11日

    GitHub 把 MCP server allowlist、denylist 與第三方 agent activity 放進企業管理面;本文拆解政策語義、遙測邊界與可落地的 rollout 方法。

    • AI Agent
    • MCP
    • Enterprise AI
    • Governance
  • Claude Managed Agents 走向受治理的 Runtime:預算、委派、地域與 Inference Hooks
    Blog · Cloud & Platform · 2026年8月11日

    Anthropic 的 Managed Agents 把 session budget、advisor、inference geography、repository skills 與 inference hooks 變成 runtime 控制面;本文拆解它們能治理什麼,以及仍然未知的邊界。

    • AI Agent
    • Anthropic
    • Claude
    • Platform Engineering
  • FinRank:金融文件 RAG 的 hard-negative 檢索評測
    論文閱讀 · NLP · 2026年8月11日

    精讀 FinRank:用公司、年度與披露邊界構造金融文件檢索測試,說明為什麼 pooled corpus、hard negatives 與 metadata filter 會改變企業 RAG 的結論。

    • Paper Reading
    • RAG
    • Information Retrieval
    • Enterprise AI
  • A²E:把 Agent 評測變成可追蹤、可重評的稽核引擎
    論文閱讀 · AI Engineering · 2026年8月11日

    精讀 A²E:以 ATP 統一 benchmark 與 agent harness,用 span-based trace 保存執行因果,再以 lifecycle-aligned metrics 分析正確性、工具行為、成本與安全。

    • Paper Reading
    • Agent Systems
    • Evaluation
    • Observability
  • TREC RAG 2026:當 RAG 評測開始把 Agent 放進流程裡
    Blog · AI Engineering · 2026年8月9日

    用 TREC RAG 2026、ClimbMix-400b 與 RAGDoll 先理解 Agent-first 評測的方向,再延伸到企業 RAG 的實作 harness。

    • RAG
    • Evaluation
    • AI Agent
    • Enterprise AI
  • TREC RAG 2026 技術深讀:從 Evidence Lineage 到可重播的 RAG Evaluation Harness
    Blog · AI Engineering · 2026年8月9日

    以 TREC RAG 2026 與 RAGDoll 為參考,逐步設計企業 RAG evaluation harness 的資料模型、執行管線、citation support、Agent trace、judge 校準與 production gates。

    • RAG
    • Evaluation
    • AI Agent
    • Enterprise AI
  • Cloudflare 發布 Open Agentic Internet 藍圖:可讀、可搜尋、可呼叫、可付費的 Agent Web 架構
    Blog · Cloud & Platform · 2026年8月7日

    深度剖析 Cloudflare 提出的 Agentic Internet 基礎架構。從 Web Bot Auth 身份驗證、Markdown for Agents、WebMCP 前端工具暴露到 x402 微支付協定,全方位解析網頁如何從人類 UI 轉型為 AI Agent 友善的開放網路。

    • AI Agent
    • MCP
    • Platform Engineering
    • Enterprise AI

花花翻過所有筆記了

暫時找不到相符內容。

可以縮短關鍵字、切換內容類型,或從下方精選入口繼續閱讀。

從 AI Agent 開始 探索企業 RAG

Bloss0m

由 Justin 建立的 AI 工程研究與實作品牌,從前沿訊號走到可查驗的系統。

探索

  • 專案
  • 部落格
  • 論文精讀

認識 Justin

關於與聯絡 ↗
  • Now
  • 花花實驗室

除另有標示外,本站文章與專案說明為作者原創;程式碼授權請見各儲存庫。