先建立方法閱讀底座
從 AlexNet 的架構與訓練證據開始,練習把方法、實驗與年代限制分開。
- AlexNet(上):先用證據讀懂它為何改變 ImageNet
- AlexNet(下):把可訓練化配方拆成可驗證的設計
PAPERS · REPRODUCTION · ENGINEERING NOTES
不只摘要論文,而是整理架構決策、可複現方法、評測限制,以及研究進入真實系統後會發生什麼。
START WITH A PATH
三條有限路徑把文章庫變成有順序的學習旅程;從適合的難度開始,讀到取得需要的工程答案即可。
從 AlexNet 的架構與訓練證據開始,練習把方法、實驗與年代限制分開。
沿著多模態解析、工具檢索、持續記憶、GraphRAG、規模化與 runtime control 前進。
+ 8 個後續步驟
從這裡開始從 reward model、長期記憶與 runtime,一路讀到安全訊號、即時修復與持久化評測。
+ 5 個後續步驟
從這裡開始READING LIBRARY
可依研究領域、閱讀難度或論文發表年份篩選。
深讀 SWE-Bench ProMax:以 170 個跨檔案、多語言、行為保持的程式重構任務,檢驗 coding agent 是否能完成大型變更,而不只修好一個測試。
深讀 ACM 如何用跨框架的 Configuration Graph、immutable revisions、dependency-aware impact propagation 與 runtime provenance,治理 LangGraph、CrewAI 與 OpenAI Agents SDK 的異質 Agent 組態。
深讀 ADIAS:以持續的 issue state 組織跨回合失敗證據,讓 full-code agent optimization 能記住修過什麼、哪些介入失效,以及何時真的修好。
深讀 DocMemo:用 document schema、page belief 與 question episodic memory 保存跨回合 retrieval state,再以 Bayesian update、Thompson sampling 與 adaptive granularity 找回遺漏證據。
精讀 FinRank:用公司、年度與披露邊界構造金融文件檢索測試,說明為什麼 pooled corpus、hard negatives 與 metadata filter 會改變企業 RAG 的結論。
精讀 A²E:以 ATP 統一 benchmark 與 agent harness,用 span-based trace 保存執行因果,再以 lifecycle-aligned metrics 分析正確性、工具行為、成本與安全。
拆解 ContextWeave 如何把多月工作流重建成可執行 benchmark,並檢驗記憶對工作區結果、偏好一致性、連續性與誤導風險的真實影響。
拆解 Argus 的 Manager–Planner–Engineer–Reviewer runtime、持久狀態、驗證式演化與 rollback,並區分 benchmark 結果、作者自營案例與尚未證明的自我學習主張。
精讀 AskChem 如何以帶有 DOI、原文引句與 evidence locator 的 atomic claim 取代 paper/chunk 作為檢索單位,並檢查它在 30 題 AskChem-Bench 上改善了什麼、沒有證明什麼。
拆解 AgentS4D 如何把 workspace agent 的風險入口、誘導策略、目標傷害與生命週期證據放進同一個 sandbox benchmark,並檢查完成率為什麼不能代表安全。
深讀 Wang 等人的 arXiv v3 研究:在固定問題、證據與對抗文件的 28 層企業型語料梯度上,BM25 如何跨過約 1,000 萬語料 token 的交叉點,以及為什麼 agent 應該接在全域候選排序之後。
精讀 AgentTrajectorySentinel 如何用健康軌跡訓練的低成本時間監控器、決定性驗證與 rollback-and-retry,在不逐步呼叫 LLM judge 的情況下提早攔截失敗;同時拆開它的校準依賴、內容盲點、修復實驗與可重現性邊界。
精讀 Before Reasoning Can Fail 如何把『搜尋後沒有讀證據就回答』拆成可觀測的軌跡失敗,並檢驗 Read-Gate 是否真的改善多跳問答。
深讀 PAST-Bench 如何用 fresh-session task families、matched persistence controls 與 trace-level mechanism evidence,分辨 Agent 變好是因為保留經驗,還是只是分數變高。
拆解 RubricRanker 如何用 query-specific search rubrics、SFT 與 GRPO 訓練文件 reranker,並檢查它在 deep research 與 RAG benchmark 上真正改善了什麼。
完整拆解 OSReward 的資料建構、27 個 VLM judges、Hard/Multi 子集、錯誤與成本分析、OS-Shepherd-100K 訓練,並延伸成可部署的混合驗證架構。
依 arXiv:2602.02007 解讀 xMemory 四層階層、sparsity–semantics 目標、兩階段 top-down 檢索,以及 LoCoMo/PerLTQA 實證。
依 arXiv:2502.11371 解讀統一評估協議、四類 GraphRAG、Table 1–5 數字、效率 trade-off 與 Selection/Integration 混合策略。
以論文、附錄與官方程式庫為據,拆解 RAG-Anything 的雙圖索引、實驗證據、失敗案例與工程採用邊界。
以論文證據檢視 RAG-MCP 的工具路由流程、11,100 候選壓力測試、MCPBench 結果、規模退化與未釋出 artifact。
以論文證據檢視 ERM 的 correctness gate、選擇性歸因、有界 key update、BEIR/BRIGHT 結果與未釋出 artifact。
從 Figure 1–3、Sections 3–6 重讀 ReLU、多 GPU、overlapping pooling、資料增強與 dropout 的證據。
以論文可定位證據重讀 AlexNet 的問題、評測與歷史性結果:它證明了什麼,也沒有證明什麼。
RESEARCH EXCHANGE