START WITH A PATH

先選問題,再選論文

三條有限路徑把文章庫變成有順序的學習旅程;從適合的難度開始,讀到取得需要的工程答案即可。

入門 → 中階 2 篇

先建立方法閱讀底座

從 AlexNet 的架構與訓練證據開始,練習把方法、實驗與年代限制分開。

  1. AlexNet(上):先用證據讀懂它為何改變 ImageNet
  2. AlexNet(下):把可訓練化配方拆成可驗證的設計
從這裡開始
中階 → 進階 11 篇

理解檢索、記憶與 Production RAG

沿著多模態解析、工具檢索、持續記憶、GraphRAG、規模化與 runtime control 前進。

  1. RAG-Anything:多模態文件檢索不只是把圖片轉成文字
  2. RAG-MCP:用檢索縮小工具發現,但不能忽略路由失敗
  3. RAG without Forgetting:把成功的 Query Expansion 寫回索引,但不要把錯誤也寫進去

+ 8 個後續步驟

從這裡開始
進階 8 篇

Agent Runtime、安全與評測

從 reward model、長期記憶與 runtime,一路讀到安全訊號、即時修復與持久化評測。

  1. OSReward 論文精讀:為什麼 Agent 的成功不能只交給另一個模型判斷?
  2. ContextWeave 論文精讀:記憶真的讓 Agent 更會做事嗎?
  3. Argus 論文精讀:長期 Agent 需要的是 Runtime,不是更長的 Prompt

+ 5 個後續步驟

從這裡開始
入門:先懂問題與直覺 中階:跟著方法與實驗 進階:判讀證據邊界與採用條件

READING LIBRARY

依工程問題尋找論文

可依研究領域、閱讀難度或論文發表年份篩選。

  • SWE-Bench ProMax:大型多語言重構,真的能測出 coding agent 的長程協作嗎?

    進階
    筆記 · 2026年8月13日 · 論文 · 2026 · AI Engineering

    深讀 SWE-Bench ProMax:以 170 個跨檔案、多語言、行為保持的程式重構任務,檢驗 coding agent 是否能完成大型變更,而不只修好一個測試。

    90 秒掌握這篇論文
    問題
    既有 coding-agent benchmark 多半以 Python、單一 issue 或 bug fix 為中心;agent 可能修好可見測試,卻漏掉跨檔案的呼叫點、設定、文件與測試。這無法回答「它能否完成大型、行為保持的重構」這個更接近真實維護工作的問題。
    核心設計
    從 GitHub 的 refactoring commits 挖掘候選,經 Docker 環境驗證、專家與 LLM 輔助標註、人工複核,最後保留 170 個任務,涵蓋 Python、Java、TypeScript、Go、C、C++、Rust 七種語言。
    最強結果
    在論文固定的 mini-SWE-agent 與 OpenHands scaffold、每題最多 300 steps/$10 的設定下,OpenHands + GPT-5.2 的 resolve rate 為 41.2%,但同一模型在 mini-SWE-agent 只有 21.8%。這首先是 scaffold 與 agent loop 的結果,不是單純的模型排行榜。
    主要邊界
    resolve 是「所有測試通過」的 binary outcome,不評估 patch 的可維護性、未被測試的行為、review 品質或 action trace。TypeScript 任務集中在兩個 repository、其中 Angular 有 25 題;跨語言比較不能當作獨立且均衡的語言難度實驗。
    進入完整精讀
  • Agentic Configuration Management:把 Agent 系統當成可治理的組態,而不只是一次執行

    進階
    Agent 安全 · Part 2 · 筆記 · 2026年8月12日 · 論文 · 2026 · AI Agent

    深讀 ACM 如何用跨框架的 Configuration Graph、immutable revisions、dependency-aware impact propagation 與 runtime provenance,治理 LangGraph、CrewAI 與 OpenAI Agents SDK 的異質 Agent 組態。

    90 秒掌握這篇論文
    問題
    一個 agent system 的行為不只由程式碼決定,還取決於 prompt、model、tool、skill、workflow、policy、framework 與 runtime state;現有 framework 和 AgentOps 工具各自管理一部分,卻很難把「哪個完整組態產生了這次執行」固定下來。
    核心洞見
    ACM 把這些異質 artifact 正規化成 typed、independently versioned 的 Agentic Configuration Items(ACI),由四張互連的 Configuration、Evolution、Assurance、Runtime Graph 管理;執行 framework 只負責投影,治理 kernel 在共同表示上工作。
    最強證據
    27 個 controlled governance scenarios 跨 LangGraph、CrewAI 與 OpenAI Agents SDK,另有 9 個 quantitative impact cases;三個 framework 在受控範圍得到相同 governance outcomes,重複執行的 impact set 與 metrics 也一致(Section 7.2–7.6、Tables 8、10、12)。
    主要邊界
    這是 reference model 與 prototype 的 conformance/feasibility evidence;distributed execution、learning、long-term memory、MCP/A2A native protocol 與 large-scale industrial validation 都在目前範圍外(Table 13、Table 14、Sections 8.4、9)。
    進入完整精讀
  • ADIAS:把 Agent 自我改良改寫成可追蹤的問題修復

    進階 Agent Runtime、安全與評測
    筆記 · 2026年8月12日 · 論文 · 2026 · AI Engineering

    深讀 ADIAS:以持續的 issue state 組織跨回合失敗證據,讓 full-code agent optimization 能記住修過什麼、哪些介入失效,以及何時真的修好。

    90 秒掌握這篇論文
    問題
    自動化 agent design 通常以 candidate 為中心保存歷史。每一回合都重新閱讀候選程式、分數與 trajectory,卻沒有明確記住「同一個失敗是否已經修過、哪個介入有效、哪個改動造成 regression」。
    核心直覺
    把被修復的 issue,而不是 candidate agent,變成跨回合的控制狀態。每個 issue 擁有穩定身份、priority、supporting evidence、lifecycle status 與 intervention-outcome history。
    最強證據
    論文在 Tau-Bench、ALFWorld、TextCraft、WebShop、ScienceWorld 五個互動式環境比較 ADIAS 與五種 baseline;Table 1 的平均分數為 78.4,最強 baseline DGM-H 為 62.6。這些方法共用 task split、wrapper、action interface、scoring script、十回合 optimization budget 與每回合 15 個 training episodes(論文 Section 4、Table 1)。
    主要邊界
    論文把 trajectory diagnosis 與 issue association 固定下來,沒有獨立測量診斷正確率;評估也限於文字型互動 benchmark。GitHub repository 的 README 仍是 Coming Soon,因此本文不把「paper 說有 code」等同於「讀者現在可重現」。
    進入完整精讀
  • DocMemo:讓長文件 RAG 在找錯證據後仍能回頭

    進階 理解檢索、記憶與 Production RAG
    筆記 · 2026年8月12日 · 論文 · 2026 · AI Engineering

    深讀 DocMemo:用 document schema、page belief 與 question episodic memory 保存跨回合 retrieval state,再以 Bayesian update、Thompson sampling 與 adaptive granularity 找回遺漏證據。

    90 秒掌握這篇論文
    問題
    長文件的答案可能分散在數十頁、表格、圖與跨頁線索中。static retrieval 一開始就固定 top-k pages;若第一輪漏掉 evidence,後續 reasoner 沒有狀態可以解釋「哪一頁可能有用、哪些頁面已被排除、還缺什麼」。
    核心直覺
    把 retrieval 做成 dynamic evidence exploration。Document Schema Memory 保存文件結構,Page Belief Memory 更新頁面相關性信念,Question Episodic Memory 記住當前問題的發現與 query refinement。
    最強證據
    在 MMLongBench-Doc、LongDocURL、PaperTab 三個 long-document DocVQA benchmark 上,DocMemo 的 accuracy 為 71.3、81.1、80.4,平均 77.6;Table 4 的 ablation 也顯示移除 memory 或 Bayesian update 會使 MMLongBench-Doc accuracy 從 71.3 降到 68.5 或 68.8。
    主要邊界
    評估依賴 GPT-4.1 binary judge、PDF rendering、Qwen3.5-VL-9B、ColQwen2.5、MinerU 與三個 benchmark 的 annotation;它沒有證明任意企業 corpus 的 citation faithfulness、access-control correctness、freshness 或總成本。
    進入完整精讀
  • FinRank:金融文件 RAG 的 hard-negative 檢索評測

    中階 理解檢索、記憶與 Production RAG
    金融檢索評測 · Part 1 · 筆記 · 2026年8月11日 · 論文 · 2026 · NLP

    精讀 FinRank:用公司、年度與披露邊界構造金融文件檢索測試,說明為什麼 pooled corpus、hard negatives 與 metadata filter 會改變企業 RAG 的結論。

    90 秒掌握這篇論文
    問題
    金融文件問答的錯誤不只來自「找不到相似文字」。同一個詞可能出現在不同公司、不同申報年度、不同 Note,metadata filter 也可能把真正的 supporting passage 一起裁掉。FinRank 要測的是:檢索器能否在這些近似但不正確的段落中保住正確證據。
    核心想法
    建立 1,185 筆人工撰寫的金融 QA、5,230 段 pooled corpus 與 6,021 個 curated hard negatives,再用多種資料切分測試跨年份、跨公司與查詢改寫的泛化。
    最重要證據
    在 pooled corpus 的 Recall@10 表中,e5-mistral-7b-instruct 為 44.8、BM25 為 32.1;metadata-filtered BM25 為 55.0,但 Section 7.1 說明 filter 可能因 first-occurrence metadata 把 gold passage 排除。Section 7.3 的 hard-negative 對比又讓 pairwise accuracy 比 random negatives 低 13.0–20.5 個百分點。
    主要邊界
    論文沒有測 answer generation、citation correctness 或 faithfulness;資料主要來自 2024–2025 的美國 10-K/10-Q,且標註與資料分布仍有版本不一致。因此它是 retrieval evaluation 的好起點,不是金融 RAG 上線安全證明。
    進入完整精讀
  • A²E:把 Agent 評測變成可追蹤、可重評的稽核引擎

    中階 Agent Runtime、安全與評測
    Agent Auditing · Part 1 · 筆記 · 2026年8月11日 · 論文 · 2026 · AI Engineering

    精讀 A²E:以 ATP 統一 benchmark 與 agent harness,用 span-based trace 保存執行因果,再以 lifecycle-aligned metrics 分析正確性、工具行為、成本與安全。

    90 秒掌握這篇論文
    問題
    Agent 最後答對,不代表它走了可靠、便宜或安全的路徑;最後答錯,也不代表你知道問題出在 planning、tool use、memory、judge 或 runtime。若每個 harness 自己存一份文字 log,就很難跨 framework 比較,也很難在新 metric 出現時重評既有 trajectory。
    核心想法
    A²E 將 Task、Monitor、Evaluation 分成三層。Agent Task Protocol(ATP)把 benchmark 的 task 與 harness 的執行介面分開;Monitor 將 model calls、tool calls、state 與錯誤組成有 parent-child 關係的 trace;Evaluation 用 lifecycle-aligned taxonomy 把 process、outcome 與 runtime 指標放在一起。
    最重要證據
    實驗涵蓋 23 個 benchmark、9 個 harness、每個 cell 5 個 task,共 1,035 次 scored runs;同一個 DeepSeek-V4-pro FP4 backbone、inference config、tool setup、step limit 與 timeout 被固定。Section 6.2/6.3 報告 harness 間的 success-rate gap 可達 GDPVal 0.20、MMLU-Pro 0.30、tau³-bench 0.66。
    主要邊界
    這是平台架構與診斷框架的 demonstration,不是對九個 harness 的普遍排名。Table 2 的 prose 與顯示的 tasksucceeded/correctness 數值互相矛盾;paper commit、judge calibration、API 變動與 component-level ablation 也不足以支持強因果結論。
    進入完整精讀
  • ContextWeave 論文精讀:記憶真的讓 Agent 更會做事嗎?

    進階 Agent Runtime、安全與評測
    Agent 評測 · Part 2 · 筆記 · 2026年8月7日 · 論文 · 2026 · AI Agent

    拆解 ContextWeave 如何把多月工作流重建成可執行 benchmark,並檢驗記憶對工作區結果、偏好一致性、連續性與誤導風險的真實影響。

    90 秒掌握這篇論文
    問題
    記憶 benchmark 常把「找得到歷史」當成成功,卻沒有測試它是否讓下一個可執行工作真的做得更好。
    核心想法
    把多月工作流重建成固定、可執行的任務串,對同一 target task 只切換是否提供過去軌跡;用結果品質與偏好遵循,而非 retrieval hit,量出記憶造成的差值。
    最強證據
    在 14 位參與者、1,005 個重建任務(568 個核心評測任務)的設定中,作者報告最強 memory component 將 Workspace Score 由 68.08 提升至 78.20、Preference Score 由 41.50 提升至 70.60(Section 5.2、Table 2)。
    邊界
    重建的 Docker/模擬 API 與 LLM 型評分器使結果可比較,卻不能直接代表真實企業資料、真實工具漂移或所有 memory 實作的 production uplift。
    進入完整精讀
  • Argus 論文精讀:長期 Agent 需要的是 Runtime,不是更長的 Prompt

    進階 Agent Runtime、安全與評測
    Multi-Agent Coordination · Part 1 · 筆記 · 2026年8月7日 · 論文 · 2026 · AI Agent

    拆解 Argus 的 Manager–Planner–Engineer–Reviewer runtime、持久狀態、驗證式演化與 rollback,並區分 benchmark 結果、作者自營案例與尚未證明的自我學習主張。

    90 秒掌握這篇論文
    問題
    長時程 agent 失敗時,單一長 prompt 沒有清楚的任務 authority、可稽核狀態、驗證關卡或可回復邊界。
    核心想法
    Argus 以 Manager、Planner、Engineer、Reviewer 在 durable project state 上循環;只有經 role-owned review 的 memory、skill、routing 與 procedure 才能成為下一輪狀態。
    最強證據
    報告在七個 task-native arena 中展示廣度,並在 SWE-Bench Pro 報告 GPT-5.5 條件下 Argus 78% 對 Direct Copilot 59%、約 1.41 倍 aggregate tokens(Figure 1、Section 5)。
    邊界
    這是 arXiv v1 technical report;實作、prompt、trace、checkpoint 與完整 benchmark package 尚未公開,不能把結果當成可重現的 runtime 採用證明。
    進入完整精讀
  • AskChem:把文獻檢索單位改成帶來源的 claim

    進階 理解檢索、記憶與 Production RAG
    檢索系統 · Part 1 · 筆記 · 2026年8月7日 · 論文 · 2026 · NLP

    精讀 AskChem 如何以帶有 DOI、原文引句與 evidence locator 的 atomic claim 取代 paper/chunk 作為檢索單位,並檢查它在 30 題 AskChem-Bench 上改善了什麼、沒有證明什麼。

    90 秒掌握這篇論文
    問題
    paper/chunk retrieval 讓讀者或 agent 自己找證據句、判斷 claim 是否可定位、再跨 paper 合成。
    核心想法
    AskChem 將帶 DOI、quote/evidence locator 與類型的 atomic claim 作為檢索單位,接上 taxonomy、evidence graph 與同一組 REST/SDK/MCP interface。
    最強證據
    2.4M claims、147K papers 的系統,在 30 個 chemistry synthesis questions 上報告 AskChem-grounded answer 的 DOI resolvability 100%,LLM-only 為 88.3%(Section 7、Table 1)。
    邊界
    DOI 可解析與 citation density 是 provenance proxy,不是 claim 事實正確、完整文獻覆蓋或化學結論可用性的證明。
    進入完整精讀
  • AgentS4D 論文精讀:任務完成了,Runtime 真的安全嗎?

    進階 Agent Runtime、安全與評測
    Agent 安全 · Part 1 · 筆記 · 2026年8月7日 · 論文 · 2026 · AI Agent

    拆解 AgentS4D 如何把 workspace agent 的風險入口、誘導策略、目標傷害與生命週期證據放進同一個 sandbox benchmark,並檢查完成率為什麼不能代表安全。

    90 秒掌握這篇論文
    問題
    workspace agent 即使完成任務,仍可能因 prompt、skill、file、web content、memory 或 user message 的風險載體產生不安全副作用。
    核心想法
    AgentS4D 將評估單位設為完整的 harness–LLM–task 環境,依風險來源、induction strategy、harm 與 execution lifecycle 檢查 completion 與 safety。
    最強證據
    328 個注入風險案例在 20 組 harness/backend configuration 中得到 6,560 runs;4,461 runs (68.0%) 觸發預先定義的 unsafe signal,4,344 runs(66.22%)同時 unsafe 且 complete(Section 4、Table 2)。
    邊界
    案例、資產與效果是 synthetic/controlled,且 v1 沒有 executable code 或 data;這些比例不是 production incident rate,也不是任一 harness 的通用安全排序。
    進入完整精讀
  • BM25 在大規模語料中勝出:RAG 範式的擴展研究

    中階 理解檢索、記憶與 Production RAG
    Retrieval Systems 精讀 · Part 2 · 筆記 · 2026年8月7日 · 論文 · 2026 · NLP

    深讀 Wang 等人的 arXiv v3 研究:在固定問題、證據與對抗文件的 28 層企業型語料梯度上,BM25 如何跨過約 1,000 萬語料 token 的交叉點,以及為什麼 agent 應該接在全域候選排序之後。

    90 秒掌握這篇論文
    問題
    RAG paradigm 常只在單一 corpus size 比較,無法看見 accuracy、construction cost、query cost 與 latency 如何一起隨資料量變化。
    核心想法
    以 28 個 nested corpus tiers(1,144 到 511,959 documents)固定 reader/judge 與 adversarial bedrock,比較 lexical、dense、graph、file-system agency;再以 retrieval-swap control 隔離 access substrate。
    最強證據
    在 shared large tiers,作者報告 BM25 約在 10M corpus tokens 超過 raw file-system agency;matched 150-question resweep 中 Agent+BM25 69.4、raw-file agency 36.9(Section 5.1、Figure 4、Table 4)。
    邊界
    EnterpriseRAG-Bench 是 fictional enterprise-shaped corpus、500 questions 和一個主 reader/judge;公開 executable benchmark/data artifact 未確認,不能轉寫成普遍「BM25 永遠贏」。
    進入完整精讀
  • Real-Time Detection and Repair of LLM Agent Failures:Agent 失敗的即時偵測與修復

    進階 Agent Runtime、安全與評測
    Agent 評測 · Part 3 · 筆記 · 2026年8月7日 · 論文 · 2026 · AI Agent

    精讀 AgentTrajectorySentinel 如何用健康軌跡訓練的低成本時間監控器、決定性驗證與 rollback-and-retry,在不逐步呼叫 LLM judge 的情況下提早攔截失敗;同時拆開它的校準依賴、內容盲點、修復實驗與可重現性邊界。

    90 秒掌握這篇論文
    問題
    agent failure 往往在最後答案以前發生;每步用 LLM judge 又可能太慢、太貴。
    核心想法
    以 healthy trajectory 訓練 temporal monitor,配合 deterministic verification;異常時 rollback 到可信 checkpoint 並定向 retry。
    最強證據
    作者在 2,823 committed episodes、三個框架與多種模型上比較 monitor、verifier 與 repair policy,修復研究報告 success 由 52% 到 73%(Section 5、Table 4)。
    邊界
    healthy-only calibration、短軌跡、injected failures 與文字型 hallucination 的偵測弱點,限制新 production stack 的轉移。
    進入完整精讀
  • 推理之前就可能失敗:Agentic RAG 的證據前程序性失敗

    進階 理解檢索、記憶與 Production RAG
    Production RAG 控制 · Part 1 · 筆記 · 2026年8月7日 · 論文 · 2026 · Retrieval Systems

    精讀 Before Reasoning Can Fail 如何把『搜尋後沒有讀證據就回答』拆成可觀測的軌跡失敗,並檢驗 Read-Gate 是否真的改善多跳問答。

    90 秒掌握這篇論文
    問題
    agentic RAG 可 search 到 snippets 卻在 read 前 final;這是 evidence-conditioned reasoning 開始前的程序失敗,不應與讀過 gold evidence 後仍答錯混為一談。
    核心想法
    以 saved tool traces、retrieved/read passages 和 final answer 定義 discipline 與 post-gold-read failure;Read-Gate 強制「search 後、final 前至少 read 一段」,不改模型、retriever 或 reasoning budget。
    最強證據
    12,000 個 paired trajectories 跨 HotpotQA、2WikiMultiHopQA、MuSiQue;zero-read subset forced reading 的 LLM-Acc 增加 14.9–19.9 points,完整 minimal-reasoning cells 增加 3.2–9.4(Table 1、Section 5.2)。
    邊界
    適用於可觀察 search/read/final action 的 multi-hop QA;read 不保證已讀對或推理正確,MuSiQue 缺完整 gold chunk annotation 也限制 post-gold-read 分析。
    進入完整精讀
  • PAST-Bench:Persistent Agent 真的從過去學會了什麼嗎?

    進階 Agent Runtime、安全與評測
    Agent 評測 · Part 4 · 筆記 · 2026年8月7日 · 論文 · 2026 · AI Agent

    深讀 PAST-Bench 如何用 fresh-session task families、matched persistence controls 與 trace-level mechanism evidence,分辨 Agent 變好是因為保留經驗,還是只是分數變高。

    90 秒掌握這篇論文
    問題
    持久 agent 後續得分提高,可能來自模型、prompt、任務難度或殘留 context,而不是正確使用先前經驗。
    核心想法
    PAST-Bench 在 fresh-session task families 中,固定 prompt、grader、tool stack,只切換 persistence-on/off;同時量 task-score gap 與 write/read/artifact 的 mechanism evidence。
    最強證據
    26 個 scenario、204 個 episode、四種能力、七個模型與四個框架;Hermes+ 報告 overall gap 從 +0.13 到 +0.15、Mech 從 0.64 到 0.73(Table 2、Section 4.3)。
    邊界
    overall gap 差異小於 run-to-run variation,任務由提案團隊設計,matched ablation 是強控制而不是完整因果證明。
    進入完整精讀
  • RubricRanker 論文精讀:RAG 需要的不是最相關文件,而是對的文件集合

    進階 理解檢索、記憶與 Production RAG
    檢索系統 · Part 3 · 筆記 · 2026年8月7日 · 論文 · 2026 · Retrieval Systems

    拆解 RubricRanker 如何用 query-specific search rubrics、SFT 與 GRPO 訓練文件 reranker,並檢查它在 deep research 與 RAG benchmark 上真正改善了什麼。

    90 秒掌握這篇論文
    問題
    傳統 reranker 逐份文件評 relevance,卻不保證 top-k 合起來完整、精簡、一致且權威。
    核心洞見
    把輸出目標從「文件排名」改成「共同支撐答案的 evidence set」,並用 query-specific rubrics 產生集合標籤與 reward。
    最強證據
    Table 1--3 顯示下游分數提升,且 ablation 指向 rubric labels 與 cold-start SFT,而不是 RL 單獨創造效果。
    主要邊界
    最終答案仍由 Agent 與 LLM judge 評分;較好的 evidence set 不等於引用、推理或事實都正確。
    進入完整精讀
  • OSReward 論文精讀:為什麼 Agent 的成功不能只交給另一個模型判斷?

    進階 Agent Runtime、安全與評測
    Agent 評測 · Part 1 · 筆記 · 2026年8月2日 · 論文 · 2026 · AI Agent

    完整拆解 OSReward 的資料建構、27 個 VLM judges、Hard/Multi 子集、錯誤與成本分析、OS-Shepherd-100K 訓練,並延伸成可部署的混合驗證架構。

    90 秒掌握這篇論文
    核心洞見
    先用人工 gold benchmark 拆出 false-success 偏誤,再把可驗證狀態、model judge 與人工仲裁放進不同證據層。
    最強證據
    Table 1 與 Figure 5--7 顯示完整集接近 90% 的 judge 到 Hard set 只剩約 70%,錯誤集中在 failure recall 與跨平台失敗類型。
    主要邊界
    OS-Shepherd 改善成本與部分準確率,但資料標籤仍來自 strong-judge agreement,完整 artifact 與 production verifier 都未齊備。
    Accuracy
    整體 verdict 正確率。
    進入完整精讀
  • Beyond RAG for Agent Memory:xMemory 詳細筆記

    中階 理解檢索、記憶與 Production RAG
    Beyond RAG for Agent Memory 精讀 · Part 1 · 筆記 · 2026年3月24日 · 論文 · 2026 · NLP

    依 arXiv:2602.02007 解讀 xMemory 四層階層、sparsity–semantics 目標、兩階段 top-down 檢索,以及 LoCoMo/PerLTQA 實證。

    90 秒掌握這篇論文
    問題
    agent memory 是有時間連續性、近重複且高度相關的互動流;固定 top-k chunks 容易集中在同一局部,pruning 又可能切斷時間依賴。
    核心想法
    xMemory 將 raw messages decouple 再 aggregation 成 message、episode、semantic、theme 四層,以 sparsity–semantics objective 指導 split/merge,並 top-down 逐層縮小到需要的細節。
    最強證據
    論文在 LoCoMo、PerLTQA 與長對話設定比較 memory baseline;Table 1、Figure 2、Figure 3 與 Appendix ablation 分別支援層級、檢索與效率論述。
    邊界
    階層品質依賴 segmentation、embedding 與 token budget;benchmark QA 分數不直接證明真實 agent 能安全地更新或治理長期記憶。
    進入完整精讀
  • RAG vs GraphRAG:系統性對照與混合策略(詳細筆記)

    中階 理解檢索、記憶與 Production RAG
    GraphRAG vs RAG 精讀 · Part 1 · 筆記 · 2026年3月24日 · 論文 · 2025 · NLP

    依 arXiv:2502.11371 解讀統一評估協議、四類 GraphRAG、Table 1–5 數字、效率 trade-off 與 Selection/Integration 混合策略。

    90 秒掌握這篇論文
    問題
    不同 GraphRAG 系統同時改變圖建構、檢索、context budget 與生成流程,單看個別論文很難回答何時值得付圖的成本。
    核心想法
    在統一 preprocessing、retrieval budget 與 generation script 下,將 RAG 與 KG-based、community-based、text-centric、hierarchical GraphRAG 分開測,並提出 Selection/Integration hybrid。
    最強證據
    QA 與 query-based summarization 的比較用 Table 1–5、Section 4–5 與效率分析顯示優勢依 query type、global context 與建圖成本而變。
    邊界
    受測系統、語料、Llama-3.1-8B-Instruct 與固定預算限制外推;benchmark win 不等於圖會在你的文件或 SLA 下有 ROI。
    進入完整精讀
  • RAG-Anything:多模態文件檢索不只是把圖片轉成文字

    中階 理解檢索、記憶與 Production RAG
    RAG-Anything 精讀 · Part 1 · 筆記 · 2026年3月23日 · 論文 · 2025 · NLP

    以論文、附錄與官方程式庫為據,拆解 RAG-Anything 的雙圖索引、實驗證據、失敗案例與工程採用邊界。

    90 秒掌握這篇論文
    問題
    傳統方法把圖片與表格壓成 caption 後,常遺失 cell、panel、axis 與跨頁關係。
    核心洞見
    用文字代理負責檢索,但保留可回指的原始圖表;再讓顯式圖關係與 dense similarity 共同找證據。
    最強證據
    Table 2--4 與 Figure 2 顯示完整系統整體領先,主要收益來自 graph construction,長文件切面差距更明顯。
    主要邊界
    拒答、parser 錯誤、entity alignment、成本與 latency 都沒有被總體 accuracy 解決。
    進入完整精讀
  • RAG-MCP:用檢索縮小工具發現,但不能忽略路由失敗

    中階 理解檢索、記憶與 Production RAG
    RAG-MCP 深度精讀 · Part 1 · 筆記 · 2026年3月23日 · 論文 · 2025 · NLP

    以論文證據檢視 RAG-MCP 的工具路由流程、11,100 候選壓力測試、MCPBench 結果、規模退化與未釋出 artifact。

    90 秒掌握這篇論文
    問題
    把大量 MCP tool schema 全塞進 prompt,會增加 token、distractor 與錯誤選 tool 的機會。
    核心想法
    先將 MCP metadata 建索引,query 時 retrieve top-k candidate schema,再讓 executor 在小候選集內 validate 與 invoke;retrieval 是 candidate generation,不是授權決策。
    最強證據
    MCPBench web-search 設定中,論文報告 RAG-MCP 的 ground-truth MCP top-1 accuracy 43.13%,對 keyword pre-filter 18.20%、all-schema prompting 13.62%(Section 4.2、Table 1)。
    邊界
    v1 的 retriever metadata、embedding/version、schema drift、permission、p95 latency 與真實 invocation success 未完整公開;top-1 route 不是 task success。
    進入完整精讀
  • RAG without Forgetting:把成功的 Query Expansion 寫回索引,但不要把錯誤也寫進去

    中階 理解檢索、記憶與 Production RAG
    RAG without Forgetting 深度精讀 · Part 1 · 筆記 · 2026年3月23日 · 論文 · 2026 · NLP

    以論文證據檢視 ERM 的 correctness gate、選擇性歸因、有界 key update、BEIR/BRIGHT 結果與未釋出 artifact。

    90 秒掌握這篇論文
    問題
    query expansion 可改善 query–document mismatch,卻要每次重新生成;持久 key expansion 又容易把錯誤 feedback 寫入 index。
    核心想法
    ERM 只接受通過 correctness gate 的 expansion unit,並把它歸因給真正提高 similarity 的 document key,再做 bounded update;它更新 key,不重訓 retriever。
    最強證據
    作者在 13 個 BEIR/BRIGHT domain 報告 retrieval 與 generation 結果,並在 Table 1、Table 2、Figure 3 與 Appendix B.9 分別呈現品質、延遲、budget 與 transfer。
    邊界
    公開論文沒有 implementation、live A/B、attack/privacy/rollback study;gate 的錯誤會把錯誤關聯變成持久 index state。
    進入完整精讀
  • AlexNet(下):把可訓練化配方拆成可驗證的設計

    中階 先建立方法閱讀底座
    AlexNet 精讀 · Part 2 · 筆記 · 2026年3月19日 · 論文 · 2012 · CV

    從 Figure 1–3、Sections 3–6 重讀 ReLU、多 GPU、overlapping pooling、資料增強與 dropout 的證據。

    90 秒掌握這篇論文
    問題
    60M-parameter CNN 即使有 1.2M images 仍會過擬合;也需要把訓練 recipe 與 competition result 分開解讀。
    核心想法
    以 random crop/flip、RGB PCA lighting jitter 與 dropout 擴增或正規化有效訓練分布,再用 SGD、momentum、weight decay 和 learning-rate schedule 讓 Part 1 的架構收斂。
    最強證據
    color augmentation 讓 top-1 error 降超過 1%,overlapping pooling 降 0.4/0.3 points;最終 ILSVRC-2010 37.5/17.0,2012 top-5 15.3(Section 4–6、Table 1)。
    邊界
    這些 ablation 多在當年的 architecture/data/compute 組合;不代表每個 modern vision model 都需要 ten-crop、LRN 或相同 learning-rate heuristic。
    進入完整精讀
  • AlexNet(上):先用證據讀懂它為何改變 ImageNet

    入門 先建立方法閱讀底座
    AlexNet 精讀 · Part 1 · 筆記 · 2026年3月18日 · 論文 · 2012 · CV

    以論文可定位證據重讀 AlexNet 的問題、評測與歷史性結果:它證明了什麼,也沒有證明什麼。

    90 秒掌握這篇論文
    問題
    在 2012 年,用百萬級高解析影像訓練深 CNN 同時受限於優化速度、GPU 記憶體與過擬合。
    核心想法
    AlexNet 不是單一「大網路」技巧,而是將卷積的局部歸納偏好、ReLU、兩張 GPU 的受限分割與可擴大的八層架構組成可訓練系統。
    最強證據
    ILSVRC-2010 的 top-1/top-5 error 為 37.5%/17.0%;2012 competition top-5 為 15.3%,次名為 26.2%(Section 6、Table 1)。
    邊界
    LRN、雙 GPU split 與部分 kernel 設計是當年硬體折衷;這篇不主張它們在現代 accelerator 或所有視覺任務仍是最佳選擇。
    進入完整精讀

RESEARCH EXCHANGE

把論文變成可以落地的工程討論

演講與聯絡