PAPERS / REPRODUCTION / ENGINEERING NOTES
為工程實作而讀的論文
不只摘要論文,而是整理架構決策、可複現方法、評測限制,以及研究進入真實系統後會發生什麼。
- 篇精讀筆記
- 80
- 個研究議題
- 7
- 條學習路徑
- 3
READING LIBRARY
論文精讀封存|第 3 頁
顯示第 49–72 篇,共 80 篇。
-
MemGPT: Towards LLMs as Operating Systems 精讀:LLM 記憶體分層
中階 Agent Runtime、安全與評測MemGPT 如何把有限 context 視為工作記憶,以作業系統式分層與函式呼叫管理外部記憶;並解析長對話與多跳查詢的實驗邊界。
90 秒掌握這篇論文
-
思維鏈(Chain-of-Thought)論文精讀:提示如何引導多步推理
中階 Agent Runtime、安全與評測Chain-of-Thought prompting 如何用 few-shot 中間步驟引導大型語言模型進行多步推理,並解析模型規模、任務類型與提示效果的關係。
90 秒掌握這篇論文
-
WebGPT 論文精讀:結合瀏覽器檢索與人類回饋的問答模型
中階 Agent Runtime、安全與評測WebGPT 如何讓模型操作文字瀏覽器,學會搜尋、引用與回答;並釐清人類偏好評測能證明什麼,以及它與 ReAct 代理迴圈的差異。
90 秒掌握這篇論文
-
RAG 論文精讀:檢索增強生成的架構與運作原理
中階 理解檢索、記憶與 Production RAG回到 RAG 原始論文,理解 dense retriever 如何與 BART 聯合生成、RAG-Sequence 與 RAG-Token 的差別,以及這套方法和現代 RAG 平台的邊界。
90 秒掌握這篇論文
-
DPR 論文精讀:雙編碼器與開放域問答的稠密檢索
中階 理解檢索、記憶與 Production RAGDPR 如何用問題/段落雙編碼器、in-batch negatives 與 MIPS 改善開放域問答檢索;並拆解檢索命中率與端到端回答品質的差距。
90 秒掌握這篇論文
-
Self-RAG 論文精讀:用反思標記學習檢索、生成與評判
中階 理解檢索、記憶與 Production RAGSelf-RAG 如何用 reflection tokens 決定何時檢索,並評估內容是否相關、有證據支持且有用;同時說明它與完整 RAG 平台及工具代理的差異。
90 秒掌握這篇論文
-
REALM 論文精讀:檢索增強語言模型的預訓練方法
中階 理解檢索、記憶與 Production RAGREALM 如何以遮罩語言模型訊號共同訓練知識檢索器,並用非同步索引支援開放域問答;也比較它與 RAG、DPR 在訓練成本和用途上的差異。
90 秒掌握這篇論文
-
Gorilla 論文精讀:LLM 的 API 檢索與工具呼叫
中階 Agent Runtime、安全與評測Gorilla 如何結合 API 文件檢索與微調,讓模型產生較可核對的 API 呼叫;並解讀 APIBench 對目錄級工具選擇與參數生成的評測範圍。
90 秒掌握這篇論文
-
MidTool 論文精讀:用中期訓練改善 Agent 工具使用
進階 Agent Runtime、安全與評測深讀 MidTool:用 20.3B-token、11.22M-sample 的工具使用語料,把 schema grounding、工作流組合與不完整資訊下的恢復能力提前教給模型;但 web-search 仍是 0%。
90 秒掌握這篇論文
-
SWE-Bench ProMax 論文精讀:程式 Agent 的大型多語言重構評測
進階 Agent Runtime、安全與評測深讀 SWE-Bench ProMax:以 170 個跨檔案、多語言、行為保持的程式重構任務,檢驗 coding agent 是否能完成大型變更,而不只修好一個測試。
90 秒掌握這篇論文
-
ADIAS 論文精讀:以問題修復驅動 Agent 自我改進
進階 Agent Runtime、安全與評測深讀 ADIAS:以持續的 issue state 組織跨回合失敗證據,讓 full-code agent optimization 能記住修過什麼、哪些介入失效,以及何時真的修好。
90 秒掌握這篇論文
-
DocMemo 論文精讀:多模態文件的記憶引導檢索
進階 理解檢索、記憶與 Production RAG深讀 DocMemo:用 document schema、page belief 與 question episodic memory 保存跨回合 retrieval state,再以 Bayesian update、Thompson sampling 與 adaptive granularity 找回遺漏證據。
90 秒掌握這篇論文
-
ACM 論文精讀:Agent 系統的組態管理與治理模型
進階 Agent Runtime、安全與評測Agentic Configuration Management 如何用跨框架組態圖、不可變版本、相依影響傳播與 runtime provenance,治理異質 Agent 設定。
90 秒掌握這篇論文
-
FinRank 論文精讀:金融文件檢索與重排序評測
中階 理解檢索、記憶與 Production RAG精讀 FinRank:用公司、年度與披露邊界構造金融文件檢索測試,說明為什麼 pooled corpus、hard negatives 與 metadata filter 會改變企業 RAG 的結論。
90 秒掌握這篇論文
-
An End-to-End Agent Auditing Engine 精讀:A²E 評測與稽核
中階 Agent Runtime、安全與評測精讀 A²E:以 ATP 統一 benchmark 與 agent harness,用 span-based trace 保存執行因果,再以 lifecycle-aligned metrics 分析正確性、工具行為、成本與安全。
90 秒掌握這篇論文
-
ContextWeave 論文精讀:長期 Agent 的工作流程與記憶評測
進階 Agent Runtime、安全與評測拆解 ContextWeave 如何把多月工作流重建成可執行 benchmark,並檢驗記憶對工作區結果、偏好一致性、連續性與誤導風險的真實影響。
90 秒掌握這篇論文
-
Argus 論文精讀:長期推理 Agent 的執行環境
進階 Agent Runtime、安全與評測拆解 Argus 的 Manager–Planner–Engineer–Reviewer runtime、持久狀態、驗證式演化與 rollback,並區分 benchmark 結果、作者自營案例與尚未證明的自我學習主張。
90 秒掌握這篇論文
-
AskChem 論文精讀:以主張為單位整合化學文獻
進階 理解檢索、記憶與 Production RAG精讀 AskChem 如何以帶有 DOI、原文引句與 evidence locator 的 atomic claim 取代 paper/chunk 作為檢索單位,並檢查它在 30 題 AskChem-Bench 上改善了什麼、沒有證明什麼。
90 秒掌握這篇論文
-
AgentS4D 論文精讀:LLM Agent 執行生命週期的安全風險
進階 Agent Runtime、安全與評測拆解 AgentS4D 如何把 workspace agent 的風險入口、誘導策略、目標傷害與生命週期證據放進同一個 sandbox benchmark,並檢查完成率為什麼不能代表安全。
90 秒掌握這篇論文
-
BM25 Wins at Scale 論文精讀:大規模語料下的 RAG 檢索比較
中階 理解檢索、記憶與 Production RAG深讀 Wang 等人的 arXiv v3 研究:在固定問題、證據與對抗文件的 28 層企業型語料梯度上,BM25 如何跨過約 1,000 萬語料 token 的交叉點,以及為什麼 agent 應該接在全域候選排序之後。
90 秒掌握這篇論文
-
AgentTrajectorySentinel 論文精讀:LLM Agent 失敗的即時偵測與修復
進階 Agent Runtime、安全與評測精讀 AgentTrajectorySentinel 如何用健康軌跡訓練的低成本時間監控器、決定性驗證與 rollback-and-retry,在不逐步呼叫 LLM judge 的情況下提早攔截失敗;同時拆開它的校準依賴、內容盲點、修復實驗與可重現性邊界。
90 秒掌握這篇論文
-
Before Reasoning Can Fail 論文精讀:Agentic RAG 的證據取得失敗
進階 理解檢索、記憶與 Production RAG精讀 Before Reasoning Can Fail 如何把『搜尋後沒有讀證據就回答』拆成可觀測的軌跡失敗,並檢驗 Read-Gate 是否真的改善多跳問答。
90 秒掌握這篇論文
-
PAST-Bench 論文精讀:個人 Agent 的遞迴自我改進評測
進階 Agent Runtime、安全與評測深讀 PAST-Bench 如何用 fresh-session task families、matched persistence controls 與 trace-level mechanism evidence,分辨 Agent 變好是因為保留經驗,還是只是分數變高。
90 秒掌握這篇論文
-
RubricRanker 論文精讀:深度研究 Agent 的文件重排序
進階 理解檢索、記憶與 Production RAG拆解 RubricRanker 如何用 query-specific search rubrics、SFT 與 GRPO 訓練文件 reranker,並檢查它在 deep research 與 RAG benchmark 上真正改善了什麼。
90 秒掌握這篇論文
RESEARCH EXCHANGE