PAPERS / REPRODUCTION / ENGINEERING NOTES
為工程實作而讀的論文
不只摘要論文,而是整理架構決策、可複現方法、評測限制,以及研究進入真實系統後會發生什麼。
- 篇精讀筆記
- 80
- 個研究議題
- 7
- 條學習路徑
- 3
READING LIBRARY
論文精讀封存|第 2 頁
顯示第 25–48 篇,共 80 篇。
-
RAGSieve 論文精讀:用局部對比偵測 RAG 知識投毒
進階 理解檢索、記憶與 Production RAG深讀 RAGSieve:以同一個檢索事件的 retrieval tail 與同一個語料鄰域作為局部對照,在 query-time 與 corpus-time 找出可疑的排名推升;同時釐清投毒偵測不是事實查核。
90 秒掌握這篇論文
-
BTS-AgentBench 論文精讀:從遙測紀錄建立可重播的 Agent 評測
進階 Agent Runtime、安全與評測精讀 Jeong-Yoon Kim 的 BTS-AgentBench(arXiv:2608.27334 v1):從 BTS 建築遙測建立只讀工具、可執行任務、有限互動契約與證據化評測;精確重播很強,但不等於生產安全或任意領域的可攜性。
90 秒掌握這篇論文
-
Agentic RAG 論文精讀:失敗傳播與因果歸因
進階 理解檢索、記憶與 Production RAG深讀 When Failures Propagate:用介入式 benchmark、三跳 MuSiQue 與 certified content corruption,拆開 Agentic RAG 的失敗偵測、因果歸因、傳播與恢復。
90 秒掌握這篇論文
-
ACE 論文精讀:簡報編輯 Agent 的結構理解與自我修正
進階 Agent Runtime、安全與評測ACE 如何以階層式 scene graph、CARE 與指令遵循 judge 建立可路由、可差分、可回溯的簡報編輯閉迴路;並釐清評測與重現邊界。
90 秒掌握這篇論文
-
Agent 工具呼叫成功卻工作流程失敗:外部效應異常論文精讀
進階 Agent Runtime、安全與評測深讀 Agent–Tool Boundary 的 effect-history 模型:為什麼單次 tool call 回傳成功,仍不足以保證長流程的外部世界狀態一致,以及 MCP annotation 與交易式工具契約究竟填補了哪些空白。
90 秒掌握這篇論文
-
EvoOntology 論文精讀:資料 Agent 的自我演化本體層
進階 理解檢索、記憶與 Production RAGEvoOntology 如何把異質資料的 ontology 封裝成 MCP server,建立有證據依據的初始結構,再以可歸因的 typed edits 與成對閘門持續演化。
90 秒掌握這篇論文
-
Corrupt Plans, Clean Traces 論文精讀:計畫注入與思維鏈監控
進階 Agent Runtime、安全與評測Plan Injection 如何讓惡意計畫在 context 中影響行為,卻留下看似自然的推理軌跡;並說明這對 Chain-of-Thought 監控與因果判讀的限制。
90 秒掌握這篇論文
-
K-Bench 論文精讀:Agent 部署情境的 LLM 遺忘評測
進階 Agent Runtime、安全與評測K-Bench 如何跨多個可觀測通道與記憶介質測試 Agent unlearning,並區分真正遺忘、資訊轉移到其他通道,以及 Agent 本身崩潰。
90 秒掌握這篇論文
-
REVA 論文精讀:重用證據視圖以壓縮 RAG 上下文
進階 理解檢索、記憶與 Production RAGREVA 如何把生成器注意力歷史整理成以文件為鍵的分數庫,重用 RAG 證據視圖;並檢查新文件 fallback、預算、品質與延遲取捨。
90 秒掌握這篇論文
-
VikingRAG 論文精讀:結構化文件檢索與 Token 效率
進階 理解檢索、記憶與 Production RAG深讀 VikingRAG:把文件階層保留在 URI 可定位的外部 storage,以 Search、List、Grep、Read 支援 evidence-gap retrieval,再用 experience edges 與 adaptive escalation 降低重複探索的 token 與延遲。
90 秒掌握這篇論文
-
DRACO 論文精讀:用動態評分規準分配 Agent 訓練回饋
進階 Agent Runtime、安全與評測精讀 DRACO(arXiv:2609.04094):在沒有 ground-truth verifier 的長程工具任務中,動態產生每條 rollout 的 rubric,再把 trajectory-level advantage 依 judge 指出的步驟重新分配給 GRPO。
90 秒掌握這篇論文
-
CONTINUITY 論文精讀:Agent 組合中的安全上下文與授權契約
進階 Agent Runtime、安全與評測CONTINUITY 如何用安全上下文契約、欄位來源、轉換見證與 effect-bound permit,檢查 LLM Agent 從指令到外部副作用的授權連續性。
90 秒掌握這篇論文
-
Parsing the Stream 論文精讀:長期 Agent 的即時狀態與執行軌跡
進階 Agent Runtime、安全與評測Parsing the Stream 如何把 append-only trace 摺疊成 typed RunState,再產生 observer 與 worker 視圖;並檢查長程任務收益與固定彙總的適用邊界。
90 秒掌握這篇論文
-
Generative Agents 論文精讀:以記憶、反思與計畫模擬人類行為
中階 Agent Runtime、安全與評測Generative Agents 如何用記憶串流、反思與規劃模擬 Smallville 中的社會互動;並解讀消融實驗與兩天沙盒觀察所支持的行為證據。
90 秒掌握這篇論文
-
Deep Residual Learning for Image Recognition 精讀:ResNet 殘差連接
中階 先建立方法閱讀底座ResNet 如何用恆等捷徑學習殘差,緩解深層 plain network 的退化問題;並從 ImageNet 實驗理解這項證據的年代與任務邊界。
90 秒掌握這篇論文
-
YOLO 論文精讀:單次前向運算的即時物件偵測
中階 先建立方法閱讀底座YOLO 如何把物件偵測改寫成單次前向傳播的迴歸問題,並在速度與定位誤差間取捨;本文聚焦原始版本,不混用後續 YOLO 系列結果。
90 秒掌握這篇論文
-
Attention Is All You Need 精讀:Transformer 與自注意力機制
中階 先建立方法閱讀底座解讀 Transformer 原始論文的多頭自注意力、位置編碼與編碼器-解碼器架構,並解析機器翻譯實驗、訓練效率與方法限制。
90 秒掌握這篇論文
-
InstructGPT 論文精讀:RLHF 與人類回饋的指令對齊
中階 先建立方法閱讀底座InstructGPT 如何用示範微調、reward model 與 PPO 讓 GPT-3 更符合人類偏好;並解讀偏好勝率、標註分佈與安全評測涵蓋的範圍。
90 秒掌握這篇論文
-
推測解碼(Speculative Decoding)論文精讀:大小模型協作加速推論
中階 先建立方法閱讀底座Speculative decoding 如何讓小模型先打草稿、目標模型平行驗證,再用 rejection sampling 保持輸出分佈;並拆解加速成立的條件與成本。
90 秒掌握這篇論文
-
間接提示注入論文精讀:LLM 應用的外部內容攻擊
中階 Agent Runtime、安全與評測間接提示注入如何藉由網頁、郵件或工具輸出,把未受信資料送進模型的指令通道;本文整理攻擊面、實證案例與應用控制邊界。
90 秒掌握這篇論文
-
ReAct 論文精讀:結合推理與行動的語言模型提示方法
中階 Agent Runtime、安全與評測ReAct 如何把自然語言推理與環境行動交錯,讓模型在問答與互動任務中規劃、觀察再修正;並解析搜尋失敗、幻覺與評測設定。
90 秒掌握這篇論文
-
Toolformer 論文精讀:語言模型如何自監督學習使用工具
中階 Agent Runtime、安全與評測Toolformer 如何用未來 token 損失篩選工具呼叫,讓語言模型自監督學會使用問答、搜尋、計算機、日曆與翻譯 API。
90 秒掌握這篇論文
-
SWE-bench 論文精讀:用 GitHub 真實問題評測程式修復能力
中階 Agent Runtime、安全與評測SWE-bench 如何以真實 GitHub issue、完整 Python 倉庫與測試評測程式修復能力,並說明檢索方式、測試協議與解題率的關係。
90 秒掌握這篇論文
-
Reflexion 論文精讀:以語言回饋與記憶改善 Agent 任務表現
中階 Agent Runtime、安全與評測Reflexion 如何在不更新模型權重的情況下,把自我回饋寫入 episodic memory,跨多次嘗試修正策略;並比較程式與互動任務的成效差異。
90 秒掌握這篇論文
RESEARCH EXCHANGE