序列建模基礎
從經典 encoder–decoder 與 self-attention 架構出發,建立判讀序列轉換論文的底座。
讀者問題:一個序列模型的控制點改在哪裡,哪些證據仍值得帶進今天的系統?
查看這個主題PAPERS / REPRODUCTION / ENGINEERING NOTES
不只摘要論文,而是整理架構決策、可複現方法、評測限制,以及研究進入真實系統後會發生什麼。
READING LIBRARY
可依研究領域、閱讀難度或論文發表年份篩選。
Raven 把可執行的模型與 harness 配成專才,再由 Host Agent 規劃合作 DAG。本文拆解 harness composition、MAOB 評測與 +10.4/+10.5 個百分點的真正分母:它衡量規劃圖匹配,不是 worker 執行成功率。
EfficientAgent 說明 KV cache 從 GPU 搬到 host memory 何時真的划算:關鍵不是單次請求,而是其他並行 Agent 在兩次重用之間形成的 reuse working set。本文拆解容量估算、寫入 admission、SWE-bench replay 結果與硬體邊界。
真實、曾經正確的文件也可能讓 RAG 把模型原本答對的答案改錯。本文拆解 317 個跨領域知識反轉、日期與有效期間的差異、因果介入,以及依賴可信 metadata 的 reranker。
ReVerPi 的單次 source-reading campaign 揭示:第一個配對分支碰到 request cap 時,runner 會抑制 companion,讓 completed-pair summary 遺漏已知失敗與未知結果;有限 frame bounds 與分層成本分析說明結論能走多遠。
精讀 SpecHarness 如何把 agent 可見的指示編成來源可追溯的義務,並以合格證據提交狀態;同時檢視 SkillsBench 與 GuideBench 結果、執行成本與完整 runtime 歸因限制。
精讀 arXiv v1 如何在十組本機 coding-agent harness、受控容器與四種攻擊路徑中測試 trace tampering,並拆解 native trace、外部檔案 observer 與工具效果證據的差異。
深讀 arXiv v1 如何比較 dsh 外掛遷移 skill 的靜態診斷分數,並以契約反例、任務集中度、LLM 評審敏感度與 artifact 範圍限制解讀其證據。
精讀 arXiv 2608.16586 v1:八種切塊策略如何影響檢索品質、索引吞吐、查詢速度與記憶體,以及這組基準能支持到哪裡。
當 Agent 只驗證部分限制時,過期但彼此一致的規則為何仍會被接受;本文拆解不可變來源、追加式取代、有限驗證預算與合成實驗適用範圍。
深讀 APort Vault:把付款請求、付款成功、政策判斷、收款人白名單與未授權轉帳拆開,檢視模型外的 pre-action authorization 在限定 replay 中做到了什麼,以及哪些工程與證據邊界仍在。
深讀 Trajectory-Aware Benchmark Subset Selection:解析歷史 outcome 分層、軌跡去洩漏與幾何選樣,檢視 76 種配置、時間交叉驗證、成本與跨任務邊界。
深讀 MobileCybench:以 13 款 Android app、495 個安全性 probes 評估五種 coding agents,拆清 probe 觸發、漏洞歸因、維護者確認與外推邊界。
精讀 Wu 等人的 XYEval(arXiv 2609.23939 v1):以受控 XY mutation 比較五個模型在六類任務的表現,追蹤誤導建議如何影響任務完成、對話表達與工具軌跡,並檢視基準和生成器的邊界。
深讀 The RAT:以聯合 Bayesian 模型拆分 retrieval、abstention 與 answer correctness,並檢視標註預算、LLM judge 校準、partial retrieval 與其受控 Wikipedia 評估邊界。
精讀 Prime Agent(arXiv 2608.23552 v1):拆解 L0–L3 狀態層級、持續 REPL、遞迴 subagents 與 Continual Harness,並檢視作者自報評測、持續性帶來的規格鑽漏洞風險,以及未沙箱化執行的部署邊界。
Self Improvement via Fast Tree-search 如何用成對 judge、Bradley–Terry 排名與非同步搜尋篩選 Agent patch,再把昂貴評測留給較有希望的候選。
深讀 BioPhys-Bridge(arXiv:2609.19180 v1):把 evidence ID、數值與單位、物理方程、假設、生物機制與下一步實驗放進同一個 benchmark case,並拆開 attribution 分數與真正的 scientific correctness。
深讀 RAFT:A Stateful Retrieval-Augmented Framework for Troubleshooting Agents(arXiv:2609.20754):把封閉支援案例整理成狀態轉移軌跡,在 entry level 檢索中間狀態,再回傳完整 parent case。
SCOPE 如何用配對情境與偏好訓練,降低模型被誤導 context 翻轉正確答案的機率;並保留純文字測試、資料污染與實際發生率的限制。
Bounded Agents 如何用 principal chain、合取式授權條件與 composition closure,限制多 Agent 委派及跨步驟副作用;並檢查模型外強制與效用成本。
Hypothetical Prompt Embeddings 如何替每個 chunk 生成假設問題,把文件檢索改成問題對問題比對;並評估索引成本、切塊與不同資料集的收益差異。
深讀 After the Party 的 OpenClaw/ClawHub 生態研究:從 91 天的爆發式成長、下載集中與 reviewability gap,到 privilege evidence、掃描器分歧與可轉移的治理方法。
如何從 Agentic RAG 的中間答案與軌跡訊號預測品質和效用,提早停止檢索迭代;並檢查節省成本的證據及跨設定轉移限制。
SilentProbe 如何從 OpenAPI 規格缺口與 live differential probe 找出沉默 API 失敗,並解釋限制揭露與機器可讀性如何影響 Agent 判斷。
已顯示 24 / 80 篇精讀
依研究議題探索
每日新文章仍在下方;這些主題入口會收錄所有相關精讀,一篇論文也可以同時回答多個工程問題。
從經典 encoder–decoder 與 self-attention 架構出發,建立判讀序列轉換論文的底座。
讀者問題:一個序列模型的控制點改在哪裡,哪些證據仍值得帶進今天的系統?
查看這個主題從經典視覺模型的架構、訓練與評測證據,建立判讀方法論文的底座。
讀者問題:一個經典模型的結果,哪些設計與證據仍值得帶進今天的系統?
查看這個主題探索多模態檢索、GraphRAG、重排、證據發現與可追溯回答的工程取捨。
讀者問題:如何讓系統在更大的資料與更多工具下,仍找得到可驗證的證據?
查看這個主題從任務結果、軌跡、runtime 訊號到 benchmark,拆解 Agent 是否真的可靠。
讀者問題:除了最後答案,我們還要觀察與驗證哪些訊號,才能相信 Agent 完成了工作?
查看這個主題理解長期任務中的記憶層次、索引更新、持久狀態與安全的系統適應。
讀者問題:系統要記住、更新或遺忘什麼,才能隨時間變好而不累積錯誤?
查看這個主題從風險注入、稽核、權限與 rollback,檢視 Agent 在真實執行環境的控制邊界。
讀者問題:任務完成之外,如何證明 Agent 的過程、記憶與副作用仍在可控範圍?
查看這個主題研究工具發現、schema context、程式任務與可驗證執行如何共同影響 Agent 表現。
讀者問題:當 Agent 要選工具、改程式並執行時,如何降低 context 與操作錯誤?
START WITH A PATH
三條有限路徑把文章庫變成有順序的學習旅程;從適合的難度開始,讀到取得需要的工程答案即可。
若你剛讀完 ReAct 到 Reflexion,需要一張脊椎圖說明這些經典怎麼接到站上後續精讀,請先看 AI Agent 論文怎麼讀:從 CoT、WebGPT 到 ReAct,不必從路徑三的 OSReward 清單開始。若你剛讀完 DPR 與 Lewis RAG,需要檢索脊椎接到站上已有葉子,請用 RAG 論文怎麼讀:從向量檢索 DPR 到 Lewis RAG,不要把路徑二當成那張家族圖。
從 AlexNet 的架構與訓練證據出發,接著讀 ResNet 如何用殘差捷徑讓更深網路可訓、YOLO 如何把物件偵測改成整圖一次迴歸,再到 Transformer 如何用 self-attention 做序列轉換、InstructGPT 如何用 SFT/reward model/PPO 對齊指令,最後讀 Speculative Decoding 如何用小模型打草稿、大模型平行驗證做無損推論加速,並練習把方法、實驗與年代限制分開。
+ 4 個後續步驟
從這裡開始從 2020 昂貴的檢索增強預訓練(REALM)到較便宜的 dense retriever(DPR)、RAG 祖先與 Self-RAG 的何時檢索,然後讀多模態解析、工具檢索、持續記憶、GraphRAG、規模化與 runtime control。
+ 24 個後續步驟
從這裡開始先讀 2017–2023 Agent 方法祖先(CoT → WebGPT → ReAct → Toolformer → Gorilla → IPI → SWE-bench → Reflexion → MemGPT → Generative Agents),再讀後來的 tool/eval、runtime、安全與平台葉子。
+ 37 個後續步驟
從這裡開始RESEARCH EXCHANGE