檢索系統
系列 · 3 篇
-
AskChem:把文獻檢索單位改成帶來源的 claim
進階 理解檢索、記憶與 Production RAG精讀 AskChem 如何以帶有 DOI、原文引句與 evidence locator 的 atomic claim 取代 paper/chunk 作為檢索單位,並檢查它在 30 題 AskChem-Bench 上改善了什麼、沒有證明什麼。
90 秒掌握這篇論文
- 問題
- paper/chunk retrieval 讓讀者或 agent 自己找證據句、判斷 claim 是否可定位、再跨 paper 合成。
- 核心想法
- AskChem 將帶 DOI、quote/evidence locator 與類型的 atomic claim 作為檢索單位,接上 taxonomy、evidence graph 與同一組 REST/SDK/MCP interface。
- 最強證據
- 2.4M claims、147K papers 的系統,在 30 個 chemistry synthesis questions 上報告 AskChem-grounded answer 的 DOI resolvability 100%,LLM-only 為 88.3%(Section 7、Table 1)。
- 邊界
- DOI 可解析與 citation density 是 provenance proxy,不是 claim 事實正確、完整文獻覆蓋或化學結論可用性的證明。
-
BM25 在大規模語料中勝出:RAG 範式的擴展研究
中階 理解檢索、記憶與 Production RAG深讀 Wang 等人的 arXiv v3 研究:在固定問題、證據與對抗文件的 28 層企業型語料梯度上,BM25 如何跨過約 1,000 萬語料 token 的交叉點,以及為什麼 agent 應該接在全域候選排序之後。
90 秒掌握這篇論文
- 問題
- RAG paradigm 常只在單一 corpus size 比較,無法看見 accuracy、construction cost、query cost 與 latency 如何一起隨資料量變化。
- 核心想法
- 以 28 個 nested corpus tiers(1,144 到 511,959 documents)固定 reader/judge 與 adversarial bedrock,比較 lexical、dense、graph、file-system agency;再以 retrieval-swap control 隔離 access substrate。
- 最強證據
- 在 shared large tiers,作者報告 BM25 約在 10M corpus tokens 超過 raw file-system agency;matched 150-question resweep 中 Agent+BM25 69.4、raw-file agency 36.9(Section 5.1、Figure 4、Table 4)。
- 邊界
- EnterpriseRAG-Bench 是 fictional enterprise-shaped corpus、500 questions 和一個主 reader/judge;公開 executable benchmark/data artifact 未確認,不能轉寫成普遍「BM25 永遠贏」。
-
RubricRanker 論文精讀:RAG 需要的不是最相關文件,而是對的文件集合
進階 理解檢索、記憶與 Production RAG拆解 RubricRanker 如何用 query-specific search rubrics、SFT 與 GRPO 訓練文件 reranker,並檢查它在 deep research 與 RAG benchmark 上真正改善了什麼。
90 秒掌握這篇論文
- 問題
- 傳統 reranker 逐份文件評 relevance,卻不保證 top-k 合起來完整、精簡、一致且權威。
- 核心洞見
- 把輸出目標從「文件排名」改成「共同支撐答案的 evidence set」,並用 query-specific rubrics 產生集合標籤與 reward。
- 最強證據
- Table 1--3 顯示下游分數提升,且 ablation 指向 rubric labels 與 cold-start SFT,而不是 RL 單獨創造效果。
- 主要邊界
- 最終答案仍由 Agent 與 LLM judge 評分;較好的 evidence set 不等於引用、推理或事實都正確。
歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。
演講與聯絡