← 返回論文精讀

  • AskChem:把文獻檢索單位改成帶來源的 claim

    進階 理解檢索、記憶與 Production RAG
    檢索系統 · Part 1 · 筆記 · 2026年8月7日 · 論文 · 2026 · NLP

    精讀 AskChem 如何以帶有 DOI、原文引句與 evidence locator 的 atomic claim 取代 paper/chunk 作為檢索單位,並檢查它在 30 題 AskChem-Bench 上改善了什麼、沒有證明什麼。

    90 秒掌握這篇論文
    問題
    paper/chunk retrieval 讓讀者或 agent 自己找證據句、判斷 claim 是否可定位、再跨 paper 合成。
    核心想法
    AskChem 將帶 DOI、quote/evidence locator 與類型的 atomic claim 作為檢索單位,接上 taxonomy、evidence graph 與同一組 REST/SDK/MCP interface。
    最強證據
    2.4M claims、147K papers 的系統,在 30 個 chemistry synthesis questions 上報告 AskChem-grounded answer 的 DOI resolvability 100%,LLM-only 為 88.3%(Section 7、Table 1)。
    邊界
    DOI 可解析與 citation density 是 provenance proxy,不是 claim 事實正確、完整文獻覆蓋或化學結論可用性的證明。
    進入完整精讀
  • BM25 在大規模語料中勝出:RAG 範式的擴展研究

    中階 理解檢索、記憶與 Production RAG
    Retrieval Systems 精讀 · Part 2 · 筆記 · 2026年8月7日 · 論文 · 2026 · NLP

    深讀 Wang 等人的 arXiv v3 研究:在固定問題、證據與對抗文件的 28 層企業型語料梯度上,BM25 如何跨過約 1,000 萬語料 token 的交叉點,以及為什麼 agent 應該接在全域候選排序之後。

    90 秒掌握這篇論文
    問題
    RAG paradigm 常只在單一 corpus size 比較,無法看見 accuracy、construction cost、query cost 與 latency 如何一起隨資料量變化。
    核心想法
    以 28 個 nested corpus tiers(1,144 到 511,959 documents)固定 reader/judge 與 adversarial bedrock,比較 lexical、dense、graph、file-system agency;再以 retrieval-swap control 隔離 access substrate。
    最強證據
    在 shared large tiers,作者報告 BM25 約在 10M corpus tokens 超過 raw file-system agency;matched 150-question resweep 中 Agent+BM25 69.4、raw-file agency 36.9(Section 5.1、Figure 4、Table 4)。
    邊界
    EnterpriseRAG-Bench 是 fictional enterprise-shaped corpus、500 questions 和一個主 reader/judge;公開 executable benchmark/data artifact 未確認,不能轉寫成普遍「BM25 永遠贏」。
    進入完整精讀
  • RubricRanker 論文精讀:RAG 需要的不是最相關文件,而是對的文件集合

    進階 理解檢索、記憶與 Production RAG
    檢索系統 · Part 3 · 筆記 · 2026年8月7日 · 論文 · 2026 · Retrieval Systems

    拆解 RubricRanker 如何用 query-specific search rubrics、SFT 與 GRPO 訓練文件 reranker,並檢查它在 deep research 與 RAG benchmark 上真正改善了什麼。

    90 秒掌握這篇論文
    問題
    傳統 reranker 逐份文件評 relevance,卻不保證 top-k 合起來完整、精簡、一致且權威。
    核心洞見
    把輸出目標從「文件排名」改成「共同支撐答案的 evidence set」,並用 query-specific rubrics 產生集合標籤與 reward。
    最強證據
    Table 1--3 顯示下游分數提升,且 ablation 指向 rubric labels 與 cold-start SFT,而不是 RL 單獨創造效果。
    主要邊界
    最終答案仍由 Agent 與 LLM judge 評分;較好的 evidence set 不等於引用、推理或事實都正確。
    進入完整精讀

歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。

演講與聯絡