RAG 深度精讀
系列 · 1 篇
-
RAG:把檢索接上生成,但不能把 2020 的 RAG 當成 Production RAG 平台
中階 理解檢索、記憶與 Production RAG精讀 Lewis et al. NeurIPS 2020:把 BART 接到 Wikipedia 的 dense retriever,用 RAG-Sequence/RAG-Token 讓取回的段落條件化生成。NQ 上 RAG-Seq Exact Match 44.5;這仍是 2020 的方法論文,不是 2025 的 Production RAG 平台,也不是 agent 迴圈。
90 秒掌握這篇論文
- 問題
- 大型預訓練模型把事實塞進參數裡,知識密集任務仍落後專用架構;參數記憶難更新、難追溯,也容易胡謅。
- 核心洞見
- 把預訓練的 seq2seq 生成器(BART)接到預訓練的 dense retriever(DPR 初始化)與 Wikipedia 索引。決策點從「只靠參數答」改成「先取回段落,再條件化生成」。RAG-Sequence 整段共用一份文件;RAG-Token 可按 token 換文件。
- 最強證據
- Table 1 的開放域 QA:NQ 上 RAG-Seq 44.5、RAG-Token 44.1,高於 DPR 41.5、REALM 40.4、T5-11B+SSM 36.6。Table 2 的生成與分類:Open MS-MARCO 上 RAG-Seq 相對 BART 各 +2.6 Bleu/Rouge-L;FEVER-3 72.5,距當時 pipeline SOTA 76.8 差 4.3 個百分點,且沒有 retrieval 中間監督。
- 主要邊界
- 記憶是 2018 年 12 月 Wikipedia 切成 21M 個 100 詞塊,不是私有語料;檢索是 dense MIPS,不是 production hybrid;沒有 agent 的 search/read/final,也沒有 2026 企業意義上的 citation faithfulness。
歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。
演講與聯絡