DPR 深度精讀
系列 · 1 篇
-
DPR:把開放域 QA 改成 dense 段落檢索,但不能把雙編碼器當成 Production RAG
中階 理解檢索、記憶與 Production RAG精讀 Karpukhin et al. EMNLP 2020:用 question/passage 雙編碼器 BERT 與 in-batch negatives 學 dense 檢索,在 Wikipedia 段落上用 MIPS 取代 BM25。NQ top-20 檢索 78.4% 對 BM25 59.1%;端到端 Exact Match 41.5。這是 RAG 用的 retriever,不是生成平台。
90 秒掌握這篇論文
- 問題
- 開放域 QA 依賴高效段落檢索;實務上幾乎都用 TF-IDF/BM25 這類稀疏倒排。稀疏表示難處理同義與改寫,也無法用問句–段落對直接學任務特定空間。
- 核心洞見
- 把檢索改成兩個獨立 BERT-base 編碼器:passage encoder 離線把 Wikipedia 切成的段落編成 768 維向量並建 FAISS 索引;question encoder 在線編碼問題,用點積做 MIPS。訓練用 gold 正例+in-batch negatives(再加 BM25 hard negatives),不必像 ORQA/REALM 那樣做昂貴的額外預訓練或週期重建索引。
- 最強證據
- Table 2 的 top-20/top-100 檢索準確率——NQ 上 Single DPR 78.4%/85.4%,BM25 59.1%/73.7%(約 +19.3 個百分點的 top-20);摘要寫 9%–19% absolute。Table 4 端到端 Exact Match:NQ 上 DPR 41.5,高於 ORQA 33.3 與 REALMNews 40.4。Figure 1:只用 1,000 個訓練例的 DPR 已勝過 BM25。
- 主要邊界
- 記憶是 2018-12-20 English Wikipedia 切成約 2,101 萬個 100-word 段落;評測是英語開放域/抽取式 QA;相似度是雙編碼器點積,沒有 late interaction;不是 production hybrid、不是 citation faithfulness、不是 agentic search/read/final。
歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。
演講與聯絡