Self-RAG 深度精讀
系列 · 1 篇
-
Self-RAG:讓模型決定何時檢索,但不能把反思 token 當成 Production RAG 閘門
中階 理解檢索、記憶與 Production RAG精讀 Asai et al. ICLR 2024:用 reflection tokens(Retrieve/Relevant/Supported/Useful)訓練 LM 按需檢索並自我批判。PopQA 上 Self-RAG 7B 54.9、13B 55.8;這是 when-to-retrieve 的方法論文,不是 Production RAG 平台,也不是 agent 工具迴圈。
90 秒掌握這篇論文
- 問題
- 標準 RAG 不問需不需要,一律取回固定篇數;無關段落會拖累生成,也傷害指令遵循的通用性。取回之後,模型也不保證會跟著段落走。
- 核心洞見
- 訓練一個任意 LM,讓它在生成過程中穿插 reflection tokens:Retrieve 決定要不要檢索;ISREL/ISSUP/ISUSE 分別批判相關性、支持度與效用。檢索變成決策,而不是管線預設階段。
- 最強證據
- Table 2 六任務總表——Self-RAG 7B/13B 在 PopQA 54.9/55.8、TriviaQA 66.4/69.3、PubHealth 72.4/74.5、ARC 67.3/73.1;biography FactScore 81.2/80.2;ASQA citation precision/recall 66.9/67.8 與 70.3/71.3。Table 3a:相對 Self-RAG(50k)45.5,No Critic 的 PopQA 42.6、ASQA em 18.1;Retrieve top1 的 PopQA 41.8。
- 主要邊界
- critic 先靠 GPT-4 銀標再蒸餾;reflection tokens 仍可能錯;索引與評測是 Wikipedia/公開 QA,不是企業 ACL 與 citation 產品;也不是帶工具的 agent 迴圈。
歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。
演講與聯絡