← 返回論文精讀

  • Self-RAG:讓模型決定何時檢索,但不能把反思 token 當成 Production RAG 閘門

    中階 理解檢索、記憶與 Production RAG
    Self-RAG 深度精讀: Part 1 , 筆記: 2026年8月27日 , 論文: 2024 , NLP

    精讀 Asai et al. ICLR 2024:用 reflection tokens(Retrieve/Relevant/Supported/Useful)訓練 LM 按需檢索並自我批判。PopQA 上 Self-RAG 7B 54.9、13B 55.8;這是 when-to-retrieve 的方法論文,不是 Production RAG 平台,也不是 agent 工具迴圈。

    90 秒掌握這篇論文
    問題
    標準 RAG 不問需不需要,一律取回固定篇數;無關段落會拖累生成,也傷害指令遵循的通用性。取回之後,模型也不保證會跟著段落走。
    核心洞見
    訓練一個任意 LM,讓它在生成過程中穿插 reflection tokens:Retrieve 決定要不要檢索;ISREL/ISSUP/ISUSE 分別批判相關性、支持度與效用。檢索變成決策,而不是管線預設階段。
    最強證據
    Table 2 六任務總表——Self-RAG 7B/13B 在 PopQA 54.9/55.8、TriviaQA 66.4/69.3、PubHealth 72.4/74.5、ARC 67.3/73.1;biography FactScore 81.2/80.2;ASQA citation precision/recall 66.9/67.8 與 70.3/71.3。Table 3a:相對 Self-RAG(50k)45.5,No Critic 的 PopQA 42.6、ASQA em 18.1;Retrieve top1 的 PopQA 41.8。
    主要邊界
    critic 先靠 GPT-4 銀標再蒸餾;reflection tokens 仍可能錯;索引與評測是 Wikipedia/公開 QA,不是企業 ACL 與 citation 產品;也不是帶工具的 agent 迴圈。
    進入完整精讀

歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。

演講與聯絡