RAG 檢索完整性與治理
系列 · 1 篇
-
RAGSieve:用自我參照的局部對比,找出 RAG 知識投毒的排名推升
進階深讀 RAGSieve:以同一個檢索事件的 retrieval tail 與同一個語料鄰域作為局部對照,在 query-time 與 corpus-time 找出可疑的排名推升;同時釐清投毒偵測不是事實查核。
90 秒掌握這篇論文
- 問題
- RAG 把外部語料放進生成證據。攻擊者只要能透過公開頁面、共享儲存或 connector 讓少量文件進入 index,就可能讓特定錯誤答案在目標 query 的 top-5 被看見。難處是:被攻擊的 corpus 不是可信 reference,而不同主題的自然語意密度也不一樣。
- 核心洞見
- 不要以為有一份先驗乾淨資料集,也不要用一個跨語料的 global threshold。RSQ 以同一 query 的 top-5 與 ranks 6–20 做 query-local contrast;RSG 以每份文件自己的語意鄰居與 local floor 做 corpus-local contrast。兩者都讓 inspected system 自己提供 matched control。
- 最強證據
- RSQ 在九個 dataset–retriever 組合、六種攻擊的 macro AUROC 為 95.2%,在最多移除 5% clean document 的 operating point 偵測 82.2% poison;RSG 對應為 93.3% 與 79.8%。串接 RSG 與 RSQ 後,六種攻擊的 ASR 從 67.4% 降至 14.0%,unpoisoned-retrieval F1 則由 42.1% 變為 41.3%(Table 1、Table 5、Table 9)。
- 主要邊界
- 這些數字是合成攻擊、三個 QA corpus、三個 dense retriever 與固定評測 protocol 的結果。它們支持「可疑 promotion pattern 可以被局部對照抓到」,不支持「被 flag 的文字一定是假的」、 「檢索到的 claim 已完成 truth verification」,也不支持 production-scale 多租戶延遲或 zero-poison guarantee。
歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。
演講與聯絡