Agentic RAG 失敗診斷與歸因
系列 · 1 篇
-
失敗一旦傳播,還能找出起點嗎?Agentic RAG 的因果失敗歸因
進階深讀 When Failures Propagate:用介入式 benchmark、三跳 MuSiQue 與 certified content corruption,拆開 Agentic RAG 的失敗偵測、因果歸因、傳播與恢復。
90 秒掌握這篇論文
- 問題
- Agentic RAG 把 retrieval、reasoning 與回答拆成多個 hop。早期拿到錯誤 evidence,可能在後面變成 query drift、錯誤 bridge 或 wrong answer;但後續 retrieval 也可能把它修回來。只看 final answer 或最後一個 trace,無法直接知道最早哪一跳造成失敗。
- 核心洞見
- AgenticRAG-FP 在指定 hop $h$ 先注入一個可認證的 fault,再從被改過的 prefix 重新執行 suffix。診斷器不是對一條靜態錯誤 trace 猜原因,而是拿預先知道的 injectedathop 檢驗 exact-hop attribution。
- 最強證據
- strict dense Claude Haiku 4.5 sweep 取 80 題三跳 MuSiQue;在仍然失敗的案例中,coverage-based diagnosis 的 exact-hop accuracy 為 hop 1:0.91 [0.81, 0.98]、hop 2:0.00 [0.00, 0.00]、hop 3:0.00 [0.00, 0.00],分母分別是 43、36、21(Table 2,Section 7.1)。
- 主要邊界
- 這個結果支持「在這組 strict intervention 與後綴重跑裡,coverage 的 hop-level signal 會在較深 hop 消失」,不支持「所有自然發生的 Agentic RAG 失敗都不可歸因」。content study 的 hop 2 只有 18 個 failed cases,hop 3 只有 3 個,因此 method ranking 不能外推。
歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。
演講與聯絡