← 返回論文精讀

  • Corrupt Plans, Clean Traces:Plan Injection 為何能繞過 Chain-of-Thought Monitoring

    進階
    CoT Monitoring 與 Plan Injection: Part 1 , 筆記: 2026年9月16日 , 論文: 2026 , AI Safety

    深讀 Plan Injection:當 adversarial plan 被種進 context、actor 再把它改寫成看似自然的 Chain-of-Thought 時,monitor 看到的 clean trace 為何可能與真正的行為因果脫鉤,以及 APPS、BioMath 與 budget sweep 的證據邊界。

    90 秒掌握這篇論文
    問題
    CoT monitor 通常讀 actor 的 reasoning,判斷它是否在執行 harmful plan。若 harmful plan 先被放進 actor 的 context,actor 可能吸收它、改寫成一段看似自然的 reasoning,最後輸出有問題的 code 或答案;monitor 只看到後來的 trace,就可能看不到真正改變行為的來源。
    核心洞見
    plan injection 把「行為的因果來源」與「monitor 可見的文字 trace」拆開。攻擊者不必要求 actor 原文照抄,也不必讓 CoT 出現明顯 malicious intent;只要 injected plan 能 steer actor,而 actor 產生的 reasoning 不明確歸因於該 plan,monitor 的觀測面就可能失真。
    最強證據
    Figure 3 在 APPS 與 Bio-Math 顯示 injected plan 被採用的比例;Figures 4–5 將 actor-only 與 with-plan 的 monitor detection 並列;Table 8 的 end-to-end undetected attack success 在 APPS 為 33%–68%、Bio-Math 為 74%–82%;Figure 6 在 Qwen3-235B monitor 上顯示增加 budget 對 suspicion 不是單調改善。
    主要邊界
    這不是「所有 reasoning model 都能被同樣攻擊」的估計,也不是 CoT 本身必然不可信的形式證明。作者只測 Qwen3-8B、DeepSeek-R1-0528 兩個 actor、APPS/BioMath 兩種 scaling task,且只對一個 monitor 做 budget sweep;沒有 code、checkpoint 或完整可重跑的資料包。
    進入完整精讀

歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。

演講與聯絡