← 返回論文精讀

  • Parsing the Stream:長程 Agent 不只需要記憶,還需要一個可審計的 live state

    進階 Agent Runtime、安全與評測
    Agent Trace 可觀測性: Part 1 , 筆記: 2026年9月7日 , 論文: 2026 , AI Engineering

    精讀 Pakhomov 與 Nijkamp 的 Parsing the Stream(arXiv:2609.01466):把 append-only trace fold 成 typed RunState,再編譯成 observer 與 worker 兩種 view;它在特定累積任務中改善長程表現與監控成本,但不證明固定 aggregate 能取代所有 trace memory。

    90 秒掌握這篇論文
    問題
    長程 Agent 的 trace 會同時超過兩個消費者的能力。人類 observer 需要在執行中知道「現在做什麼、哪些事情已經確定、還缺什麼」;Agent worker 則必須把同一條不斷變長的 trace 放回有限的 context。只保留尾端會丟掉早期事實,直接把整條歷史塞回每一回合又會讓 token、成本與錯誤一起增長。
    核心洞見
    不要為 worker 與 observer 各自做一個彼此不一致的摘要器,而是把 trace 先寫成 append-only typed ledger,折疊成帶有來源與 coverage 的 RunState,再從這個 state 編譯出不同消費者需要的 view。
    最強證據
    在 12 份真實 transcript、每個 condition 70 個監控問題的 COMPREHEND 評估中,compiled view 的 Sonnet 5 accuracy 為 0.871、Haiku 4.5 為 0.850;raw tail 分別只有 0.479 與 0.476。CONTINUE 的 120-link clean protocol 則是 curated fold 30/30、scratchpad 30/30、full context 8/30(Table 1–2、Figure 2–3)。
    主要邊界
    這些結果是 schema coverage 與任務形狀的條件式證據。作者自己在 alternating-sign chain 上展示 fold 會失去優勢,也承認 benchmark–system co-evolution、單一 vendor、固定 schema、單 session,以及 prompt injection、secret redaction、多 Agent ledger 尚未被測試。
    進入完整精讀

歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。

演講與聯絡