Agent Trace 可觀測性
系列 · 1 篇
-
Parsing the Stream:長程 Agent 不只需要記憶,還需要一個可審計的 live state
進階 Agent Runtime、安全與評測精讀 Pakhomov 與 Nijkamp 的 Parsing the Stream(arXiv:2609.01466):把 append-only trace fold 成 typed RunState,再編譯成 observer 與 worker 兩種 view;它在特定累積任務中改善長程表現與監控成本,但不證明固定 aggregate 能取代所有 trace memory。
90 秒掌握這篇論文
- 問題
- 長程 Agent 的 trace 會同時超過兩個消費者的能力。人類 observer 需要在執行中知道「現在做什麼、哪些事情已經確定、還缺什麼」;Agent worker 則必須把同一條不斷變長的 trace 放回有限的 context。只保留尾端會丟掉早期事實,直接把整條歷史塞回每一回合又會讓 token、成本與錯誤一起增長。
- 核心洞見
- 不要為 worker 與 observer 各自做一個彼此不一致的摘要器,而是把 trace 先寫成 append-only typed ledger,折疊成帶有來源與 coverage 的 RunState,再從這個 state 編譯出不同消費者需要的 view。
- 最強證據
- 在 12 份真實 transcript、每個 condition 70 個監控問題的 COMPREHEND 評估中,compiled view 的 Sonnet 5 accuracy 為 0.871、Haiku 4.5 為 0.850;raw tail 分別只有 0.479 與 0.476。CONTINUE 的 120-link clean protocol 則是 curated fold 30/30、scratchpad 30/30、full context 8/30(Table 1–2、Figure 2–3)。
- 主要邊界
- 這些結果是 schema coverage 與任務形狀的條件式證據。作者自己在 alternating-sign chain 上展示 fold 會失去優勢,也承認 benchmark–system co-evolution、單一 vendor、固定 schema、單 session,以及 prompt injection、secret redaction、多 Agent ledger 尚未被測試。
歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。
演講與聯絡