← 返回論文精讀

  • ACE:讓簡報畫布 Agent 先理解結構,再用批評回饋修正

    進階
    Agent Canvas 編輯與評測: Part 1 , 筆記: 2026年9月17日 , 論文: 2026 , AI Engineering

    深讀 ACE(arXiv:2608.24103 v1):以 hierarchical scene graph、CARE 與 instruction-following judge 把多頁簡報編輯拆成可路由、可差分、可回溯的閉迴路,並釐清 benchmark、human rater、mock 與 live reproduction 的邊界。

    90 秒掌握這篇論文
    問題
    PowerPoint/HTML 一類 flat absolute-positioned 文件把物件位置寫成大量座標。Agent 若要在一個 element 新增內容或改 layout,常得重新計算其他物件;而不同但合理的設計可能被 reference-diff 指標誤判為錯。
    核心洞見
    ACE 以 hierarchical scene graph 保存 parent–child 關係、相對變換與 auto-layout,再用 98 個專用工具把意圖映射到結構化操作;CARE 只取與任務相關的 slide、節點或 design token。完成 edit 後,JsonDiff 對比原始與目前狀態,由不看 ground truth 的 instruction-following judge 提供下一輪 critique。
    最強證據
    完整 94-task benchmark 的 GPT IF 是 ACE 4.23、HTML baseline 3.81,paired p=.010;速度約 1.75 倍、成本約低 44%。但同一組的 VQ 是 3.66 對 3.57(p=.56),所以 headline 不是「所有視覺品質都提升」。
    主要邊界
    26 位 blind raters 在 ACE 對 HTML 的 overall decisive win rate 是 58.7%,self-corrected output 對 single-pass 是 81.5%;這些結果有小樣本、tie、低至中度一致性與 judge circularity 限制。它沒有證明 ACE 能改善所有 creative editing,也沒有證明 judge 能取代設計師。
    進入完整精讀

歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。

演講與聯絡