Agent 評測與人機協作
系列 · 1 篇
-
XYEval: Agents say yes to bad advice 精讀:Agent 為何接受錯誤建議
進階 Agent Runtime、安全與評測精讀 Wu 等人的 XYEval(arXiv 2609.23939 v1):以受控 XY mutation 比較五個模型在六類任務的表現,追蹤誤導建議如何影響任務完成、對話表達與工具軌跡,並檢視基準和生成器的邊界。
90 秒掌握這篇論文
歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。
演講與聯絡