讓 Agent 替人談成一筆交易,仍不代表它替對人做了好選擇。Anthropic 的 Project Swap 把這兩件事拆開:201 名 Anthropic 員工在舊金山、紐約、倫敦、西雅圖、華盛頓特區與都柏林六個 office pools 參與 Claude agent 書籍交換,研究者同時量測 Agent 是否猜中個人喜好,以及市場能否把書交換到更合適的人手上。這是一項由 Anthropic 自行設計和執行的低風險員工研究;它提供的是委託偏好評測的原型,不是高風險代理人已能代表客戶的證據。
把「會交易」和「懂委託人」分成兩個問題
參與者各自帶一本要交換的書,先用約五分鐘和 Claude 對談閱讀興趣。Anthropic 使用 Fable 5,從談話推估參與者對 pool 內書籍的排序,再把這份排序交給代理人上交易場。代理人可以提出或接受雙邊交換,也能提出多人輪轉;交易須取得所有相關代理人同意。參與者另外排序一小組書,作為評估 Agent 是否代表自己的參照。
這個設計讓研究者能分開看兩段能力:偏好模型把人想要什麼轉成排序;談判 Agent 再根據排序尋找交換。若最後拿到一本不合口味的書,原因可能是第一段理解錯誤,也可能是第二段沒把已知偏好實現出來。把兩段混成單一「市場成功率」,就看不出先該修哪裡。
61% pairwise agreement 是有限但可測的偏好訊號
在提交排序的 188 名參與者中,Claude 根據 intake conversation 建立的書籍排序,對所有可比較的書籍 pair 有 61% pairwise agreement;若只是隨機猜書籍先後,基準是 50%。這個指標問的是:對同一個人挑出的兩本書,模型是否把較受偏好的一本排在前面。它不表示模型有 61% 機率選中第一名,也不表示每位參與者都達到同一準確度。
Fable 5 的 61% 是研究中較強的偏好猜測結果之一,不應把它解讀成通用的個人化能力認證。參與者的中位 intake 約 216 個字,分散在八則訊息;作者也報告,寫得較多的人較容易被代表,但偏好本身可能不完整、會隨情境改變,甚至連本人也未必能精確說出想讀什麼。一次短訪談得到的排序只是帶有不確定性的模型,而不是委託人的正式授權文件。
85% shortfall attribution 的分母與條件
研究把參與者自己提交的排序當作「ground truth」:每人從所屬 pool 選十本書排序,若最後收到的書不在這份短名單內,作者會依 Claude 排序位置,以其他參與者在相近位置給的平均分數估補。作者也測試了替代估補方法;無估補時的最佳分配為 0.88、最終分數為 0.62,但這會排除重跑交易場中表現最差的 38% 參與者,因此可能高估結果。以主要計分方式,書籍位置轉為 0 到 1 的分數後再對參與者取平均。因多人可能都想要同一本書,理想結果不是人人都拿到第一名;若中央分配者知道每個人的真實排序,最佳可行 assignment 的 utilitarian score 是 0.89。實際分散式市場在同一套個人排序上平均為 0.55。
要拆解兩者差距,Anthropic 再問:如果使用 Claude 推估的 noisy rankings 來求最佳分配,之後仍用參與者自己的排序評分,結果會是多少?答案是 0.60。從 0.89 到 0.60 的 0.29 分差,除以總缺口 0.89−0.55=0.34,約為 85%;剩下約 15% 是在這組 noisy rankings 下,分散式交易相對於理想化配置的差距。換句話說,這是作者在特定市場與計分方式下的短缺分解,不是「偏好理解錯誤在所有 Agent 失敗中造成 85%」的因果定律。
數字也提醒我們不要把效率指標偷換成「談判能力」。市場 score 0.55 大約相當於參與者拿到個人十本書排序中的第五名;這反映偏好估計與交易流程共同作用的結果。以同一批不完美排序計算,中央化的 Top Trading Cycles 評為 0.60,離散議價則是 0.55。即使換市場機制,錯誤輸入仍把可能的結果限制住。
重跑比較了模型與 instructions,沒有消除偏好誤差
為分辨單次交易中的偶然性,作者另外重跑交易場。對模型比較,他們在五個主要 office pools、全程採用 neutral instructions 的條件下,執行 80 個 homogeneous floors:Haiku 4.5、Sonnet 4.5、Opus 4.8 與 Fable 5 各 20 場,每場所有 Agent 使用同一模型。另有 60 個 mixed floors,同樣使用 neutral instructions;三種模型配對各 20 場,一半 Agent 使用 Opus,另一半使用另外三種模型之一。這些重跑顯示模型家族改變交易結果的幅度通常大於本研究測試的 ruthless/prosocial 指令差異;但這些分數主要依 Claude 自己的排序評估市場動態,換回參與者的真實排序後差距會縮小。
這個結果的工程含義不是「應先升級模型」或「善意指令無用」,而是要固定輸入偏好後比較談判策略,再獨立量測偏好表示的校準程度。若模型用自己的偏好猜測打分,可能會把「在錯誤目標上更有效率」誤報為替人帶來更好的結果。Agent 評測可以參照本站的 Agent 評估與錯誤診斷 思路,明確記錄評分 oracle、成功條件和模型所能看到的資訊;Agent 基本組件與控制流程則可延伸閱讀 AI Agent 架構指南。
指令比較也涉及忠誠與公平的取捨。研究中的 ruthless Agent 只以替自己的參與者換到較喜歡的書為目標;prosocial Agent 另有讓所有人都拿到喜歡書籍的次要目標。前者平均略占優勢,後者有時會讓步。這說明「替我最大化」和「讓整個市場更好」不是同一個 policy;真實系統應讓人看懂授權目標與可接受的妥協,而不是把一條含糊的「幫我處理」交給 Agent 自行定義。
三週後的回饋是接受度訊號,不是安全證明
發書三週後,Anthropic 向參與者做 endline survey。回覆者平均給收到的書 7.2/10,並表示願意把下一年書籍預算約 30% 交給 Agent 自行控制;作為比較,他們願意交給熟悉自己品味、懂書的朋友約 40%。研究正文說只有約 59% 員工回答這次追蹤調查,因而存在回覆選擇偏差。這些答案是在「Agent 可自主挑書且沒有最後否決機會」的情境問題中取得,仍是低風險書籍消費上的自陳意願,不是實際資產委託或高風險授權行為。
研究的其他限制同樣重要:六個 office pools 共 201 人,但 Dublin 只有 3 人,作者因 pool 太小而將其排除於多數分析;多數核心排名分析因此為非 Dublin 的 188 名提交者。參與者全是 Anthropic 員工、研究未提供參與誘因,而且 Agent 都是 Anthropic 建立的 Claude production models,經後訓練後偏向禮貌與合作。市場規則也固定,並非任意開放的現實交易平台。Anthropic 公開了 26 頁報告及附錄,但截至本文查核時,來源頁未提供 participant-level raw data 或可重跑的 simulation code,外部讀者無法獨立重算這些市場結果。
把研究轉成委託 Agent 的工程檢查
Project Swap 最有用的啟示,是把偏好理解視為獨立的 release gate。對一個要代人行動的 Agent,至少應能回答:
- 它從哪些談話、設定或歷史行為推得偏好?每項推測的信心和時效是什麼?
- 使用者能否看到幾個代表性選擇、修正不合適的假設,或先選擇人工確認?
- 哪些取捨是使用者授權的,哪些需要回來詢問?Agent 是否可能為了整體市場結果犧牲委託人利益?
- 市場參與者能看到哪些訊息與決策紀錄?事後是否有可追溯的理由與申訴路徑?
先在低風險選擇上測試「模型怎麼理解這個人」,再逐步增加自主權,會比只看成交率、任務完成率或模型榜單更接近代理的忠誠責任。對任何涉及金錢、醫療、就業或權利的委託,都需要新的代表性樣本、具體授權與獨立安全證據;Project Swap 並沒有提供這些證據。
延伸閱讀
- AI Agent 架構指南:理解 Agent 的狀態、工具與控制流程。
- XYEval:Agent 為什麼會對錯誤建議說好:評估 Agent 如何面對錯誤或偏離目標的輸入。
- Takt:多 Agent 協作拓撲:延伸思考多 Agent 的協作和控制邊界。
來源
- Anthropic Research, Economics. “Project Swap: What happens when agents trade for us?”, 2026-09-24. 26 頁完整報告與附錄。