← 返回論文精讀

  • WebGPT:讓模型用瀏覽器找答案,但不要當成會推理的 Agent 迴圈

    中階 Agent Runtime、安全與評測
    WebGPT 深度精讀: Part 1 , 筆記: 2026年8月27日 , 論文: 2021 , NLP

    精讀 Nakano et al. arXiv:2112.09332 v3:給 GPT-3 一個文字瀏覽器,用人類示範與偏好/reward model 訓練它搜尋、引用再回答。175B best-of-64 對示範者 56%、對 Reddit 69%;這是瀏覽式 QA,不是 ReAct 的 thought–action–observation。

    90 秒掌握這篇論文
    問題
    長文問答落後人類;檢索與綜合被拆開做。沒有引用時,人類很難核對段落級事實。
    核心洞見
    把搜尋引擎外包給 Bing,把綜合交給微調後的 GPT-3,中間接一個文字瀏覽器。模型只能發 Table 1 的指令(search、click、quote、scroll、end),瀏覽中收集引用,再寫答案。訓練是人類示範的行為複製,加上人類偏好的 reward model,再用 rejection sampling 選答案。
    最強證據
    175B best-of-64 對示範者整體偏好 56%,對 ELI5 最高票答案 69%(Section 4.1、Figure 2)。best-of-64 對純 BC 偏好 68%;RL 對 BC 58%,但與 rejection sampling 疊加幾乎沒有好處(Section 5.1、Figure 4、Figure 5)。
    主要邊界
    沒有獨立 thought 動作。文字瀏覽器是受限 action space,不是通用工具迴圈。答案仍可能改寫錯或挑對 labeler 有說服力的引用。這是 2021 的 OpenAI 技術報告/arXiv preprint,不是後來的產品瀏覽功能。
    進入完整精讀

歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。

演講與聯絡