← 部落格

工程筆記

GPT-5.6 Sol 已正式推出:模型路由、價格與評測判讀

GPT-5.6 Sol 已正式推出:模型路由、價格與評測判讀 AI 趨勢拆解 Bloss0m Note 048

這個 route 保留了「previewing」的歷史名稱,但產品狀態已改變。OpenAI 在 2026 年 6 月 26 日先向少數合作夥伴提供 GPT-5.6 有限預覽,接著在 7 月 9 日宣布整個家族正式供應。根據 GPT-5.6 正式發布頁GPT-5.6 Sol 型號文件,Sol 現在是旗艦層級,gpt-5.6 alias 會路由至 gpt-5.6-sol;Terra 與 Luna 則分別面向成本與能力平衡、以及成本敏感的大量工作負載。

因此,工程問題已不是「如何取得預覽資格」,而是如何用自己的任務、延遲與成本資料建立 routing policy。模型越強,不代表把所有請求送往最大層級就越可靠。

已核實的產品狀態與規格

截至 2026 年 8 月 9 日,三個 API 型號皆列於官方文件,並可透過 Responses API 使用:

型號官方定位Input / cached input / output(每 1M tokens)
gpt-5.6-sol旗艦能力;gpt-5.6 alias 指向此型號US$5 / US$0.50 / US$30
gpt-5.6-terra能力與成本平衡US$2.50 / US$0.25 / US$15
gpt-5.6-luna成本敏感、大量工作負載US$1 / US$0.10 / US$6

三者的官方型號頁均記載 1,050,000-token context window、128,000-token 最大輸出、2026 年 2 月 16 日 knowledge cutoff,以及文字與圖片輸入、文字輸出。音訊與影片不是這個模型家族的輸入輸出能力;即時語音應查看獨立的 Realtime 型號。

定價還有兩個容易被摘要忽略的條件:輸入超過 272K tokens 時,整個 request 的 input 以 2 倍、output 以 1.5 倍計價;GPT-5.6 的 cache write 以未快取 input 的 1.25 倍計價。cached read 雖然便宜,但 cache 是否命中與長上下文 premium 會直接改變單次任務成本。

新能力如何影響 Agent 架構

官方 GPT-5.6 model guidance 建議 reasoning、tool calling 與多輪工作使用 Responses API,並明列幾項新能力:

  • reasoning.effort 支援 nonelowmediumhighxhighmax;更高 effort 應以實測品質增益交換延遲與 token,而不是預設開到最高。
  • Pro mode 是 reasoning.mode: "pro",不是另一個 Pro model slug;它和 reasoning effort 是兩個獨立設定。
  • Programmatic Tool Calling 允許模型在託管 runtime 內協調符合條件的工具與中間結果。
  • Multi-agent 仍標記為 beta。它可平行處理可拆分的工作,但需要額外驗證結果完整性、成本與失敗收斂。
  • Persisted reasoning 與 explicit prompt caching 可減少重複上下文處理,但也帶來狀態生命週期與 cache write 成本。

合理的路由器不應只看 prompt 長度。它至少要輸入任務風險、工具副作用、SLA、context 大小與預估成本,再把請求送到候選模型;高風險或低信心結果仍要進入驗證或人工審批。若要完整整理 Agent 的工具、狀態與評測面,可搭配 AI Agent 完整指南 閱讀。

Benchmark 能說什麼,不能說什麼

OpenAI 的正式發布頁報告多項 vendor-run evaluations。例如 GPT-5.6 Sol 在 Terminal-Bench 2.1 為 88.8%,高於頁面列出的 GPT-5.5 85.6%;在 BrowseComp 為 90.4%,搭配 Ultra 時為 92.2%。這些結果支持「特定設定下的工具與終端任務有提升」這個窄結論,但不能直接換算成你的 production success rate。

長上下文數字尤其需要保守解讀。在 OpenAI MRCR v2 的 8-needle、512K–1M 區間,發布頁列出的 Sol 分數是 73.8%,GPT-5.5 是 74%。也就是說,能接收 1.05M tokens 不等於能在所有長上下文位置穩定找回關鍵資訊。更大的 context 也會增加 prefill latency、成本與不相關資訊干擾。

評估模型時,至少固定 prompt、工具、reasoning effort、最大重試與成功判準,再比較:

  • 任務成功率與必要證據是否齊全;
  • p50 / p95 latency 與超時率;
  • input、cached input、reasoning、output 的實際 token;
  • 工具呼叫次數、失敗恢復與副作用重複率;
  • 每個成功任務的總成本,而非只有每 token 標價。

限制、保障措施與導入風險

GPT-5.6 仍可能產生錯誤答案、錯用工具或遺漏長上下文證據。官方 guidance 也提醒,cyber 與 biology 的即時 classifiers 可能拒絕輸出,或在 streaming 期間暫停數秒檢查;合法的 dual-use 工作亦可能受到影響。這類延遲與拒絕必須進入 SLA、fallback 與使用者溝通設計。

另外,官方 benchmark 是模型供應商發布的結果,包含特定 scaffold、工具與 reasoning 設定。除非在自己的資料、權限與負載下重現,不能把它當成採購保證。對長任務,還要設置 checkpoint、可恢復狀態與獨立驗證;相關方法可延伸閱讀 長任務代理的 HarnessHarness Engineering

來源

歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。

演講與聯絡