
GPT-6 Sol 對比 GPT-5.6 Sol:一個指數點、一半價格,以及一個沒人宣布的退步
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 610 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 189 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
是的,升級吧——但先讀第二段。GPT-6 Sol 於 2026 年 9 月 22 日發布,在 Artificial Analysis 的 Intelligence Index 上得分 48。GPT-5.6 Sol 於 2026 年 7 月 9 日發布,得分 47。一分。取代它的模型成本只要一半:每百萬輸入 $2.00、每百萬輸出 $10.00,相較之下是 $4.00 和 $20.00。就最顯眼的數字來看,這是目前產品陣容中最容易做出的升級決定,而且這次降價是真的、永久的,也是該廠商對旗艦產品所做出過的最大單次降幅。
麻煩之處在於,Artificial Analysis 自己對 GPT-6 Sol 的評估發現的是進步與退步並存,而非單純的升級。在 GDPval-AA v2.1 上出現了退步。此外,還有一個針對超過 272,000 個輸入 token 的長上下文重新定價級距,會使輸入費率大約翻倍,並使輸出提高一半——而 272K 正是 GPT-5.6 Sol 已公布表現優勢的區間。一場看似能直接讓你的帳單減半的遷移,在長上下文流量上,結果可能更接近打平,還附帶能力上的取捨。
指數上漲一點,實際上代表什麼意義
兩個模型都是在同一塊主機板、版本 4.3.2 上進行量測,這讓這次比較成為整個 GPT-6 Sol 系列中最乾淨的一次——沒有測試框架的差異,沒有廠商與獨立第三方之間的落差,而是由同一個實驗室量測同一家廠商的兩個模型。
• AA Intelligence Index — GPT-6 Sol 48,在 212 個中排名第 18;相較之下,GPT-5.6 Sol 47,在 212 個中排名第 19
• 每個 Index 任務的成本 — GPT-6 Sol 約為 GPT-5.6 Sol 的一半
• 輸出速度 — GPT-6 Sol 104.4 tokens/秒 vs GPT-5.6 Sol 72.6 tokens/秒
• 首個 token 的時間 — GPT-6 Sol 107.18 秒 vs GPT-5.6 Sol 較快,兩者對比 3.87 秒的排行榜中位數
• 輸入價格 — GPT-6 Sol 每 100 萬 $2.00,對比 GPT-5.6 Sol 每 100 萬 $4.00
• 輸出價格 — GPT-6 Sol 每 1M $10.00,對比 GPT-5.6 Sol 每 1M $20.00
• 快取輸入 — GPT-6 Sol 相較 GPT-5.6 Sol 約便宜 90%,每 100 萬 $0.40
• 批次費率 — GPT-6 Sol 未公布 vs GPT-5.6 Sol $2.50 / $15.00
• 長上下文層級 — GPT-6 Sol 在輸入超過 272K 時重新定價,而 GPT-5.6 Sol 無對應級距
• 上下文視窗 — 根據 AA,GPT-6 Sol 為 872K,宣稱 1.05M;對比 GPT-5.6 Sol 約 1.05M 至 1.1M
• 最大輸出 — 兩者皆為 128K
• 發布 — GPT-6 Sol 2026-09-22 對比 GPT-5.6 Sol 2026-07-09

把這兩條速度指標放在一起看。GPT-6 Sol 的輸出生成速度比前代快約 44%,但它在產生第一個 token 上卻慢得多——107.18 秒,而排行榜中位數是 3.87 秒。以排行榜標準來看,GPT-5.6 Sol 同樣稱不上快,但還沒到那種程度。如果你是為了互動式產品而遷移到 GPT-5.6 Sol,GPT-6 Sol 並非可直接替換的選項,而這是與任何基準測試都無關的功能性退步。
有一點悄悄透露著有利訊號:GPT-6 Sol 的標準費率 $2/$10,比 GPT-5.6 Sol 的批次費率 $2.50/$15 還低。即便是舊款模型的折扣價,也比新款模型的牌價更貴。這是最有力的證據,說明這次降價是結構性的,而非促銷性質。
迴歸才是有趣的部分。
Artificial Analysis 發現,GPT-6 Sol 大致將每項任務的成本減半,同時帶來好壞參半的進步與退步。GDPval-AA v2.1 便是被點名的退步項目。另外,OpenAI 的 GPT-5.6 Luna 在 Coding Agent Index 上也出現退步——這顯示這是這一代模型的一種模式,而非單一模型的偶發失誤。
這值得認真看待,正因為它是獨立得出的結果。OpenAI 的發布資料是圍繞每項任務成本,以及它自行挑選的基準測試項目所建構的;Artificial Analysis 沒有產品要賣,只呈報其測試框架所產出的結果。一個價格更低、在綜合指標上大致相當,但在特定子任務上明顯較差的模型,並不是嚴格意義上更好的模型。它只是前沿上的另一個點。
實際來說:如果你的工作負載高度偏向 GDPval-AA 的形態——具經濟價值的知識工作,也就是那個基準原本被打造來衡量價值的任務類型——那麼綜合分數增加一分並不能涵蓋你的情況,真正要緊的是退步的那個數字。如果你的工作負載屬一般性質,那麼每項任務成本減半才是關鍵數字,而綜合分數顯示你並沒有犧牲任何可衡量的東西。
GPT-5.6 Sol 依然勝出之處
GPT-5.6 Sol 有一項已發表的長上下文檢索結果,是 GPT-6 Sol 無法以任何同等表現匹敵的:MRCR v2、8-needle,在 256K 至 512K 範圍達到 91.5%。這是一項檢索準確率數據,落在 GPT-6 Sol 費率表變動的區間內。
把這兩個事實並列來看。超過 272,000 個輸入 token 時,GPT-6 Sol 的整筆請求會重新計價為大約 $4 輸入與 $15 輸出。這大約是 GPT-5.6 Sol 先前的輸入費率,以及其輸出費率的四分之三——因此,你當初為之遷移的 50% 節省,在輸入上縮水到約 0%,在輸出上則縮水到 25%,而這正好落在 GPT-5.6 Sol 已有明確記載優勢、GPT-6 Sol 卻沒有公開對應表現的上下文範圍內。
GPT-5.6 Sol 其他已公布的結果依然相當可觀,這正是部分團隊不願轉換的原因:
• 智慧體最終考試 — GPT-5.6 Sol 53.6
• Terminal-Bench 2.1 — GPT-5.6 Sol 88.8 / 88.0
• SWE-Bench Pro — GPT-5.6 Sol 64.6
• OSWorld 2.0 — GPT-5.6 Sol 62.6
• BrowseComp — GPT-5.6 Sol 90.4
• GDPval-AA v2 — GPT-5.6 Sol 1747.8 Elo
• HLE — GPT-5.6 Sol 49.5
• MRCR v2,8 針 — GPT-5.6 Sol 在 256K 至 512K 下達 91.5%
這些是 OpenAI 自行回報的數據。要注意,BrowseComp 的 90.4 與 MRCR 的數字是最難被取代的兩項:網頁研究代理與長上下文檢索這類工作負載中,一個已有公佈數據的兩個月前模型,會比一個沒有對應測量值的新模型更保險。
GPT-6 Sol 帶來哪些價目表上沒有的東西
定價才是重點,但另外還有三件事也變了。
首先,是上下文上限。根據 Artificial Analysis 的列載,GPT-6 Sol 為 872,000 個 token,對比 OpenAI 其他資料中聲稱的 1.05M,最大輸入為 922K。GPT-5.6 Sol 依來源不同,大約介於 1.05M 至 1.1M 之間。就帳面數字而言,這在可用視窗上是小幅退步——但附帶的條件是:真正決定成本的是 272K 的分層界線,而非上限。
第二,可用性。GPT-6 Sol 已在 API,以及 Plus、Pro、Business、Enterprise 和 Edu 方案中的 ChatGPT Work 與 Codex 提供——而且企業管理員必須先啟用它,使用者才能看到。它不在 ChatGPT Chat 中。GPT-5.6 Sol 是更廣泛的部署。如果你的團隊存取途徑須經由企業管理員,那麼這次移轉就不只是程式碼變更。
第三,新旗艦的推出通常意味著舊旗艦會變成更便宜的備援選擇,而非退役。定價為 $4/$20 的 GPT-5.6 Sol 在 Index 上仍有 47 分,依然是非常出色的模型;而在長上下文檢索工作中,它有一項 GPT-6 Sol 未公布的數據。
一場成本比表面上看來更低的遷移
這次升級之所以特別容易,是因為這兩個模型來自同一個供應商、API 形式相同,而且在排名中相鄰——這意味著這次遷移只是改動模型字串,而非重新架構,而且備援路徑早就已經在你的程式碼裡了。GPT-5.6 Sol 已在 OrcaRouter 上以 OpenAI 的定價提供,採用直通式模式,讓 OpenAI 的價格變動當天就在我們這邊生效,而不必等經銷商重新議價之後才反映。
截至本文撰寫之際,GPT-6 Sol 尚未收錄在我們的目錄中——它得透過 OpenAI 自家的 API 才能觸及。所以,一場遷移最誠實的樣貌是在同一把金鑰背後,以 GPT-5.6 Sol 作為後盾的一條路由:把新的流量導向 GPT-6 Sol,讓前一代模型只差一次設定變更就能切回,並讓自動容錯移轉涵蓋新旗艦模型可用性仍在塵埃落定的那段空窗期。對一個才問世兩天的模型來說,前面還有一道 Enterprise 啟用開關,以及一個在超過 272K 詞元後就會改變成本結構的長脈絡層級,此時仍把前一代接在線路上並非審慎之舉——而是糟糕的一下午與糟糕的一星期之間的差別。

遷移檢查清單
在做任何其他事之前,先測量你實際的上下文分布。如果你請求的第 95 百分位數低於 272,000 個輸入 token,就遷移——節省的是帳單兩側實實在在的 50%,每項任務成本減半,而綜合指標顯示你什麼都沒放棄。如果有相當比例的流量位於那條線之上,請仔細建模這個層級:在大約 $4/$15 的價格下,相較於 GPT-5.6 Sol 的 $4/$20,優勢在輸出方面是 25%,在輸入方面則毫無優勢,而你是以失去一項有文獻記載的長上下文檢索結果作為代價。
檢查是否有人在等待第一個 token。107 秒大約是看板中位數的二十八倍,而這正是正式環境中最先浮現的失效模式。凡是另一端有真人在等的情況,都應該留在 GPT-5.6 Sol,或改派到其他地方。
接著檢查啟用路徑。Enterprise 方案需要管理員開啟 GPT-6 Sol,而它在 ChatGPT Chat 裡完全付之闕如。在內部宣布移轉之前,先確認你的使用者真的能取用得到。
最後,第一個月請在你自己的評估上留意 GDPval-AA v2.1。獨立實驗室發現在那裡出現了退步,而綜合分數只提升一分,並不能告訴你你的特定任務集是變好還是變差。在正式切換之前,先在兩個模型上執行你的評估,而不是切換之後才做。

本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
