
GPT-6.1 Sol 對比 GPT-6 Sol:多一週的額外工作換來了什麼,又沒換來什麼
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 397 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 195 tok/s
- Orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1141 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- xAISpaceXAI: Grok 4.62026-08-1244智能77程式
如果你目前已在正式環境中使用GPT-6 Sol,而你正在考慮 GPT-6.1 Sol 是否值得遷移,答案完全取決於你哪一項成本較大——而這兩款模型的設計方式,讓答案幾乎不會是「兩者皆是」。GPT-6 Sol 於 2026 年 9 月 22 日推出,每百萬輸入 token 為 $2.00、快取為 $0.20、輸出為 $10.00。GPT-6.1 Sol 於 2026 年 9 月 29 日推出,輸入為 $2.00、快取為 $0.10、輸出為 $10.00,並在較低的推理投入下,於複雜軟體工程任務上取得供應商回報的 6.4 個百分點改善。輸入與輸出價格並未變動。快取費率減半。這一行唯一改變的內容就是整個財務論證,而其他一切則是能力論證,且在這個版本生命週期的此時此刻,該論證僅來自單一來源。
有三件事改變了。其中一件是帳單。
剝去行銷包裝,這兩個部署之間的差異短到足以記在腦中。
• 快取輸入 — 在 GPT-6.1 Sol 上每百萬個 token 為 $0.10,而 GPT-6 Sol 為 $0.20。這是實際測量而非聲稱,也是唯一以算術形式呈現的變更。
• 能力,依廠商說法 — OpenAI 報告指出,在較低的推理投入與成本下,於 DeepSWE v1.1 領先 6.4 分;在最高投入下,Terminal-Bench Science 0.1 的分數超過兩倍;在最高投入下,於 OSWorld 2.0 離線集上領先七分;在中等投入下,AutomationBench 領先 4.8 分;而事實錯誤率在刻意誘發錯誤的提示集上從 11.4% 降至 7.7%。這些全都未經重現。
• 推理階梯 — GPT-6.1 Sol 支援 low、medium、high、xhigh 與 max,但不支援 none;GPT-6 Sol 支援全部六種。這是會讓程式碼出錯的差異,也是沒人會在發布貼文中提及的那一項。
其餘一切完全相同,或者說幾乎沒兩樣:同樣的 1,000,000-token 上下文視窗、同樣的 128,000-token 輸出上限、同樣的 $2.50 快取寫入費率、同樣的 272K-token 重新計價門檻——超過此門檻時,整個請求的輸入與快取都以 2 倍計費,輸出則以 1.5 倍計費;工具呼叫同樣必須使用 Responses API,也同樣不支援微調。知識截止日期從 2026 年 4 月 20 日移到 4 月 30 日——十天,這個數字正說明了這與其說是重建,不如說是多大幅度的改裝。
為什麼快取行的價值超乎表面

把快取讀取量減半,乍看之下是很奇怪的產品更新主打,直到你仔細看看代理流量的實際樣貌。代理迴圈在每一輪都會重新送出同一段穩定的前綴——系統提示、工具結構定義、檢索到的上下文、對話歷史——而在長時間的會話中,同一段前綴會被計費數十次甚至數百次。這正是快取命中率不再只是四捨五入的零頭、而是帳單上最主要那一行項目的流量類型。
試算一下單一長時間 agent 工作階段的數字。假設一個 120,000 token 的前綴在 40 輪中重複使用,因此每工作階段有 480 萬個快取輸入 token,再加上為數不多的 15 萬個全新輸出 token。在 GPT-6 Sol 上,快取讀取計費 $0.96,輸出計費 $1.50——每工作階段大約 $2.46。在 GPT-6.1 Sol 上,同一個工作階段的快取讀取計費 $0.48,輸出同樣是 $1.50:大約 $1.98。每工作階段差 48 美分,這不足以構成決策。但把它乘以每月十萬個工作階段,就是 $48,000——而這就足以構成決策了。
有兩點但書讓這個說法站得住腳。快取讀取只有在實際命中前綴時,才會以快取費率計費,所以你實際省下的是命中率乘以差額,而不是差額本身。而且前綴必須低於 272,000 個 token,標準費率才可能適用:一旦超過這條界線,整個請求就會重新計價,輸入和快取變成 2 倍、輸出變成 1.5 倍,這可能蓋過前綴省下的 10 美分。長上下文工作階段,正是快取計算最不可能像宣傳手冊所說那樣美好的情況。
基準差距真實存在,而它源自同一個地方
OpenAI 的發布貼文對其評估結果的說明異常具體,這點對它有利;但那些數字每一個都是供應商在替自家模型打分,這點則對它不利。這些數字呈現的模式相當一致:被廣泛引用的比較對象始終是 GPT-6 Astra,而與 Astra 的比較永遠是成本比較。在 DeepSWE v1.1 上,其說法是能以約五分之一的成本達到與 Astra 相當的表現。在 GDP.pdf 上,則是以每項任務約五分之一的成本逼近 Astra 的最先進水準。在 OSWorld 2.0 上,與 Astra 差距在 2.1 分以內,而每項任務成本約為其七分之一。在事實準確性上,與 Astra 差距在 1.9 分以內,且每項任務成本不到其五分之一。這並非撰稿時的偶然;這就是其產品論點,而且是一個關於價格、而非關於能力領先的論點。
OpenAI 唯一沒有套用自家宣傳框架的地方值得讚許:在 Terminal-Bench Science 0.1 上,它明白表示 GPT-6 Astra 在受測模型中仍以 68.1% 穩居最高分,且應該用於最艱難的科學研究。一篇會告訴你何時該買更昂貴同門產品的發布文,是一篇帶有幾分自律的發布文。
針對 GPT-6 Sol 而言,這項比較的誠實狀況是這樣——在這種配置下,兩個模型都沒有獨立評分。Artificial Analysis 對 GPT-6 Sol 在最大推理投入下有完整評估:Intelligence Index 為 48、每項 index 任務 $1.06、產生 7,700 萬個輸出 token,而排行榜中位數為 8,800 萬,以及 Coding Agent Index 為 57、每項任務 $2.99。截至 9 月 30 日,它完全沒有 GPT-6.1 Sol 的項目;該模型的 slug 會 404,而且該字串並未出現在即時排行榜上。因此,今天唯一可得的實測第三方比較,是 GPT-6 Sol 與其他實驗室模型之間的比較——而不是 GPT-6 Sol 與其自家後繼者之間的比較。現在任何人拿給你看的 6.1 對 6.0 圖表,都是在拿 OpenAI 的簡報投影片給你看。
這次移轉是字串變更,除非實際上並非如此。
在你切換識別碼之前,值得先讀一下 OpenAI 自己針對 GPT-6 系列的遷移指南,因為其中兩點會讓可運作的程式碼掛掉。第一點是推理階梯:如果有任何請求送出 reasoning_effort: "none",GPT-6.1 Sol 會拒絕,而文件中記載的補救方式是從 low 開始,並在具代表性的任務上比較,而不是假設最低設定就等同於它。過去看用 none 作為延遲基準的工作流程,會失去那個基準。第二點是工具呼叫:GPT-6.1 Sol 支援 Chat Completions,但不支援透過它進行工具呼叫——工具需要使用 Responses API。如果你的技術堆疊是在 /v1/chat/completions 上呼叫函式,那你不是在替換一個字串,而是在移植一個端點。廠商自己對已經使用 GPT-6 Sol 的開發者下達的指示,是在切換前先檢閱那份指南,這是一個相當明確的訊號:這並不是一週差距所暗示的那種可直接替換的更新。
其餘參數的運作方式不變:reasoning effort、結構化輸出、串流、提示快取與工具集全都可沿用,而相同的 272K 重新定價規則也以完全一樣的方式套用於兩個模型。請將 model 設為 gpt-6.1-sol,在原本支援的地方保留你的 effort 設定,並移除 temperature、top_p 與 top_logprobs,只要 effort 不是 none — 最後這一點適用於兩個模型,而且是任何推理模型遷移後常見的 400 錯誤來源。
在不將生產路徑押注於其上的情況下進行遷移

實際可行的遷移不是一次切換,而是一場影子運行:把一部分正式流量送往新的識別碼,讓舊的識別碼繼續擔任負責回應的路徑,並在你自己的任務上做比較。這是路由問題,而這正是你所呼叫的平台會改變工作形態的唯一所在。OrcaRouter 今天以 OpenAI 自家定價、零加成供應 GPT-6 Sol —— 包含 $2.00 / $0.20 / $10.00 這張價目表,以及 272K 重新計價規則 —— 因此比較中的基準組與其他所有服務跑在同一把金鑰上,而 6.1 這條分支只要一可呼叫,就能加入路由集合,不需要第二份合約或第二個 SDK。在那之前,誠實的立場是:GPT-6 Sol 才是目前可呼叫的模型,而這點值得明說,而不是反過來暗示:openai/gpt-6.1-sol 會回傳「model not found」,就在我們公開的 目錄端點上,今天確實如此。自動容錯移轉正是讓影子運行在真正上線時得以安全的原因 —— 如果新路由發生錯誤,請求會在舊路由上完成,而你是從日誌、而不是從使用者那裡得知。
現在誰該採用:成本主要來自長時間代理工作階段中快取輸入的團隊,以及工作流程已使用 Responses API、且從不傳送 none 的團隊。對他們來說,這幾乎是免費升級——供應商表示能力有所提升、快取率減半,而遷移只需改一個字串。誰該等待:在延遲關鍵路徑上使用 none 的團隊、工具呼叫透過 Chat Completions 進行的團隊,以及任何在投入之前需要 OpenAI 以外數據的人。對最後這群人而言,等待並沒有公布的結束日期,而這段時間最明智的做法,就是建立這項比較所需要的評估集——因為當獨立評分出現時,那會是針對別人的流量。

本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
