「GPT-5.6 vs Grok 4.6」的主視覺標題卡,眉題為「指數同為 61 — 價格與上下文分歧」:左側圓角卡片「GPT-5.6 Sol」(OpenAI — 2026 年 7 月 9 日發布;每 1M tokens 為 $4.00 / $20.00;約 1.05M 上下文 · 128K 輸出;最大努力 = 4 個子代理)與右側圓角卡片「Grok 4.6」(SpaceXAI — 2026 年 8 月 12 日發布;每 1M tokens 為 $2.00 / $6.00;500K 上下文 · 無輸出上限;努力程度撥盤從低到超高),頁尾為「獨立 AA 指數:61 = 61。」,OrcaRouter 標誌位於右下角。
Guides & Insights

GPT-5.6 vs Grok 4.6:指數持平,上下文與價格分道揚鑣

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

在 Artificial Analysis Intelligence Index 量表上,兩者截至2026年9月初的測量中,OpenAIGPT-5.6——其旗艦等級 GPT-5.6 Sol 就是 gpt-5.6 API 名稱所指——和 SpaceXAI 的 Grok 4.6 得分同為 61。獨立指數將兩款競爭旗艦並列,在前沿比較中實屬罕見,而這正是這場對決的精彩起點,而非終點。打成平手的這兩款模型,銷售方式截然不同。GPT-5.6 Sol 是 OpenAI 於7月9日發布的旗艦,在9月3日 GPT-6 Astra 推出後重新定位為價值等級;自8月24日降價後,定價為每百萬輸入代幣 4.00 美元、每百萬輸出代幣 20.00 美元,可讀取約 105 萬個代幣的上下文。xAI 於8月12日發布的 Grok 4.6,定價為每百萬輸入代幣 2.00 美元、每百萬輸出代幣 6.00 美元,最高支援 50 萬個代幣。在獨立指數上平分秋色,但兩款模型在單一請求能走多遠——以及走這一步要花多少——上分道揚鑣。

這個頁面現在存在有其具體原因:兩張費率表與兩個上限在數週內接連變動。Grok 4.6 於 8 月 12 日發布,最初兩週僅限於 Grok Build 和 API,隨後於 8 月 28 日在 Web 與行動裝置的一般 Grok 聊天中開放使用。GPT-5.6 Sol 的促銷降價於 8 月 24 日生效,十天後 GPT-6 Astra 的推出悄然將 Sol 從旗艦降為平價旗艦。以下兩款型號現在都是你在不想支付 Astra 等級價格、卻又需要接近前沿推理能力時會選擇的對象——這正是 61 比 61 的平手之所以成為實際決策點、而非冷知識問題的原因。

「「以61平手」是什麼意思,以及它不是什麼意思」

這個分數需要日期和量尺。Artificial Analysis 在截至九月初所使用的指數量表上,測得 GPT-5.6 Sol 約 61 分、Grok 4.6 61 分——也就是本部落格其他 GPT-5.6 對戰所引用的量表——Grok 在 AA 追蹤的 202 個模型中排名第 11,Sol 則以相同分數位居其後數名之內。AA 隨後於 9 月 7 日重新校準了指數(v4.3),這個版本會壓縮分數:GPT-5.6 Sol 在新量表上測得 47 分,GPT-6 Astra 與 Claude Fable 5.1 測得 53 分,而 Grok 4.6 尚未在新量表上公布整體分數。因此,下方的平手是針對重新校準前的九月量表所作的陳述,最好解讀為相對位置:在最近一次同時評分兩者的指數中,這兩者勢均力敵,且都緊跟在 Claude Opus 5 等級之後。

{{1}}關於這個平手,還有一點需要注意,而這會影響你如何使用這個結果。{{/1}} {{2}}這兩個分數是在不同的努力設定下產生的{{/2}} — {{3}}GPT-5.6 Sol 使用 max reasoning 設定,也就是 OpenAI 的最高檔位(在處理困難請求時會運行四個並行子代理){{/3}},而 {{4}}Grok 4.6 使用 high 設定,即 xAI 在 low 到 xhigh 刻度上的預設值。{{/4}} {{5}}兩者都是「全力以赴」的配置,但並非同一種配置;這次的平手只存在於這兩個特定設定之間,而非兩個模型所提供的所有設定之間。{{/5}} {{6}}這個平分結果所確立的是:沒有任何一個模型握有另一方陣營可以在獨立綜合指標上指出的通用智慧優勢{{/6}} — 因此,{{7}}要在兩者之間抉擇的買家,必須跳脫指標數字,去看實際情境、價格,以及雙方真正能拿出的證據。{{/7}}

兩張費率卡,兩道懸崖

兩家供應商都將長提示詞視為高級事件來計費,而且一旦超過門檻,整個請求就會按較高費率計費——這就是讓這份價格比較清晰易懂的共同機制。OpenAI 對 GPT-5.6 Sol 的費率是每百萬 tokens $4.00 / $20.00,快取讀取為 $0.40;一旦請求的輸入 tokens 超過約 272K,整個請求就會重新定價為 $8.00 / $30.00——這是 Epoch AI 於 9 月 8 日記錄的長上下文結構。xAI 對 Grok 4.6 的費率是每百萬 tokens $2.00 / $6.00,快取讀取為 $0.50;一旦提示詞超過 200K tokens,整個請求就會改為 $4.00 / $12.00。

已發布 — GPT-5.6:2026年7月9日(公開API;gpt-5.6 別名達到 Sol tier)。Grok 4.6:2026年8月12日。

每1M定價(輸入/輸出) — GPT-5.6 Sol:$4.00 / $20.00,快取讀取 $0.40(優惠至少至 2026年11月21日)。Grok 4.6:$2.00 / $6.00,快取讀取 $0.50。

長提示詞方案 — GPT-5.6 Sol:在超過約 272K 輸入後,整個請求為 $8.00 / $30.00。Grok 4.6:在 200K 輸入時,整個請求為 $4.00 / $12.00。

上下文 / 輸出上限 — GPT-5.6 Sol:約 1.05M 輸入,128K 輸出。Grok 4.6:輸入 500K,無公開的輸出上限。

指數(獨立) — GPT-5.6 Sol(max)約 61,對比 Grok 4.6(high)的 61,為重新校準前的九月量表。

模態 — 兩者皆接受文字與圖像輸入並產生文字。

將這些實際數字代入計算,模式一目了然:在 Grok 4.6 能應付的每一種提示長度下,它都是更便宜的選擇,因為其重新定價後的上限仍落在 GPT-5.6 Sol 的標準費率或更低。

100K 輸入 / 8K 輸出 — GPT-5.6 Sol:0.10 × $4 + 0.008 × $20 = $0.56。Grok 4.6:0.10 × $2 + 0.008 × $6 = $0.25。Grok 在此請求上大約便宜 55%。

400K 輸入 / 30K 輸出(兩者均已重新定價) — GPT-5.6 Sol:0.40 × $8 + 0.03 × $30 = $4.10。Grok 4.6:0.40 × $4 + 0.03 × $12 = $1.96。即使在其自身價格陡升之後,Grok 仍約為半價。

600K 輸入 / 30K 輸出——GPT-5.6 Sol:0.60 × $8 + 0.03 × $30 = $5.70。Grok 4.6:無法處理——600K 超出其 500K 的上下文視窗。正是在這個區間,Sol 是唯一選項,其價格也不再顯得昂貴。

A two-column scoreboard titled 'GPT-5.6 vs Grok 4.6 — the scoreboard'. Left column 'GPT-5.6 Sol': Released Jul 9 2026; Price $4.00 / $20.00 per 1M, cache $0.40; Over 272K input whole request $8.00 / $30.00; Context / output ~1.05M / 128K; AA Intelligence Index ~61 (max); SWE-bench Verified ~96% (reported). Right column 'Grok 4.6': Released Aug 12 2026; Price $2.00 / $6.00 per 1M, cache $0.50; At 200K input whole request $4.00 / $12.00; Context / output 500K / no published cap; AA Intelligence Index 61 (high); GPQA Diamond 94.9% (reported). Footer: 'Independent index: tied at 61 — AA scale, pre-Sept-7 2026 recalibration.'; OrcaRouter logo bottom-right.

懸崖幾何在一個方面有利於 GPT-5.6 Sol:其門檻(272K)高於 Grok(200K),因此在約 200K 至 272K 的輸入範圍內,Grok 已經重新定價,而 Sol 尚未如此。即使在該範圍內,Grok 往往也在美元成本上勝出,因為其重新定價後的輸出費率為 $12,仍比 Sol 的標準 $20 低 40%。經濟效益只有在超過 500K token 時才轉向對 Sol 有利,而那正是 Grok 的上下文視窗無法進入的區域。若你的提示長度保持在 200K 以下——多數聊天、RAG 與程式碼輔助流量皆屬此類——Grok 4.6 在混合成本上將近只有 Sol 的一半,而整體請求的懸崖效應意味著你應將 200K 視為規劃邊界,而非軟性建議。

Sol 額外的五十萬個 token 實際上是為了什麼

Grok 4.6 的 500K 視窗所能容納的真實工作負載,比規格表所暗示的更多——涵蓋整個程式碼庫的讀取、長篇代理程式紀錄、大型檢索情境——而且它沒有公開輸出上限,這在生成端反而是一項優勢:對於單次呼叫必須產生極長內容的情況,Grok 沒有明文上限,而 GPT-5.6 Sol 則止步於 128K 輸出 tokens。GPT-5.6 Sol 的優勢在於 500K 到 1.05M 這個區間,而真正需要它的工作負載,其實比行銷宣稱的更窄:例如在上下文中同時持有整個儲存庫與長篇任務歷史的代理程式、需要一次性分析完畢的超長會議或研究紀錄,以及針對太大而無法切進 Grok 等級視窗的語料庫進行檢索的工作。如果你的任何管線都不會觸及那個區間,Sol 多出來的上下文就是你在 $4.00 輸入費率下付了錢卻用不到的餘裕。

這兩個模型在引導推理的方式上也不同。GPT-5.6 Sol 提供低/中/高/最高四段投入程度調整,其中「最高」模式會平行執行四個子代理,協作處理困難任務——基本上每個棘手請求都是一個小型代理群,能力強但輸出 token 成本高昂,也是造就約 61 指數分數的設定。Grok 4.6 則執行單一模型,配備低到極高(預設為高)的調整檔位,以及伺服器端的搜尋與程式執行工具,這讓其行為更容易預估預算:一個請求、一個模型,成本可依費率表估算。對想要固定花費的開發者而言,Grok 的單一模型設計在營運上較簡單;而對最困難的長程任務來說,Sol 的「最高」模式群集才是能力更強的配置——這也正是其最佳分數與最糟帳單來自同一設定的原因。

雙方實際上能出示的證據

這兩個模型在獨立的程式碼計分板上都沒有優勢,所以可引用的證據隨供應商而分裂。OpenAI 報告 GPT-5.6 Sol 在 SWE-bench Verified 上約為 96%——這是兩個模型中能拿出最強程式碼評測成績,但也是已回報、卻尚未公布獨立稽核的評測——而 Sol 在真實世界的優勢還包括內建於 Codex 和 ChatGPT 工具中。xAI 回報 Grok 4.6 在 GPQA Diamond 上達 94.9%,宣稱是該基準測試過的最高分,並引用代理式評測,平均每個綜合性任務約耗費 0.84 美元的 API 成本;這些都是供應商數字。在速度上,兩者差距比價格差異所顯示的更小:AA 量測到 Grok 4.6 在標準伺服下每秒輸出 64.9 個 token,GPT-5.6 Sol 也在每秒 60 多個 token 的相同區間;而 OpenAI 另外由 Cerebras 驅動的「Ultrafast」預覽版(最高約每秒 750 token)依然有限制且未定價。整張證據表應讀為:指標上平手、雙方的程式碼成績單都無獨立稽核、也沒有足以改變決策的速度差距。

在2026年9月,哪種預設是理性的?

當你的流量低於 200K tokens 的輸入量時,請選擇 Grok 4.6——在它所服務的每一種長度上,價格都接近一半,獨立指數顯示兩款模型水準相當,而且單一模型的調度搭配伺服器端工具,能讓帳單保持可預測。當你確實需要 500K 到 1.05M 的上下文區間,當你的技術棧已經是 Codex 或 ChatGPT 原生,且報導中約 96% 的 SWE-bench 數字能為採購提供一份編碼能力的收據,或者當你想要四個子代理的最大努力配置來應付最困難的長期任務時,請選擇 GPT-5.6 Sol。另外要留意兩個日期:GPT-5.6 Sol 的 $4/$20 促銷價僅保證至少到 2026 年 11 月 21 日,此後這份比較就會改變;而 xAI 已預告 Grok 4.7——這兩件事的任何一件都可能重新調整你即將標準化的這組對比價格。

無需重新架構即可同時執行兩者

由於指標上的平手代表這是上限與價格的決策,而非品質決策,大多數團隊的實際模式是路由而非擇一。GPT-5.6 Sol 和 Grok 4.6 都以供應商的牌價掛在 OrcaRouter 上,零加價轉傳——OpenAI 的 $4/$20 與 xAI 的 $2/$6 就是列表上的數字,當任一廠商調整費率時,新價格會在當天以相同金鑰即時生效。只要一個 OpenAI 相容的端點,你就可以將 200K 以下的流量發送至 Grok 4.6將需要 Sol 更長的上下文或其最大努力配置的提示升級,並使用自動故障轉移,讓某一供應商路徑上的速率限制成為路由事件而非服務中斷。

A screenshot of the OrcaRouter model page for GPT-5.6 Sol (model id openai/gpt-5.6-sol), showing the header price of $4.00 in / $20.00 out per 1M tokens, tags including Vision, Tools, JSON and Reasoning, 'by OpenAI — 2026-07-09', a description of GPT-5.6 Sol as the flagship model in OpenAI's GPT-5.6 series covering deep multi-step reasoning, large-scale software engineering and long-horizon agentic work over a 1.05M-token context window with up to 128K output tokens, and the site's latest-model navigation.

這份比較的價格部分正是會變動的所在——OpenAI 的 Sol 促銷僅保證至 11 月 21 日,而 xAI 的路線圖上列有 4.7——因此本部落格持續更新的參考依據是其 GPT-5.6 Sol 定價頁面,每當資費表變更時,該頁面都會加上日期戳記並重新驗證。

A screenshot of OrcaRouter's '$4 / $20 per 1M Tokens — After the Price Cut' pricing article on the GPT-5.6 Sol promotional rate, bylined Gideon Frost, shown alongside the site's LATEST MODELS rail.

兩行答案

如果你的提示詞在 500K token 以內——而大多數情況確實如此——Grok 4.6 在它能服務的每個長度上,都以接近一半的價格提供與 GPT-5.6 Sol 相同的獨立指數分數,且沒有公開的輸出上限,還有一個可預測的單一模型調節盤。GPT-5.6 Sol 則在 Grok 無法觸及的區間贏得它的溢價:超過 500K token 的上下文,以及在 OpenAI 工具鏈內部,其報導的約 96% SWE-bench Verified 分數,加上其下的 Terra 和 Luna 層級,給你一個家族而非單一模型。指數上的平手意味著這個決定關乎上限與金錢,而非能力——所以在投入之前,先量測你最長的真實提示詞,因為那個單一數字會決定贏家。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新