
GPT-6 對上 Grok 4.6:兩個中階方案,一份在超過 20 萬個 Token 後出現分歧的帳單
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
GPT-6 Sol 和 Grok 4.6在兩欄最上方所列的價格相同:每百萬輸入 token 為 2.00 美元,每百萬輸出 token 為 6.00 美元。但幾乎沒人會在旁邊註明的是,這兩欄會在請求中的不同位置開始對不上。Grok 4.6 在提示超過 200,000 個輸入 token 後就開始收取其長脈絡費率;GPT-6 Sol 則要等到 272,000 才啟動。一旦越過這些界線,整筆請求都會重新計價——不只是超出的部分——而且兩家廠商重新計價的方向正好相反,而這正是決定一次長時間 agent 執行帳單的關鍵。GPT-6 Sol 與同系列的 GPT-6 Astra 和 GPT-6 Luna 於 2026 年 9 月 22 日推出;Grok 4.6 是 SpaceXAI 產品線中的中階層級,於 2026 年 8 月 12 日推出,如今又已有 Grok 4.7 加入,因此這是兩款已上市模型之間的比較,而非其中任何一款的發表。
2026 年 10 月 7 日還發生了第二件事,這件事對你如何看待 GPT-6 至關重要:OpenAI 開始將GPT-6推送至 ChatGPT 的主要 Chat 分頁,並於 10 月 8 日觸及免費方案,其中 Plus、Pro、Business 與 Enterprise 方案運行 GPT-6 Sol,Free 與 Go 方案則運行 GPT-6 Luna。這是表面上的變化——相同的模型、遠為龐大的受眾,以及一個 OpenAI 稱為 Intelligent UI 的新介面層。它不會更動任何一項 API 費率。但它確實意味著,如果你正拿「GPT-6」與任何東西做基準比較,你現在的比較對象,是一個同時有極大量的人在瀏覽器分頁裡與之對話的模型。
兩張卡片真正不同之處
• 短上下文輸入 — GPT-6 Sol 每百萬 $2.00 vs Grok 4.6 每百萬 $2.00
• 短上下文輸出 — GPT-6 Sol 每百萬 $10.00 vs Grok 4.6 每百萬 $6.00
• 長請求門檻 — GPT-6 Sol 在輸入超過 272,000 個 token 時重新計價 vs Grok 4.6 超過 200,000
• 長請求輸入 — GPT-6 Sol 每百萬 $4.00 vs Grok 4.6 每百萬 $4.00
• 長請求輸出 — GPT-6 Sol 每百萬 $15.00 vs Grok 4.6 每百萬 $12.00
• 快取輸入 — GPT-6 Sol 每百萬 $0.20 vs Grok 4.6 每百萬 $0.50
• 上下文視窗 — GPT-6 Sol 1,050,000 個 token vs Grok 4.6 500,000 個 token
• 輸入模態 — 兩者皆接受文字、圖像和檔案
• 知識工作分數 — GPT-6 Sol 47.6 vs Grok 4.6 44.3,依據 Artificial Analysis Intelligence Index
• Terminal-Bench 2.1 — GPT-6 Sol 未公布於相同修訂版本 vs Grok 4.6 88.4
把兩行輸出合起來讀,決策的形貌就會浮現。Grok 4.6 在任何低於 200K 的請求上,每百萬個輸出 token 便宜 $4.00,而超過 200K 時只便宜 $3.00。這比標題上的 40% 所暗示的差距小得多,因為兩個模型都會對整個請求重新計價,而不是只對超過界線的那部分計價——這是個值得細想的細節,因為一段 200,001 個 token 的提示,並不是以 1 個 token 按較貴費率、再加上 200,000 個按較便宜費率來計費。
那麼,門檻本身的方向正好相反。Grok 4.6 比 GPT-6 Sol 提早 72,000 個 token 開始重新計價。對於持續落在 200K 到 272K 之間的工作負載而言,Grok 4.6 是較昂貴的模型,儘管其每 token 的宣傳價格較低,而且它是兩者中唯一出現任何變動的。你的提示落在該區間的哪一側,是比哪個宣傳價格較低更有用的問題。

基準差距比價格差距更小且更窄
在 Artificial Analysis 的 Intelligence Index 上——這是第三方衡量的指標,而非廠商自製的表格——GPT-6 Sol 以 47.6 位居其位,Grok 4.6 則為 44.3。在 0 到 100 的量表上,3.3 分的差距確實存在,但這並不是那種會讓某個模型不適合某項任務、而另一個模型適合的差距。這也是在每個模型特定的推理設定下測得的,而 GPT-6 Sol 提供可設定的推理強度,Grok 4.6 也提供它自己的設定——因此,任何引用單一正面對決數字的人,引用的其實是二維網格中的一個點。
兩者真正拉開差距的地方,在於終端機風格的代理式工作。在 Terminal-Bench 2.1 上,Grok 4.6 拿下 88.4。GPT-6 Sol 在我們目錄所收錄的修訂版本上,並沒有可比的已公布數字,而對空白欄位最誠實的解讀是:該數字並未公布——而非該模型表現不佳。如果工作負載是長時間執行、由 shell 驅動的代理,已公布的證據有利於 Grok 4.6,而缺失的證據不能算作任何一方的證據。
長文本知識檢索的情況則相反。GPT-6 Sol 在長脈絡回憶上錄得 83.7,對比 Grok 4.6 的 80.3,而兩款模型的供應商各自在其他地方公布自家數據——SpaceXAI 強調 Grok 4.6 的 GPQA Diamond 為 94.9,而 OpenAI 的 GPT-6 資料大多由供應商提供且未經重現。有兩條規則可讓此事保持清楚:供應商的數字是一項宣稱,而指數數字是對具名修訂版的量測。兩者不可互換,也絕不該被平均成單一的「更佳」分數。
後繼者問題
這兩者都不是各自實驗室最新的模型,若假裝不是如此,將會是這項比較所能做出最具誤導性的事。SpaceXAI 於 2026 年 9 月 21 日推出 Grok 4.7,基本費率同為 $2.00 / $6.00,而智慧指數從 44.3 升至 46.4。OpenAI 於 2026 年 9 月 29 日推出 GPT-6.1 Sol,同樣是 $2.00 / $10.00,智慧指數為 51.8,且有一項費率實際上有所改善:快取輸入從每百萬 $0.20 降至 $0.10。Artificial Analysis 現在將其 GPT-6 Sol 頁面標示為已棄用,並指引讀者改看 GPT-6.1 Sol。
所以公平的框架不是「你該採用這兩者中的哪一個」,而是「這兩者中的哪一個,而且你確定它不是任一邊再新一個世代的版本嗎?」留在 GPT-6 Sol 的理由,通常是某個具體的、八天前才完成的整合,而不是能力上的宣稱;留在 Grok 4.6 的理由,則是某個已公布的終端代理數據,而其後繼版本尚未在公開場合達到同樣的水準。兩者都站得住腳,而且兩者都有時效限制。

從一個按鍵同時執行兩者
兩個模型都由 OrcaRouter 路由,因此讓兩個候選模型並存的機械性成本為零:一個 API 就能串接 200 多個模型,同一把金鑰,不必簽第二份合約,兩者之間也無須修改程式碼。這點在這裡比平常更重要,因為在這個特定組合中,採用第二個模型的理由並非能力上的避險,而是路由決策——把 200K 到 272K 的視窗送給 GPT-6 Sol,較短的全部交給 Grok 4.6,同一個應用程式就能在這個門檻的兩側都拿到較便宜的帳單,而這個門檻是兩家供應商都不讓你自行選擇的。
自動容錯移轉是同一套設定中無聊的那一半。長脈絡的代理執行之所以漫長,正是因為有東西讓工作階段保持開啟,而供應商在第四十分鐘時出的狀況,是代價高昂的那種失敗。事先配置好的第二條路由,能把這變成一次重試,而不是重跑一遍。
我們的型錄將兩者都列在供應商自己的定價上,完全不加價,因此任一張卡的價格變動在供應商端生效的當天,我們這邊也會同步生效。這一點值得直白說明,而不是當作口號:值得在意的原因是,上面那個 $0.20 對比 $0.50 的快取輸入價差,正是供應商會悄悄調整的那種項目,而直通式定價意味著你永遠不必等經銷商跟上。

究竟是什麼決定了它
如果你的提示詞很短,Grok 4.6 在輸出價格上的勝出幅度,是任何索引差距都無法彌補的,而且它的終端代理分數是兩欄中已公布的最強數字。如果你的提示詞很長,GPT-6 Sol 較晚的重新定價門檻和較長的視窗,比它較高的輸出費率更有價值,而快取輸入那一項的成本只有四分之一。如果你的提示詞落在 200K 到 272K 之間,你手上握著的正是唯一一種工作負載:看似較便宜的模型,實際上才是較貴的那一個,而解決辦法是選擇路由,而不是選擇模型。
真正該留意的不是這兩個模型中的任何一個,而是已經上市的兩個後繼者。Grok 4.7 和 GPT-6.1 Sol 都削弱了在這裡等待決策的理由;而每隔三週就得重跑一次的比較,應該放在路由器後面,而不是架構文件裡。
本文中的比較3
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
