用於比較 GPT-6 與 Grok 4.7 的主視覺標題卡。標題寫著「GPT-6 vs Grok 4.7」。標籤寫著「GPT-6 Sol:1.05M 上下文、128K 輸出、$2.00 / $10.00」。標籤寫著「Grok 4.7:500K 上下文、450K 輸出、$2.00 / $6.00」。頁尾寫著「輸入價格相同;輸出價格與輸出上限則不然。」
Guides & Insights

GPT-6 與 Grok 4.7:輸出欄位決定一切

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

GPT-6 Sol與Grok 4.7在輸入 token 上收費相同——每百萬個都是 $2.00——這使得輸入那一欄在兩者之間毫無選擇價值。真正的決定住在右邊那一欄。GPT-6 Sol 每百萬個輸出 token 收費 $10.00;Grok 4.7 收 $6.00。而這兩個模型對於單次呼叫允許產出多少輸出,看法相差三點五倍:GPT-6 Sol 上限為 128,000 個 token,而 Grok 4.7——SpaceXAI 的旗艦模型,於 2026 年 9 月 21 日發布,是 Grok 4.6 的後繼者——則高達 450,000 個。

這場對決中其餘的一切,都可由那兩項事實推得,再加上另一項:GPT-6 Sol 擁有更大的上下文視窗,1,050,000 個符元,相較於 Grok 4.7 的 500,000。所以,這不是一個關於某個模型更優秀的故事。這是一個關於兩個擁有不同形態的模型的故事,也是一個關於你的工作負載屬於哪種形態的故事。

先把你請求的形式弄對。

釐清該選 Grok-6 還是 Grok 4.7 時,最實用的方法是看你的工作實際上消耗哪一種資源。三種情況就能涵蓋大多數的生產流量。

長輸入,短輸出。 你正餵入一份大型文件、一個程式碼庫或一段冗長的代理逐字稿,然後取回摘要、diff 或決策。在這裡,上下文視窗是綁定限制,而 GPT-6 Sol 的 1,050,000 個 token 大約是 Grok 4.7 的 500,000 的兩倍。但請注意兩張卡上的級距線:Grok 4.7 的 $2.00 費率適用於最高 200,000 個輸入 token,超過後升至 $4.00;而 GPT-6 Sol 的 $2.00 費率則一路適用到 272,000,之後才升至 $4.00。在 200,001 個 token 時,Grok 已經重新計價,而 GPT-6 Sol 還沒有,因此一份 250,000 token 的文件在 Grok 4.7 上每百萬 token 要價 $4.00,在 GPT-6 Sol 上則是每百萬 $2.00——在你把輸出算進去之前,就已經是兩倍。

短輸入,長輸出。 你正在生成:一份長篇文件、一個大型程式碼檔案、一個結構化產物,或是一連串工具呼叫而其結果必須由模型寫出。這正是 Grok 4.7 專為其打造的場景。450,000 個權杖的輸出上限,比大多數模型所允許的高出一個數量級以上;而且每百萬輸出權杖 6.00 美元對比 10.00 美元,你為每一個這樣的權杖少付 40%。如果你的生成內容經常超過 128,000 個輸出權杖,GPT-6 Sol 根本無法在一次呼叫中處理該請求,而 Grok 4.7 可以。

兩者都均衡且偏重。長輸入與長輸出同時出現,正是兩張卡會相互作用的案例。40 萬 token 的輸入加上 20 萬 token 的輸出,在 Grok 4.7 上的定價為輸入 $4.00、輸出 $12.00(兩者都超過其門檻),而在 GPT-6 Sol 上則是輸入 $4.00、輸出 $15.00。這是 GPT-6 Sol 每 token 反而較貴的唯一配置,在假設 ChatGPT 時代的預設選項較便宜之前,值得拿你自己的平均值來對照檢查。

OpenAI 改變了什麼,以及這為何在此地重要

GPT-6 是一個三模型系列,而 2026 年 10 月 7 日,OpenAI 將其中間那個模型推到大眾面前。ChatGPT 中的 GPT-6——也就是 Intelligent UI 的推行——在 Plus、Pro、Business 與 Enterprise 上由 GPT-6 Sol 驅動,在 Free 與 Go 上則由 GPT-6 Luna 驅動,觸及每週使用 ChatGPT 的超過 12 億人。這是關於發佈範圍的事實,而非關於能力的事實,而它改變了「GPT-6」在比較中的意涵:當有人說 GPT-6 在某項基準測試中擊敗或輸給另一個模型時,他們通常特別指的是 GPT-6 Sol,或是指旗艦級的 GPT-6 Astra,價格為 $10.00 / $50.00。

就這場對決而言,ChatGPT 的推出在一個具體層面上具有重要性。Grok 4.7 於 2026 年 9 月 21 日發布,比 GPT-6 Sol 早四天,而且它是純 API 與應用程式模型,沒有同等級的十億用戶消費者預設選項。SpaceXAI 自己對它的描述狹窄而具體:一款針對長時間運行的軟體工程、具備工具使用與自我驗證的代理式工作流程,以及知識工作的旗艦模型。這是一項關於輸出密集型工作的表述,而這正是 Grok 這張牌更強的那種格局。

記分板,誠實標註

這兩者的獨立評測來自 Artificial Analysis,而總結是:它們在綜合指數上很接近,但在個別測試上有所分歧,且分歧的方式與產品相符。

• AA Intelligence Index:Grok 4.7 46.4(在其評估的模型中排名第 16),GPT-6 Sol 47.6 — GPT-6 Sol 領先約一分
• Humanity's Last Exam:Grok 4.7 43.1%,GPT-6 Sol 47.9%
• SciCode:Grok 4.7 57.4%,GPT-6 Sol 57.6% — 實際上持平
• Long-Context Recall:Grok 4.7 76.7%,GPT-6 Sol 83.7% — GPT-6 Sol 領先,與更大的上下文視窗相符
• Terminal-Bench(Grok 規格卡上的 v4.0):Grok 4.7 25.8%,GPT-6 Sol 在同一測試框架系列上為 43.9%
• 程式開發:Grok 4.7 進入程式開發指數的前十分位,與排行榜上最強的模型並列

兩點但書,而且它們不是裝飾性的。這兩個模型的索引值是在不同日期評估的,所以這並非同日的正面對決,而那一分的差距也落在一次修訂所會造成的變動範圍內。此外,上文每一個 Grok 4.7 的數字,都是供應商自己公布、並收錄於目錄中的數字,不是我們重新跑出來的分數——誠實的解讀是:Grok 4.7 是名列前十分之一的程式碼模型,在通用推理綜合指標上落後 GPT-6 Sol 約一分,而 terminal-bench 的差距是這組資料中最大的單一訊號。

Screenshot of the OrcaRouter model page for Grok 4.7, showing the SpaceXAI Grok 4.7 card with a 500,000-token context window, up to 450,000-token output, text/image/file input and text output, and a tiered rate of $2.00 per million input and $6.00 per million output up to 200,000 tokens, stepping to $4.00 and $12.00 above.

規格表所隱藏的延遲與可靠性

已公布的費率表與基準測試表,都漏掉了真正決定生產環境服務品質的關鍵,因此值得看的是實測數字,而不是行銷數字。

根據 OrcaRouter 自家 playground 在 2026 年 10 月第一週的測量數據,Grok 4.7 回傳的中位首字延遲為 3,825 毫秒,輸出速度約為每秒 147 個 token,錯誤率約在 8% 左右。GPT-6 Sol 在同一段期間測得的中位延遲更高——6,363 毫秒——錯誤率也高出許多。這些都是在共用路由上的 playground 觀察結果,並非供應商的 SLA;而某一模型路由上出現 39% 的錯誤率,屬於路由問題,而非模型問題;這正是容錯移轉(failover)存在所要填補的那種落差。對比較而言,重點在於:在那段特定時間窗內,Grok 4.7 路由看起來明顯比 GPT-6 Sol 路由更即時、也更可靠,而兩家廠商發布的規格卡都不會告訴你這件事。

同時運行兩者,但不對任何一方做出承諾。

在如此接近的對決中,誘惑在於先依價格選定一個,然後三個月後才發現你的流量型態已經改變。這正是路由所解決的問題。在 OrcaRouter 上,grok/grok-4.7與 GPT-6 Sol 都是同一份目錄中的上線路由,共用一個 API 提供,採用供應商的定價、0% 加成——所以當 SpaceXAI 或 OpenAI 調整費率時,變更當天就會生效,而不是等到你下次對帳發票時才反映。跨供應商的自動容錯移轉能涵蓋某條路由效能劣化的情況,這點在上面提到的錯誤率差異下尤其相關。而路由 DSL 讓你能依請求型態、而非模型偏好來分配流量:把長輸入、短輸出的工作送給脈絡窗口較大的模型,把長輸出生成送給 450K 上限且輸出費率較便宜的那個,讓依請求大小判斷的述詞來做選擇,而不是由人來決定。

選擇

如果你的工作是長文件分析、大上下文推理,或任何輸入 token 超過 200,000 的任務,GPT-6 Sol 是更好的選擇:上下文長度是兩倍、獨立指標更高,門檻還再往外推 72,000 個 token。如果你的工作是生成——長篇程式碼產物、長篇寫作、模型必須把找到的內容完整寫出的長工具呼叫鏈——Grok 4.7 是更好的選擇:450,000 個 token 的輸出上限是 GPT-6 Sol 達不到的、輸出 token 便宜 40%,還有足以匹配、位居前 10% 的程式設計表現。如果你兩者都真的會做,答案不是某個模型,而是一條路由。

A comparison card titled 'The shape of the request decides'. Left column 'Grok 4.7': rows 'Context: 500K', 'Output: up to 450K', 'Input: $2.00 to 200K, then $4.00', 'Output: $6.00, then $12.00', 'AA Index: 46.4'. Right column 'GPT-6 Sol': rows 'Context: 1,050,000', 'Output: 128K', 'Input: $2.00 to 272K, then $4.00', 'Output: $10.00, then $15.00', 'AA Index: 47.6'. A footer reads 'Figures per each vendor's published card and Artificial Analysis; evaluation dates differ between models.'Screenshot of the OrcaRouter model page for GPT-6 Sol, showing the OpenAI GPT-6 Sol card with a 1,050,000-token context window, 128,000 maximum output, text/image/file input, and the tiered rate card of $2.00 per million input and $10.00 per million output up to 272,000 tokens, stepping to $4.00 and $15.00 above that.

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新