一篇比較 GPT-6 Sol 與 Grok 4.7 的文章主視覺標題卡,標題為「GPT-6 Sol vs Grok 4.7」,副標題為「更便宜的 token,成本卻高出三倍」,並顯示統計數據「240M vs 77M 輸出 token」,其中 Grok 4.7 的輸出價格為 $6.00、每項任務 $3.74,而 GPT-6 Sol 的輸出價格為 $10.00、每項任務 $1.06。
Guides & Insights

GPT-6 Sol 對決 Grok 4.7:更便宜的 Token,代價卻高三倍

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

兩款模型在 2026 年 9 月相隔一天推出,而單看標價,兩者差距並不小。 Grok 4.7 於 9 月 21 日登場,每百萬個輸入詞元為 2.00 美元,每百萬個輸出詞元為 6.00 美元。 GPT-6 Sol 於 9 月 22 日登場,輸入同樣是 2.00 美元,輸出則是 10.00 美元。Grok 的輸出便宜了 40%。大多數比較都會以此為依據而選擇它,但這正是你不該看的數字。

決定這組配對的數字不在任何一張價目表上。它是 2.4 億對上 7,700 萬——也就是 Artificial Analysis 執行其 Intelligence Index 時,各個模型所生成的輸出 token 數。Grok 4.7 為了回答同一組問題,燃燒了略超過三倍的 token。把這個數字乘上每 token 費率,輸出較便宜的那個模型,每完成一項任務最終要花 3.74 美元,而另一個是 1.06 美元。每 token 更便宜,帳單卻超過三倍。

每個模型實際上是什麼

Grok 4.7 是 xAI 推出的 Grok 4.6 後繼模型,定位為其最強的程式設計與知識工作模型,具備 500,000 個 token 的上下文視窗、文字與圖像輸入、文字輸出,以及可設定為低、中、高與 xhigh 的推理強度。xAI 尚未披露參數數量。它採用的預訓練截止點據報導為 2026 年 6 月,並有補充訓練持續到 8 月。

GPT-6 Sol 是 OpenAI 的中階 GPT-6 模型——定位低於旗艦級 GPT-6 Astra,高於平價版 GPT-6 Luna——具備 1,050,000 個 token 的上下文視窗、922,000 個 token 的最大輸入、128,000 個 token 的輸出上限,以及 2026 年 4 月 20 日的知識截止點。它支援文字與圖像輸入、文字輸出,推理強度可從 none 到 max,而 OpenAI 將其定價描述為永久性而非促銷性。

上下文視窗並不接近。Sol 的大約是兩倍。這對某一類工作負載確實有影響,而那不是大多數人會跑的那一類。

價目表,以及反轉它的那一行

• 輸入 — GPT-6 Sol 每百萬個 token $2.00,相較於 Grok 4.7 每百萬個 token $2.00;完全相同

• 輸出 — GPT-6 Sol 每百萬個 token 10.00 美元,相較於 Grok 4.7 每百萬個 token 6.00 美元;Grok 便宜 40%

• 快取輸入 — GPT-6 Sol 每百萬個符元 $0.20,對比 Grok 4.7 每百萬個符元 $0.50;Sol 的快取讀取便宜了兩倍半,這與輸出費率所暗示的正好相反

• 快取寫入 — GPT-6 Sol 每百萬個 token 2.50 美元,而 Grok 4.7 的費率未列於同一張表上

• 上下文視窗 — GPT-6 Sol 1,050,000 個詞元,對比 Grok 4.7 的 500,000 個詞元

• 長脈絡附加費 — GPT-6 Sol 會對超過 272,000 個輸入權杖的請求重新計價,整筆請求的輸入與快取費率為 2 倍、輸出費率為 1.5 倍;相較之下,Grok 4.7 則是在 200,000 個輸入權杖時將所有費率加倍,同樣適用於整筆請求

• 知識截止點 — GPT-6 Sol 為 2026 年 4 月 20 日,對比 Grok 4.7 的預訓練截止點據報導為 2026 年 6 月,並有補充訓練持續至 8 月

• 推理強度 — GPT-6 Sol:無、低、中(預設)、高、極高、最大,對比 Grok 4.7:低、中(預設)、高、極高

• 模態 — 文字與圖像輸入,文字輸出,兩者皆適用

快取那一列才是買家該好好權衡的。Grok 的輸出費率較低,但它的快取輸入是 Sol 的兩倍半,而快取輸入正是長篇代理歷史與重複系統提示所在之處。若某項工作負載主要是反覆重讀一大段穩定的上下文,就會發現兩者遠比 $6 對 $10 所暗示的接近得多——而一旦再把 token 量比例套上去,排序就會反轉。

A six-row scoreboard card titled 'GPT-6 Sol vs Grok 4.7 - the scoreboard', comparing the two models on output price, cached input, context window, Intelligence Index score, index output tokens and cost per task. The left column lists GPT-6 Sol at $10.00 output, $0.20 cached input, a 1,050,000-token context, an Index of 48, 77M index tokens and $1.06 per task; the right column lists Grok 4.7 at $6.00 output, $0.50 cached input, a 500,000-token context, an Index of 46, 240M index tokens and $3.74 per task. A footer reads 'Vendor list prices; index figures per Artificial Analysis.'

為什麼 2.4 億個 token 就是故事的全貌

Artificial Analysis 測得 Grok 4.7 在 xhigh 設定下,於其索引測試中產生約 2 億 4,000 萬個輸出 token,相較之下,同一排行榜上各模型的中位數約為 8,800 萬個。其自家的摘要稱該模型「明顯緩慢且極為冗長」。在同一測試框架下測量的 GPT-6 Sol 產生了 7,700 萬個——在排行榜上被描述為「相當簡潔」。

該排行榜也直接反映了其後果。Grok 4.7 在 Intelligence Index 上得分 46,每項任務成本為 3.74 美元。在其高設定下,得分同樣是 46,而每項任務成本為 2.73 美元。GPT-6 Sol 得分 48,每項任務成本為 1.06 美元。相同的指數、相同的測試框架,卻存在兩到三倍半的成本差異,而這是任何價目表都不會顯示的。

在你把這些數字當成乾淨的一對一較量之前,有兩點必須留意。這兩個頁面是在同一天擷取的,但兩份榜單的總數不同——Grok 的頁面顯示的是 212 個模型的類別,而另一份 Grok 列表則回報為 655 名之中的排名——因此這兩個分數不保證出自同一個索引建置版本。而且這兩個數字都不是廠商提供的數據:Artificial Analysis 跑的是自家評測框架,這正是重點所在,但兩份列表的推理設定並不相同(Grok 為 xhigh,Sol 為 max),所以請把 500% 的成本差距當作實質發現,而把 2 點的指數差距視為約略值。

Screenshot of the Artificial Analysis model page for Grok 4.7 (xhigh), captured 23 September 2026, showing an Intelligence Index score of 46, list pricing of $2.00 per million input tokens and $6.00 per million output tokens with a 75% cache discount, a cost of $3.74 per Intelligence Index task, 240 million output tokens generated during the index run, a 500,000-token context window and 39.2 output tokens per second.

xAI 發表了什麼,以及沒有人查核過什麼

xAI 自家公布的發布數據很強,而且一如所有廠商的發布數據,未經重現。CursorBench 4.0 在 xhigh 下為 46.3%,對比 Grok 4.6 的 40.4%。Terminal-Bench 4.0 為 38.0%,對比 20.3%——這是本次發布中最大的單一增幅。DeepSWE v1.1 在 high 下為 71.0%,對比 65.2%。EEBench 為 64.0%,對比 53.0%。那些都是 xAI 的測試框架、xAI 的設定、xAI 的報告。

OpenAI 為 GPT-6 Sol 提供的數字遵循同樣的模式,也理當被打上同樣的折扣。差別在於,Sol 比 Grok 多了一項獨立證據:Artificial Analysis 的每任務成本數字,而這項數字是根據實測的 token 消耗量計算得出,而非取自供應商的評分表。那才是經得起這番比較的數字。

無論是哪一個模型,都沒有人發表過在相同任務上、使用相同測試框架與相同努力設定的正面對決。如果你看到這樣的結果,就檢查那三個變數中哪一個變了。

為一個月的快取代理流量定價

設想一個工作負載,其主要內容大多是穩定上下文:一個程式設計代理,帶有 60,000 個 token 的系統提示與儲存庫摘要,每月在 5,000 次呼叫中重新讀取,每次傳回 4,000 個輸出 token。假設快取運作正常,且穩定前綴以快取費率計費。

在 GPT-6 Sol 上:3 億個快取輸入 token,每百萬 $0.20,共 $60.00。2,000 萬個輸出 token,每百萬 $10.00,共 $200.00。總計 $260.00。

在 Grok 4.7 上:同樣的 3 億個快取輸入 token,以每百萬 $0.50 計算,是 $150.00。2,000 萬個輸出 token,以每百萬 $6.00 計算,是 $120.00。總計,$270.00。

幾乎完全相同——而且這還是在 token 用量保持不變的前提下,這是個相當寬鬆的假設。Grok 4.7 在 index 執行中測得的冗長程度是 Sol 的三倍。即使只對輸出量套用 1.5 倍乘數,Grok 的帳單也會達到 $330.00,而 Sol 是 $320.00,且差距會從此進一步擴大。較便宜的輸出費率在快取加上冗長度的情況下根本站不住腳;單是快取就已經勉強撐得住。

這裡沒有任何內容是在宣稱這兩個模型透過 OrcaRouter 的價格——兩者都不在我們的目錄中。GPT-6 Sol 可透過 OpenAI 自家的 API 存取,而 Grok 4.7 則透過 xAI 的;Grok 系列其餘部分,包括 Grok 4.6,都可透過我們路由 在直通模式下,以 xAI 的定價。這番算術的重點在於,你寫下的升級規則應該以你自己流量上每完成一項任務的成本為依據,而不是依據價目表——而路由層正是讓你能在不必簽第二份合約的情況下測試該規則的機制。

Screenshot of OrcaRouter's model page for Grok 4.6, captured 23 September 2026, showing the model id grok/grok-4.6 from provider SpaceXAI, a 500,000-token context window, text, image and file input, list pricing of $2.00 per million input tokens and $6.00 per million output tokens, and an OpenAI-compatible API served over both /v1/chat/completions and /v1/responses. Grok 4.7 itself does not appear on the catalogue.

每個所屬之處

• 高用量、快取上下文的代理工作 — GPT-6 Sol。快取輸入這一項對 Sol 有利 2.5 倍,而輸出量這一項則比 Grok 的還差,而且兩者會疊加。

• 想在本版本中取得已公佈的最強 Terminal-Bench 進步的程式設計工作——Grok 4.7 就是擁有那個數字的模型,而且數字很大。只要為 token 編預算,而不是為費率。

• 超過 500,000 個詞元的長文件——GPT-6 Sol,而且這根本不是場勢均力敵的較量。Grok 的視窗才到 Sol 的一半就結束了。

• 延遲敏感的路徑——兩者皆非。Artificial Analysis 將 Grok 4.7 列為每秒 39.2 個輸出 token,並形容其明顯緩慢。在你假設 Sol 更快之前,先查看目前看板上 Sol 本身的速度數據。

• 如果你看到的是以每個 token 為單位的比較,而且結論停在「所以 Grok 比較便宜」——那它就少走了最後一步。下一步是計算 token 的數量。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新