
GPT-6.1 Sol vs Grok 4.7:全場最便宜的輸出費率,以及最昂貴的對話
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
Grok 4.7,xAI 的 Grok 4.6 後繼者,於 2026 年 9 月 21 日問世,每百萬輸入詞元 2.00 美元、每百萬輸出詞元 6.00 美元。GPT-6.1 Sol,OpenAI 的中階更新版,則在八天後的 9 月 29 日推出,輸入 2.00 美元、輸出 10.00 美元。輸入價格完全相同,Grok 4.7 的輸出價格便宜 40%,而大多數比較就到此為止。但這正是錯誤的止步之處,因為同一個獨立評測機構如今已對兩個模型進行了端到端測量:Grok 4.7 完成 Artificial Analysis Intelligence Index 大約燒掉 2.4 億個輸出詞元;GPT-6.1 Sol 則燒掉 6,700 萬個。把較便宜的費率乘上三倍半的用量,每詞元價格較低的模型每完成一項任務要花 3.74 美元,而另一個只要 0.72 美元。
兩款模型,相隔八天,還有一張反轉的價目表
Grok 4.7 是 xAI 最強大的程式編寫與知識工作模型:具備 500,000 個 token 的上下文視窗,根據供應商自家列出的規格,單次回應最多可輸出 450,000 個 token,支援文字、圖像與檔案輸入,推理強度可設定為 低、中(預設)、高與極高。xAI 並未公開參數數量,據報導其預訓練截止時間為 2026 年 6 月,並持續補充訓練至 8 月。
GPT-6.1 Sol 是 OpenAI 對 GPT-6 Sol 層級的單級更新,定位在 GPT-6 Astra 之下、GPT-6 Luna 之上:具備 1,050,000 個 token 的上下文——約為 Grok 的兩倍——輸出上限為 128,000 個 token,約為 Grok 的三分之一,知識截止日為 2026 年 4 月 30 日,並支援相同的文字、圖像與檔案輸入。其推理階梯從 低到最高,預設為中,且它完全不再接受無。
每個維度一行,每一行兩側都要顯示:
• 輸入 — GPT-6.1 Sol 每 100 萬個 token 為 $2.00,對比 Grok 4.7 每 100 萬個 token 為 $2.00;相同
• 輸出 — GPT-6.1 Sol 每 100 萬個 token 為 $10.00,對比 Grok 4.7 每 100 萬個 token 為 $6.00;Grok 便宜 40%
• 快取輸入 — GPT-6.1 Sol 每 100 萬個 token 為 $0.10,對比 Grok 4.7 每 100 萬個 token 為 $0.50;Sol 的價格只有五分之一,這與輸出那行所暗示的情況正好相反
• 上下文視窗 — 1,050,000 個 token 對比 500,000 個 token
• 單次回應的最大輸出 — 128,000 個 token 對比聲稱的 450,000 個 token
• 長上下文級距 — 超過 272,000 個輸入 token 時,整筆請求重新計價,輸入與快取為 2 倍、輸出為 1.5 倍;對比超過 200,000 個輸入 token 時所有費率加倍,同樣以整筆請求計算
• 推理強度 — 低、中(預設)、高、極高、最高,對比低、中(預設)、高、極高
• 權重與參數 — 封閉、未公開,對比封閉、未公開;兩者都不提供檢查點
• 已公布最高推理強度下的智慧指數 — GPT-6.1 Sol 在最高推理強度下為 51.8,對比 Grok 4.7 在極高推理強度下為 46.4
• 每項指數任務成本(獨立計算) — $0.72,對比 $3.74
• 指數測試執行時的輸出 token — 6,700 萬個 token,對比 2.4 億個 token,而排行榜中位數接近 8,100 萬
那份清單裡的兩行就是整場比較的全部。Grok 4.7 的輸出費率確實較低,而它的快取那一行確實高出五倍;而且它為了接受量測而生成的 token 數是三倍半。單看費率表,指向的是其中一個方向。實際量測則指向另一個方向,差距達五倍。

Grok 4.7 真正領先的地方
把這篇文章定調成一面倒的勝利會是不誠實的,因為 Grok 4.7 在真實評估中勝出。在 Artificial Analysis v4.3.2 上以已公布的最大努力設定並排評分——Grok 為 xhigh,Sol 為 max,這個配置差異值得自始至終謹記:
• GDPval-AA v2.1 — Grok 4.7 Elo 1715.4 vs GPT-6.1 Sol Elo 1575.1。在具經濟價值的知識工作上,領先 140 點 Elo,也是較低費率模型最大的一次單一獨立勝出。
• AutomationBench-AA — Grok 4.7 0.6556 vs GPT-6.1 Sol 0.6487。實際上打成平手,名義上算是 Grok 的。
• SciCode — Grok 4.7 0.5741 vs GPT-6.1 Sol 0.5417。在科學程式設計上領先 3.2 分。
• Terminal-Bench 4.0 — Grok 4.7 0.2576 vs GPT-6.1 Sol 0.5606。落後 30 分,是這組配對中最大的差距。
• Humanity's Last Exam — Grok 4.7 0.4314 vs GPT-6.1 Sol 0.5292。
• AA-LCR v1.1,長上下文推理 — Grok 4.7 0.7667 vs GPT-6.1 Sol 0.83。
• AA-Omniscience — Grok 4.7 32.0 vs GPT-6.1 Sol 41.5。
• GDP.pdf — Grok 4.7 0.20 vs GPT-6.1 Sol 0.31。
• CritPt — Grok 4.7 0.1771 vs GPT-6.1 Sol 0.3171。
九項評估中有三項由 Grok 4.7 勝出或打成平手,包括最難以反駁的那一項:GDPval-AA 旨在為具經濟價值的專業工作定價,而 140 分的 Elo 領先並非雜訊。如果你的工作負載正是 GDPval 所設計要代表的那種類型——大量文件分析、專業交付成果、有正確答案的判斷決策——那麼價目表較便宜的模型在中立排行榜上也是更好的模型,而每項任務成本的劣勢就是你為此付出的代價。
xAI 自家公布的發表數字相當亮眼,而且一如所有廠商發表的數據,都未經重現。CursorBench 4.0 在 xhigh 下達到 46.3%,對比 Grok 4.6 的 40.4%;Terminal-Bench 4.0 為 38.0%,對比 20.3%,是此次發表所宣稱的最大單一增幅;DeepSWE v1.1 在 high 下為 71.0%,對比 65.2%;EEBench 為 64.0%,對比 53.0%。這些都是 xAI 自家的測試框架、xAI 的設定、xAI 的報告——而且請注意,Terminal-Bench 4.0 的 38.0% 宣稱值,對上的是獨立排行榜中同一模型、同一基準的 0.2576,這正是廠商調校過的組態與中立的最大投入跑分之間,你所該預期見到的那種落差。
OpenAI 對 GPT-6.1 Sol 所公布的數字也該打上同樣的折扣,並且有著同樣的弱點。在這項比較中,唯一兩家廠商都未提供的數字,是每完成一項任務的成本,因為它是根據實測的 token 消耗量計算而來,而非出自評分表。那才是經得起考驗的數字。
為何 2.4 億個 token 就能決定一切
Artificial Analysis 在其自家的摘要中描述了 Grok 4.7 的冗長程度,而這項指數評測背後的 token 數量就是證據:2.4 億個輸出 token,對照排行榜中位數接近 8,100 萬,大約是同一套測試中典型模型產出量的三倍。GPT-6.1 Sol 的 6,700 萬則遠低於中位數。把這兩個比例放在一起——3.6 倍的量、0.6 倍的價格——較便宜的輸出費率買到的是更多 token,而不是更小的帳單,而這正是每項任務成本 3.74 美元對上 0.72 美元差異所呈現的樣貌。
快取會改變影響的幅度,卻不會改變它的方向,而這正是讓人栽跟頭的細節。Grok 4.7 的快取輸入是每百萬 $0.50,對上 Sol 的 $0.10——在長代理歷史與反覆出現的系統提示所棲身的那條線上,貴了五倍。因此,以反覆重讀一大段穩定前綴為主的工作負載,會發現這兩個模型的差距比 $6 對 $10 所暗示的更近;而一旦再把 Grok 的冗長程度疊加上去,又會比輸入費率所暗示的更遠。在這裡,快取這條線和 token 這條線指向同一個方向,這很不尋常,也讓這組配對比價目卡所暗示的更乾淨俐落。
長脈絡條款值得單獨計價,因為它們在不同時間點觸發。GPT-6.1 Sol 會對超過 272,000 個輸入詞元的整筆請求重新計價;Grok 4.7 則是在超過 200,000 個詞元時這麼做。在一筆 250,000 詞元的呼叫中,Grok 已經翻倍——加上 $1.00 的快取讀取後為 $4.00 與 $12.00——而 Sol 仍維持標準的 $2.00 與 $10.00。在 200,000 到 272,000 個詞元之間,費率表較便宜的模型反而是貴上許多的那一個,而這個區間在文件處理工作中相當常見。
Grok 真正勝出之處,在於結構而非分數,也就是輸出上限。450,000 token 的最大回應,對比 Sol 的 128,000,是不同級別的產物:一次呼叫就能生成整個程式碼庫、長篇逐字稿、書本長度的綜合分析。如果你今天正遇到輸出上限,那麼這條界線就決定了比較結果,上述的成本計算完全不適用——你無論如何都無法買到另一個模型所沒有的能力。
兩者都在同一個按鍵上,這正是實用之處
Grok 4.7 在 OrcaRouter 上以 xAI 自家的定價提供——每百萬個 token 2.00 美元與 6.00 美元,快取讀取為 0.50 美元,而 200,000-token 的級距跳到 4.00 美元與 12.00 美元,完全依照 xAI 所列的價格原樣傳遞——而 GPT-6.1 Sol 在發布當天就以 OpenAI 的價格登上我們的路由,2.00 美元與 10.00 美元,快取輸入為 0.10 美元,272,000-token 的級距維持不變。兩者都沒有額外加價:平台是將供應商的定價原樣傳遞,而非加價,這意味著任一方廠商降價時,這裡會與那裡在同一天生效,沒有第二張帳單,也沒有中間的轉售商。

對這一組特定組合來說,這點比便利性更有價值。這兩個模型對各自擅長什麼並不一致——Grok 4.7 在專業工作 Elo 與科學程式開發上領先,GPT-6.1 Sol 則在終端機執行、事實可靠性與長脈絡檢索上領先——而這些工作負載之間的界線,會先在你的實際流量中顯現,之後才會在基準測試中顯現。將 GDPval 形式的請求送往一邊、把長時程代理執行送往另一邊,兩者置於同一個端點之後,並在兩者之間自動容錯移轉,且路由規則是在設定中變更、而非透過部署變更,會比進行一項評估專案更便宜地找出那條界線。模型融合,也就是由一組模型共同回答,是平台提供的另一個選項,適合你完全不想逐個請求做選擇的情況。

那通電話
• 長輸出代理式與終端機工作、快取前綴迴圈 — GPT-6.1 Sol。在 Terminal-Bench 4.0 上領先三十分,快取行便宜五倍,每完成一項任務的成本只有五分之一。
• 專業知識工作、文件分析、判斷任務 — Grok 4.7,憑藉 140 點的 GDPval-AA Elo 領先優勢,且 token 帳單是編列預算而非憑空假設。
• 科學程式設計 — Grok 4.7 在該排行榜的 SciCode 分項中以些微差距勝出。請用你自己的測試套件驗證;3.2 分落在不同提示集所能改變的範圍內。
• 單次回應超過 128,000 個輸出 token — Grok 4.7,而且沒有任何算術能取而代之。
• 輸入 token 介於 200,000 到 272,000 之間的請求 — GPT-6.1 Sol,因為 Grok 4.7 已經把它的整體請求翻倍,而 Sol 還沒有。
• 最便宜的可能對話 — 這兩者皆非。兩者都是前沿定價的模型,並具備前沿級的 token 食量;這項比較關乎哪一個能完成你的任務,而非哪一個在抽象層面上便宜。
• 如果某項比較以「Grok 每 token 更便宜」作結 — 那就是太早結束了一步。下一步是 token 數量,而那是 2.4 億對 67。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
