
GPT-6 Sol Pro 對比 Grok 4.7:冗長程度加倍,價格只要三分之一
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 986 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 196 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 112 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
2026 年 9 月兩款最便宜、最接近前沿的模型相隔一天推出,而它們有趣的地方不在於哪一款更聰明。GPT-6 Sol——當人們搜尋 GPT-6 Sol Pro時會找上的模型,也就是把 reasoning.mode 設為 pro 的那個模型,而非另一項獨立產品——於 2026 年 9 月 22 日推出,每百萬輸入 token 為 2.00 美元,每百萬輸出 token 為 10.00 美元。Grok 4.7由該廠商於 9 月 21 日推出,輸入同樣為 2.00 美元,輸出為 6.00 美元。在 Artificial Analysis 的中立測試框架上,兩者相差兩個索引分數,每完成一項任務的成本則相差約兩美元,而這個差距的原因並非能力,而是各自為了達到目標耗費了多少 token。
Sol 在執行 Intelligence Index 時產生了 7,700 萬個輸出 token。Grok 4.7 則產生了 2.4 億個。這個比例——略高於三比一——就是整個比較的全部,而它顛倒了每 token 價格表帶給你的結論。
兩張費率卡,以及便宜的那張並不便宜的地方
兩家供應商都自行公布這些數字;兩者皆未經獨立重新定價。
• 輸入 — GPT-6 Sol 每百萬個 Token 2.00 美元 vs Grok 4.7 每百萬個 Token 2.00 美元
• 輸出 — GPT-6 Sol 每百萬個字符 $10.00 對比 Grok 4.7 每百萬個字符 $6.00
• 快取輸入 — GPT-6 Sol 每百萬個 token 為 $0.20,對比 Grok 4.7 每百萬個 token 為 $0.50;Sol 的快取讀取便宜了 2.5 倍,這與對外主打的輸出費率所暗示的恰好相反
• 上下文視窗 — GPT-6 Sol 1,050,000 個詞元,對比 Grok 4.7 的 500,000 個詞元
• 長脈絡附加費 — GPT-6 Sol 會對超過 272,000 個輸入權杖的請求重新計價,整筆請求的輸入與快取費率為 2 倍、輸出費率為 1.5 倍;相較之下,Grok 4.7 則是在 200,000 個輸入權杖時將所有費率加倍,同樣適用於整筆請求
• 知識截止點 — GPT-6 Sol 為 2026 年 4 月 20 日,對比 Grok 4.7 的預訓練截止點據報導為 2026 年 6 月,並有補充訓練持續至 8 月
• 推理強度 — GPT-6 Sol:無、低、中(預設)、高、極高、最大,對比 Grok 4.7:低、中(預設)、高、極高
• 模態 — 兩者皆接受文字與圖像輸入並回傳文字
快取讀取那一行,才是買家該好好琢磨的。Grok 4.7 的輸出費率低了 40%,但它的快取輸入卻高了 150%,而冗長的代理歷程與反覆出現的系統提示,正是棲身於快取輸入之中。若某項工作負載主要是在反覆重讀一大段穩定的上下文,就會發現這兩個模型的差距遠比 6 美元對上 10 美元所暗示的來得小。

獨立紀錄,以及決定它的那個數字
Artificial Analysis 是唯一同時量測過這兩個模型的測試框架,其數據值得並列攤開來看,因為兩者之間的落差很具啟發性。
• 智慧指數 — GPT-6 Sol 48(最高強度)對上 Grok 4.7 46(極高強度);兩者皆遠高於同類模型的中位數 25
• 每項索引任務成本 — GPT-6 Sol $1.06,對比 Grok 4.7 $3.74
• 索引執行的輸出 token 數 — GPT-6 Sol 77M 對比 Grok 4.7 240M,相較中位數 88M
• 輸出速度 —— Grok 4.7 測得每秒 39 個 token,測試框架本身將其標示為明顯偏慢;Sol 在同一份排行榜上的數據並未刊載於同一行摘要中
• Coding Agent Index — GPT-6 Sol 57,每項任務 2.99 美元,對比 Grok 4.7 的 56,搭配其第一方 Grok Build 測試框架,較 Grok 4.6 提升九分
指數相差兩點,每項任務成本卻是三點五倍。這不是定價異常——而是冗長度的算術。Grok 4.7 是一個會長篇大論地出聲思考的模型;測試框架將它標記為「非常冗長」,相對於中位數 8,800 萬個 token,而成本取決於 token 數量,不是價目表。
這項程式開發代理的比較帶有一個計分板所掩蓋的但書。Grok 4.7 的 56 分是在 xAI 自家的 Grok Build 測試框架內測得的,而那正是 xAI 出貨並用以進行基準測試的配置。Sol 的 57 分則是在中立的測試框架中測得。第一方測試框架所帶來的一到兩分優勢,完全落在框架選擇所能解釋的範圍之內,這意味著誠實的解讀是:兩者在代理式程式開發上旗鼓相當——而非 Sol 領先一分。

各家廠商各自宣稱了什麼,以及雙方都未展示什麼
xAI 的發布資料很具體,而且是一個長遠的故事:Grok 4.7 建立在比 Grok 4.6 更大的基礎模型上,並接受了更長的強化學習訓練,目標是那些「可能需要數小時才能完成」的任務,精進自我驗證、長上下文處理,以及在 Grok Bot 環境中的行為。廠商回報的數字包括 Terminal-Bench 4.0 的 38.0%,對比 Grok 4.6 的 20.3%;CursorBench 4.0 的 46.3%;以及 DeepSWE v1.1 的 71.0%。這些全都是 xAI 自家的量測結果,且無一經過獨立重現;外界流傳的獨立 Terminal-Bench 4.0 數字明顯低於廠商數據,而這正是這類落差常見的樣態。
OpenAI 對 GPT-6 Sol 的宣稱即為上方已涵蓋的內容,且它們帶有相同的標籤。廠商報告的數字為:在 AutomationBench 上,xhigh effort 下為 33.2%,對比 Claude Opus 5 在 max 下的 26.9%,每項任務成本約為其 9%;以及在 DeepSWE v1.1 上,max effort 下為 68.8%——與 Claude Fable 5 在 xhigh 下相差 1.1 個百分點以內,每項任務成本約低 80%。請注意比較對象:OpenAI 自家的圖表將 Sol 與 Anthropic 的模型對比,而非與 Grok 4.7 對比。兩家廠商均未發布過彼此的正面對決。

路由層在哪裡證明其價值
OrcaRouter 在這組對決中並未收錄任何一方模型——Grok 4.7 與 GPT-6 Sol 都不在我們的目錄裡,因此這裡所說的並不是它們透過我們取得的價格。在這組特定搭配中,路由層的價值在於失效模式,而不是價目表。會想選用 Grok 4.7 的理由是它的長時程代理行為;不選用它的理由則是,每秒 39 個 token 的輸出速度會讓長時間的代理執行慢到足以構成問題,而執行得慢,就代表可能逾時。 跨供應商的自動容錯移轉意味著長時間的工作可以路由到當下真正可用的任何模型,而不會讓那個速度成為單點故障,而且 路由 DSL 把模型選擇表達成呼叫內的一條規則,而不是一次遷移——這在這裡很重要,因為這組搭配的正確答案取決於任務是耗費大量 token 還是對延遲敏感,而那是請求本身的屬性,不是本季度的屬性。
決策規則
• 在固定預算下進行代理式編碼——在中立編碼指數上具備 GPT-6 Sol 等級的能力,每項任務成本約為三分之一,因為它只用了三分之一的 token 就達到該水準。
• 長時程任務,重點就在於執行時間的長度——Grok 4.7。這個版本是專門針對數小時的工作訓練而成,而廠商在 SWE-Marathon 和 CursorBench 上的數據正好朝這個方向發展。
• 延遲敏感型負載——就目前紀錄來看,兩者皆非。Sol 的每項任務成本是較漂亮的數字,但 Grok 4.7 實測每秒 39 個 token,對任何互動式應用都是實實在在的限制。
• 以快取命中為主的長上下文工作負載 — GPT-6 Sol,費用落在快取讀取那一行,而不是輸出那一行。每百萬個快取權杖 $0.20 對比 $0.50,再加上兩倍大的視窗,你的提示內容越穩定,這個理由就越站得住腳。
• 如果你的比較是根據每 token 的價目表建立的,請改用每項任務成本重新建立。$6.00 對上 $10.00 的輸出,是本文中最無法提供資訊的一組數字,而這卻是每個現有頁面都拿來打頭陣的一組。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
