
Grok 4.7 與 Grok 4.6:同樣 $2/$6 價格,底下卻是不同模型
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 1009 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 195 tok/s
- Orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- xAISpaceXAI: Grok 4.62026-08-1244智能77程式
SpaceXAI 於Grok 4.72026 年 9 月 21 日發布,而關於它第一件值得注意的事,就是那個沒有改變的東西:價格。Grok 4.7 每百萬輸入符元收費 2 美元、每百萬輸出符元收費 6 美元,與Grok 4.6自 2026 年 8 月 12 日推出以來的收費完全相同。相同的價目表、相同的 50 萬符元上下文視窗、相同的文字與圖像輸入——然而,在對代理式工作至關重要的各項評估上,這兩個模型卻相去甚遠。根據 SpaceXAI 自行公布的數據,Grok 4.7 在 Terminal-Bench 4.0 上幾乎是 Grok 4.6 的兩倍,分別為 38.0% 對上 20.3%。這就是這項比較的全貌:一場同價位的世代交替,其中幾乎所有增益都落在同一個地方,而讓生產團隊頭痛的 Grok 4.6 那些問題,依然存在。
這兩個模型之間實際上究竟有什麼改變?
SpaceXAI 自己對這次發布的說明相當狹窄,值得引述的是它的輪廓,而不是那些形容詞。Grok 4.7 建立在比 Grok 4.6 更大的基礎模型上,並且接受了更長的強化學習訓練,目標是那些「可能得花數小時才能完成」的任務。該公司表示,那段訓練精進了三個面向:自我驗證、長上下文處理,以及在 Grok Bot 環境中的行為。文中沒有聲稱新架構、新模態,或不同的服務堆疊。
這種框架很重要,因為它能預測基準測試的進步會出現在哪裡,而它們確實就出現在那裡。針對耗時數小時的困難任務進行更長時間的 RL 訓練,對終端機與程式碼庫工作的提升,遠大於對知識測驗的提升。如果你原本希望 Grok 4.7 會是比 Grok 4.6 更廣泛的模型,版本發行說明可不是這麼說的——它是相同形態的模型,只是更進一步訓練到代理式工作中最困難的那一端。
參數規模這件事,是這其中唯一不屬於供應商揭露的一環。馬斯克在九月初表示,Grok 4.7 大約帶有 2.1 兆個參數,相較於 Grok 4.6 的 1.5 兆,增加了 40%,而這個數字從此被各處反覆引用。它從未出現在 SpaceXAI 的規格表上。請把它視為一項被廣泛轉述、關於基礎模型的主張,而不是已確認的規格——並且要注意,當架構是稀疏的(Grok 系列正是如此)時,參數數量對於服務成本或能力的說明力其實非常有限。
基準差距,附有採購標籤
本節中的每一項數字都來自 SpaceXAI 的發布資料。在撰寫本文時,其中沒有任何一項經過獨立重現;誠實的解讀方式是將其視為一組恰好異常具體的主張——這讓它日後可供查核,但不代表它現在已獲驗證。
• Terminal-Bench 4.0 — Grok 4.7 38.0%(廠商回報)對比 Grok 4.6 20.3%。這是此次發布中最大的單一差異,也是唯一符合「在更困難任務上進行更長期 RL」這一說法的一項。
• CursorBench 4.0 — Grok 4.7 46.3%(廠商自行回報)對比 Grok 4.6 40.4%。確實是實質進步,但幅度不大——不到六個百分點,而且這項基準測試更接近日常編輯器工作,而非自主終端機作業。
• DeepSWE v1.1 — Grok 4.7 在高推理強度下達 71.0%(供應商自報數據),相較之下 Grok 4.6 為 65.2%。這又是一次紮實但不出色的進步。
• EEBench — Grok 4.7 64.0%(廠商自行公布)。由於並未同時公布 Grok 4.6 的數據,因此這項數字無法說明升級幅度。
• AA-Briefcase v1.1 — 在專業知識工作評估上,Grok 4.7 取得 1,657 Elo(廠商提供)。
把這份清單當成一個整體來看,模式是一致的:Grok 4.7 在任務冗長且具代理性時明顯更好,而在任務簡短時則略好一些。Terminal-Bench 的躍升大約是翻倍;編輯器相關工作的增益則是單個位數百分比。如果你的工作負載是自動完成型,你是在為小幅改進支付同樣的 $2/$6。如果你的工作負載是「跑兩小時再回來看」,這個版本正是直接針對你而來。
目前為止,獨立測量顯示了什麼
有一個獨立數字存在,值得審慎說明,因為它很容易被誤讀。Artificial Analysis 在其 Intelligence Index(版本 v4.3.2)上給 Grok 4.7 評為 46 分,使其在該榜單 655 個模型中排名第 16。Grok 4.6 在同一量表上則為 44 分。綜合指數上的兩分差距,並不是 Terminal-Bench 所顯示的那種翻倍,而這種落差是有資訊價值的,而非自相矛盾:該指數混合了推理、知識、數學與程式設計,因此某個代理式切片中的大幅進展,會被模型並未改變的其他一切所稀釋。
同一頁面上還有兩個進一步的細節,比標題分數更有用。首先,Grok 4.7 在跑該指數時產生了 2.4 億個輸出 token,而中位數為 9,200 萬個——它是個冗長的推理模型,而以每百萬輸出 token 6 美元的費率計算,這種冗長程度就是一筆支出項目。其次,該指數的綜合分數讓它躋身其價格級距中最強的模型之列,而這才是對買家真正重要的比較。Artificial Analysis 尚未在模型頁面上公布 Grok 4.7 的具體價格,所以不要從那裡取用其每項任務成本數字;請使用供應商的 $2/$6。

定價懸崖,兩個模型都未能解決。
這是 Grok 4.6 費率表中,生產團隊學會痛恨的那一部分,而 Grok 4.7 並沒有改變它。低於 200,000 個輸入詞元時,費率是輸入 $2、輸出 $6。超過之後,整筆請求會重新計價為輸入 $4、輸出 $12。不是超出的詞元——而是整筆請求。一次 210,000 詞元的呼叫,成本是 199,000 詞元呼叫的兩倍,卻只多了 11,000 個詞元。
兩款模型都具備 500,000 token 的上下文視窗,因此很容易就跨過那道斷崖。長上下文代理執行與整份儲存庫提示,正是 Grok 4.7 所調校的工作負載,這意味著該模型最擅長的使用情境,也正是最可能觸發價格翻倍的那一種。如果你是因為 Grok 4.7 更能處理長時間的代理工作階段,而想把工作移轉到它上面,請在移轉之前就先為重新計價編列預算,而不是移轉之後才做。
還有一個速度等級需要納入考量。SpaceXAI 推出 Grok 4.7 的快速版本,輸出速度加倍,標價也加倍。對互動式編程來說,這是一筆合理的交易;對批次作業而言則很不划算——同樣的任務、同樣的品質,卻要付兩倍成本,只換來沒人在看的實際耗時縮短。
無需重寫即可從 Grok 4.6 遷移
實際上,好消息是這屬於模型替換,而非平台遷移。兩個模型都接受文字與圖像輸入並回傳文字,兩者都採用相同的推理投入程度等級,從 low 到 xhigh,而請求結構也正是 SpaceXAI 自 Grok 4.5 以來持續提供的格式。呼叫 Grok 4.6 時帶有 effort 參數的程式碼,不需要重新改寫就能改為呼叫 Grok 4.7。
換掉它並非沒有代價的地方,就在於評估。Grok 4.7 的增益集中在長時間的代理式執行上,因此用簡短的單輪提示建構出來的測試套件,幾乎什麼都測不出來——你會看到 CursorBench 規模的改善,就斷定這次升級不值得費這個功夫,而支持升級的理由,其實存在於你的測試套件從未演練過的任務裡。真正能定論的衡量指標,是多步驟工作下的任務完成情況:獲接納的修補、引入的迴歸問題、每個已完成任務的工具呼叫次數,以及一次執行需要人工救援的頻率。這些正是廠商自家數字所指向的軸線,也是沒有任何已發布的基準測試會為你的程式碼庫涵蓋的軸線。
冗長度是第二個要衡量的項目。一個在標準索引上會輸出 2.4 億個 token 的模型,用於你的工作負載時,輸出的 token 會比它的前代更多,而每百萬個輸出 token 收費 6 美元,這可能會悄然抹消同價位升級的價值。在正式採用前,先追蹤每項完成任務的輸出 token 數一週。

該打哪一個
這個決定確實很簡單,這在模型比較中並不尋常。對於短回合、成本敏感的流量:聊天、分類、摘要,以及編輯器規模的程式碼輔助,Grok 4.6 仍然是正確的選擇,因為 Grok 4.7 在這方面的增益很小,而其冗長性則是一項負擔。Grok 4.7 則是針對其設計的工作負載的正確選擇——長時程的代理式編碼與終端機工作,在這些工作中,任務會執行數小時,而自我驗證是完成工作與卡住之間的區別。
同時採用兩者在這裏並非折衷,而是正確答案,而且成本很低。Grok 4.6 已收錄於 OrcaRouter 的目錄中,以 SpaceXAI 的標價、0% 加價直接轉嫁,所以上面那張 $2/$6 的價目表就是你實付的價格——而由於我們是直接轉嫁供應商的標價而非從中加價,任何供應商價格變動都會在當天同步反映在我們這邊。一組 API key 即涵蓋 Grok 4.6 以及200 多款其他模型,因此按任務在它們之間調度流量只是改個設定,而非另簽一份合約。如果你想在正式環境路徑上試用 Grok 4.7 再決定是否信任它,較安全的做法是把備援維持在 Grok 4.6——一個你今天就能路由的模型——並讓跨供應商的自動容錯移轉在新模型出狀況時把請求轉回去。

接下來要看什麼
有兩件事會決定這場比較,而兩者都尚未發生。第一是 Terminal-Bench 4.0 數字的獨立重現——38% 是夠大的躍升,會有人重跑一次,而如果結果成立,Grok 4.7 在代理式管線中的論據就站得住腳,靠的是實力而非行銷。第二是 Grok 路線圖的其餘部分:SpaceXAI 已公開把 Grok 4.8、Grok 4.9 和 Grok 5 排在這次發布之後,而 Grok 4.6 本身的壽命約為五週。把 Grok 4.7 當作長期平台假設來押注,就會重蹈各團隊在 Grok 4.5 上犯過的錯誤。
就目前而言,同價升級是真的,前進方向也很明確。要記住的數字是:$2/$6 讓你買到一個模型,在長時程終端工作上大致翻倍,在其他方面卻幾乎沒有動靜——而這是一個具體、有用、可檢驗的主張,而不是跨世代的躍進。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
