
Grok 4.7 對決 Kimi K3:價格砍半、上下文減半、權重全無
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 219 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
拿一個月三億個 token 的代理式程式編寫工作量,分別用兩款模型的定價跑一遍,這個選擇就不再像是基準測試之爭了。Grok 4.7由 SpaceXAI 於 2026 年 9 月 21 日發布,每百萬輸入 token 收費 2 美元,每百萬輸出 token 收費 6 美元。Kimi K3由 Moonshot AI 於 2026 年 7 月 16 日發布,收費為 3 美元與 15 美元。在那個假設的月份裡——比如 2 億輸入與 1 億輸出——Grok 4.7 大約是 1,000 美元,Kimi K3 則約為 2,100 美元。這個差距不是四捨五入的誤差;那是足足一個模型的預算。相較之下,Kimi K3 給你 1,000,000 token 的上下文視窗,而非 500,000,原生支援影片輸入以及圖片,還有可下載的權重。Grok 4.7 給你的則是更快、更便宜、封閉原始碼的模型,而且是明確針對 Kimi K3 同樣瞄準的長時程終端機作業所訓練。兩者都屬前沿等級。它們並不是同一筆採購。
這兩個模型,簡述
Grok 4.7 是 SpaceXAI 的前沿程式編寫與知識工作模型,以比 Grok 4.6 更大的基礎模型打造,並經過更長的強化學習訓練,鎖定可能耗時數小時的任務。它是專有模型——沒有權重、無法下載——提供 500,000 個 token 的上下文視窗,接受文字與圖像輸入並回傳文字,並支援從 low 到 xhigh 的推理強度等級。它最引人注目的賣點是速度與價格:SpaceXAI 將其定位為速度約為同類模型的兩倍,價格約為一半。
Kimi K3 是 Moonshot AI 的旗艦開放式混合專家模型,也是首個躋身三兆參數級別的開放模型:總參數達 2.8 兆,每個 token 啟用 1,040 億參數,建構於 Kimi Delta Attention 與量化感知的 MXFP4 權重之上。它可接收文字、圖像與影片輸入,支援 1,000,000 個 token 的上下文,以可配置的投入程度常時運行推理,其權重可依 Kimi K3 License 下載——允許商業使用,但附有若干限制。就設計而言,它是一款你能帶回家的模型。
這就是它們之間全部的結構性差異。一個是便宜、快速、封閉的端點。另一個是更昂貴、更緩慢、開放,且上下文多一倍的產物。以下的一切都是其結果。
基準測試實際上比較的是什麼
這正是大多數 Grok 4.7 對上 Kimi K3 的評比文章出錯的地方,所以值得直言不諱:這兩個模型所公布的數字,大多並不是在衡量同樣的事物,而且至少有一對看似可相比的數字,其實並非如此。
先從那組真正會誤導人的數字開始。Kimi K3 的發表資料引用 Terminal-Bench 2.1 的 88.3 分成績。Grok 4.7 的發表資料則引用 Terminal-Bench 4.0 的 38.0%。這些是不同的基準版本,任務集不同、評分方式也不同,把兩者並列會讓人以為 Kimi K3 的代理能力是另一者的兩倍以上。這不是站得住腳的解讀,任何人都不該重複這種說法。這兩個數字也都由廠商自行提報——兩者都未經獨立重現。
可以比較的是獨立複合指標,而在那裡兩者相當接近。在目前的人工分析情報指數(Artificial Analysis Intelligence Index)v4.3.2 版本中,Kimi K3 得分 44——在 113 個模型中排名第二,是所有開放權重模型在榜單上的最高名次。Grok 4.7 得分 46,在 655 個模型中排名第十六。兩者相差兩分,而 Kimi K3 的名次是在最高推理強度下取得的。在混合複合指標上,這些模型屬於同一等級。
• 獨立綜合評分——Grok 4.7 在 AA Intelligence Index v4.3.2 上拿下 46 分,Kimi K3 在同一版本上則是 44 分。實際上可說是不分軒輊。
• 上下文視窗 — Grok 4.7 為 500,000 個詞元,Kimi K3 則為 1,000,000 個詞元。對 Kimi K3 而言,這是貨真價實、毫無保留的優勢,也是唯一一項沒有附帶但書的規格差異。
• 輸入模態 — Grok 4.7 的文字與圖像 vs Kimi K3 的文字、圖像與影片。如果你的工作負載包含影片,Kimi K3 的適用範圍更廣。
• 權重 — Grok 4.7 為專有模型,無法下載;對比之下,Kimi K3 依 Kimi K3 授權條款開放權重。對於地端部署或氣隙環境的需求而言,這是唯一真正關鍵的一點。
• 每百萬詞元價格 — Grok 4.7 輸入 $2/輸出 $6,對比 Kimi K3 輸入 $3/輸出 $15,而 Kimi 的快取輸入費率為每百萬 $0.30。Grok 4.7 在每個層面都更便宜,而且在輸出方面便宜得多。
• 推理強度控制 — Grok 4.7 提供從 low 到 xhigh 的選項,而 Kimi K3 則是常時開啟、強度可設定。功能上相似;差別在於 Grok 4.7 讓你可以把推理調低。
• 廠商回報的 agentic 證據——Grok 4.7 在 Terminal-Bench 4.0 為 38.0%,CursorBench 4.0 為 46.3%,DeepSWE v1.1 為 71.0%(皆為廠商回報)對比 Kimi K3 在 Terminal-Bench 2.1 為 88.3%,Frontend Code Arena 以 1,679 Elo 位居第一(推出時由廠商回報)。無法相比——見上文。


錢實際上都花到哪裡去了
費率表低估了差距,因為這兩個模型消耗 token 的方式不同。Grok 4.7 是一個冗長的推理模型——Artificial Analysis 在運行其 Intelligence Index 時測量到產生了 2.4 億個輸出 token,而各模型的中位數為 9,200 萬個。Kimi K3 則是另一種昂貴:它是一個大型且始終開啟的推理模型,而每百萬個輸出 token 要價 15 美元,你買到的就是冗長。
所以,誠實的成本模型不是「$2/$6 對比 $3/$15」。而是每完成一項任務的輸出 token 數,乘以輸出費率,再加上包含每次重試在內的輸入 token 數,乘以輸入費率。一個以每百萬 $6 一次長時間執行就解決任務的模型,可以勝過一個每百萬 $15 卻需要三次嘗試的模型;但如果便宜模型的每次執行夠長,它也可能輸給後者。這是你得在自己儲存庫上跑的測量,不是任何人會替你發布的測量。
在執行之前,有一項不對稱性值得先了解:Grok 4.6 是 Grok 4.7 的前代版本,它在 200,000 個輸入 token 設有定價斷崖,一旦請求跨越這條界線,整筆請求就會以雙倍費率重新計價。Grok 這邊的長上下文作業,必須對照你所部署模型的現行費率卡來確認這一點,因為 500,000-token 視窗與 200,000-token 斷崖會產生不良交互作用。Kimi K3 的定價則是均一費率,這是兩者之中較不明顯的優勢。
各自斷裂之處
這兩個模型各有一種發表資料並未優先提及的失效模式,而且兩者是不同的失效。
Kimi K3 的問題出在持續負載下的可靠性。社群與獨立測試在推出時指出,其代理式效能會隨著執行時間拉長而衰退——單次執行的結果強勁,但持續通過率較弱——而且其輸出速度約為每秒 37 至 38 個 token,這對互動式程式設計來說偏慢。Moonshot 也在推出後不久不得不暫停新的消費者訂閱,因為需求超出容量,這也透露了代管端在服務量能餘裕上的一些狀況。
Grok 4.7 的形態恰好相反:它快速、便宜且封閉,這意味著你無法檢視它、無法自行運行它,也無法對遭到淘汰預作避險。SpaceXAI 已公開排定 Grok 4.8、Grok 4.9 與 Grok 5 在這項發布之後接續推出,而 Grok 4.6 在被取代前大約只維持了五週。任何你在 Grok 4.7 上打造的內容,都應該以模型 ID 是設定值、而非一項假設的方式來建構。
第三個考量並非任一模型的失敗:兩者都不是為期兩週自主運行的正確答案,而兩家廠商都示範過正是如此。已發表的 16 天與 48 小時自主編碼示範,是由廠商自己執行、採用廠商挑選的任務,且未經獨立重現。它們值得了解,但不值得作為規劃依據。

兩者都執行,以及為什麼那才是真正的答案
成本差距與上下文差距指向相反的方向,這正是別只挑一個的理由。Kimi K3 在儲存庫規模的工作上值回票價——在那裡,1M 視窗意味著你不必切割輸入——也在任何必須自架的情境中值回票價。Grok 4.7 則在量大的情境中值回票價——高輪次的代理迴圈、工具呼叫密集的流程,以及速度與輸出成本佔主導地位的長時間終端機工作階段。
Kimi K3 已在 OrcaRouter 上,這使得這種分工成為一項路由決策,而非採購決策。它以 Moonshot 的牌價列於目錄中,而由於 OrcaRouter 以 0% 加價直接轉嫁供應商牌價,供應商一旦宣布降價,這裡當天即生效,而不必等到下一次合約續約。對於需要長上下文處理與執行處理相互協作、而非彼此競爭的工作負載——一個模型掌握整個儲存庫的視野,另一個模型據此行動——路由 DSL 能將多個模型組成單一呼叫,而模型融合則讓一組模型在任務值得額外花費時共同作答。一組 API 金鑰即可涵蓋 Kimi K3 以及200 多個其他模型,因此這種分工中的執行部分,可以來自對該工作最便宜、最快速的模型,而非恰好持有上下文的那個模型。
有一件事必須說清楚:Kimi K3 的開放權重可以下載,但 OrcaRouter 路由到的是託管端點。如果你的需求確實是地端推論,那是得在你自己的硬體上自架的專案,而不是一項路由決策——而且這是這個比較中唯一只有單一正確答案的情境。
裁決,以及唯一要記住的那個數字
如果你以成本和速度來選擇,Grok 4.7 勝出,而且差距並不小:輸入價格只有一半、輸出價格不到一半、服務速度更快,還有一個可以調低的推理旋鈕。如果你以脈絡長度、模態廣度,或能否自己擁有模型來選擇,Kimi K3 在相同條件下勝出。如果你單純以能力來選擇,獨立綜合評比顯示兩者只差兩分,你應該依據自己的評估來決定,而不是根據任一廠商的發表圖表。
要牢牢記住的數字是最上面那一個:$2/$6 對上 $3/$15。這個比較裡其他一切都可以商量,但這個比例不行。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
