為一篇標題為「Grok 4.7 vs Kimi K3 — 價格對比上下文」的文章所生成的主視覺標題卡,副標題為「兩個前沿模型,兩種不同的押注」,而數據標籤顯示價格 $2/$6 對 $3/$15、上下文 500K 對 1M,以及開放權重 否 對 是。
Guides & Insights

Grok 4.7 對決 Kimi K3:價格砍半、上下文減半、權重全無

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

拿一個月三億個 token 的代理式程式編寫工作量,分別用兩款模型的定價跑一遍,這個選擇就不再像是基準測試之爭了。Grok 4.7由 SpaceXAI 於 2026 年 9 月 21 日發布,每百萬輸入 token 收費 2 美元,每百萬輸出 token 收費 6 美元。Kimi K3由 Moonshot AI 於 2026 年 7 月 16 日發布,收費為 3 美元與 15 美元。在那個假設的月份裡——比如 2 億輸入與 1 億輸出——Grok 4.7 大約是 1,000 美元,Kimi K3 則約為 2,100 美元。這個差距不是四捨五入的誤差;那是足足一個模型的預算。相較之下,Kimi K3 給你 1,000,000 token 的上下文視窗,而非 500,000,原生支援影片輸入以及圖片,還有可下載的權重。Grok 4.7 給你的則是更快、更便宜、封閉原始碼的模型,而且是明確針對 Kimi K3 同樣瞄準的長時程終端機作業所訓練。兩者都屬前沿等級。它們並不是同一筆採購。

這兩個模型,簡述

Grok 4.7 是 SpaceXAI 的前沿程式編寫與知識工作模型,以比 Grok 4.6 更大的基礎模型打造,並經過更長的強化學習訓練,鎖定可能耗時數小時的任務。它是專有模型——沒有權重、無法下載——提供 500,000 個 token 的上下文視窗,接受文字與圖像輸入並回傳文字,並支援從 low 到 xhigh 的推理強度等級。它最引人注目的賣點是速度與價格:SpaceXAI 將其定位為速度約為同類模型的兩倍,價格約為一半。

Kimi K3 是 Moonshot AI 的旗艦開放式混合專家模型,也是首個躋身三兆參數級別的開放模型:總參數達 2.8 兆,每個 token 啟用 1,040 億參數,建構於 Kimi Delta Attention 與量化感知的 MXFP4 權重之上。它可接收文字、圖像與影片輸入,支援 1,000,000 個 token 的上下文,以可配置的投入程度常時運行推理,其權重可依 Kimi K3 License 下載——允許商業使用,但附有若干限制。就設計而言,它是一款你能帶回家的模型。

這就是它們之間全部的結構性差異。一個是便宜、快速、封閉的端點。另一個是更昂貴、更緩慢、開放,且上下文多一倍的產物。以下的一切都是其結果。

基準測試實際上比較的是什麼

這正是大多數 Grok 4.7 對上 Kimi K3 的評比文章出錯的地方,所以值得直言不諱:這兩個模型所公布的數字,大多並不是在衡量同樣的事物,而且至少有一對看似可相比的數字,其實並非如此。

先從那組真正會誤導人的數字開始。Kimi K3 的發表資料引用 Terminal-Bench 2.1 的 88.3 分成績。Grok 4.7 的發表資料則引用 Terminal-Bench 4.0 的 38.0%。這些是不同的基準版本,任務集不同、評分方式也不同,把兩者並列會讓人以為 Kimi K3 的代理能力是另一者的兩倍以上。這不是站得住腳的解讀,任何人都不該重複這種說法。這兩個數字也都由廠商自行提報——兩者都未經獨立重現。

可以比較的是獨立複合指標,而在那裡兩者相當接近。在目前的人工分析情報指數(Artificial Analysis Intelligence Index)v4.3.2 版本中,Kimi K3 得分 44——在 113 個模型中排名第二,是所有開放權重模型在榜單上的最高名次。Grok 4.7 得分 46,在 655 個模型中排名第十六。兩者相差兩分,而 Kimi K3 的名次是在最高推理強度下取得的。在混合複合指標上,這些模型屬於同一等級。

• 獨立綜合評分——Grok 4.7 在 AA Intelligence Index v4.3.2 上拿下 46 分,Kimi K3 在同一版本上則是 44 分。實際上可說是不分軒輊。

• 上下文視窗 — Grok 4.7 為 500,000 個詞元,Kimi K3 則為 1,000,000 個詞元。對 Kimi K3 而言,這是貨真價實、毫無保留的優勢,也是唯一一項沒有附帶但書的規格差異。

• 輸入模態 — Grok 4.7 的文字與圖像 vs Kimi K3 的文字、圖像與影片。如果你的工作負載包含影片,Kimi K3 的適用範圍更廣。

• 權重 — Grok 4.7 為專有模型,無法下載;對比之下,Kimi K3 依 Kimi K3 授權條款開放權重。對於地端部署或氣隙環境的需求而言,這是唯一真正關鍵的一點。

• 每百萬詞元價格 — Grok 4.7 輸入 $2/輸出 $6,對比 Kimi K3 輸入 $3/輸出 $15,而 Kimi 的快取輸入費率為每百萬 $0.30。Grok 4.7 在每個層面都更便宜,而且在輸出方面便宜得多。

• 推理強度控制 — Grok 4.7 提供從 low 到 xhigh 的選項,而 Kimi K3 則是常時開啟、強度可設定。功能上相似;差別在於 Grok 4.7 讓你可以把推理調低。

• 廠商回報的 agentic 證據——Grok 4.7 在 Terminal-Bench 4.0 為 38.0%,CursorBench 4.0 為 46.3%,DeepSWE v1.1 為 71.0%(皆為廠商回報)對比 Kimi K3 在 Terminal-Bench 2.1 為 88.3%,Frontend Code Arena 以 1,679 Elo 位居第一(推出時由廠商回報)。無法相比——見上文。

A generated two-column comparison scoreboard for Grok 4.7 and Kimi K3 with six rows: price $2/$6 vs $3/$15 per million tokens, context 500K vs 1M tokens, AA Intelligence Index 46 vs 44, weights proprietary vs open, modalities text and image vs text, image and video, and speed twice as fast vs slower output, with a footer noting index scores are per Artificial Analysis v4.3.2 and all benchmark figures are vendor-reported.Screenshot of the Artificial Analysis model page for Grok 4.7 (xhigh), showing an Intelligence Index of 46 on index version v4.3.2, a 500k token context window, text and image input with text output, and a verbosity figure of 240M output tokens generated on the index.

錢實際上都花到哪裡去了

費率表低估了差距,因為這兩個模型消耗 token 的方式不同。Grok 4.7 是一個冗長的推理模型——Artificial Analysis 在運行其 Intelligence Index 時測量到產生了 2.4 億個輸出 token,而各模型的中位數為 9,200 萬個。Kimi K3 則是另一種昂貴:它是一個大型且始終開啟的推理模型,而每百萬個輸出 token 要價 15 美元,你買到的就是冗長。

所以,誠實的成本模型不是「$2/$6 對比 $3/$15」。而是每完成一項任務的輸出 token 數,乘以輸出費率,再加上包含每次重試在內的輸入 token 數,乘以輸入費率。一個以每百萬 $6 一次長時間執行就解決任務的模型,可以勝過一個每百萬 $15 卻需要三次嘗試的模型;但如果便宜模型的每次執行夠長,它也可能輸給後者。這是你得在自己儲存庫上跑的測量,不是任何人會替你發布的測量。

在執行之前,有一項不對稱性值得先了解:Grok 4.6 是 Grok 4.7 的前代版本,它在 200,000 個輸入 token 設有定價斷崖,一旦請求跨越這條界線,整筆請求就會以雙倍費率重新計價。Grok 這邊的長上下文作業,必須對照你所部署模型的現行費率卡來確認這一點,因為 500,000-token 視窗與 200,000-token 斷崖會產生不良交互作用。Kimi K3 的定價則是均一費率,這是兩者之中較不明顯的優勢。

各自斷裂之處

這兩個模型各有一種發表資料並未優先提及的失效模式,而且兩者是不同的失效。

Kimi K3 的問題出在持續負載下的可靠性。社群與獨立測試在推出時指出,其代理式效能會隨著執行時間拉長而衰退——單次執行的結果強勁,但持續通過率較弱——而且其輸出速度約為每秒 37 至 38 個 token,這對互動式程式設計來說偏慢。Moonshot 也在推出後不久不得不暫停新的消費者訂閱,因為需求超出容量,這也透露了代管端在服務量能餘裕上的一些狀況。

Grok 4.7 的形態恰好相反:它快速、便宜且封閉,這意味著你無法檢視它、無法自行運行它,也無法對遭到淘汰預作避險。SpaceXAI 已公開排定 Grok 4.8、Grok 4.9 與 Grok 5 在這項發布之後接續推出,而 Grok 4.6 在被取代前大約只維持了五週。任何你在 Grok 4.7 上打造的內容,都應該以模型 ID 是設定值、而非一項假設的方式來建構。

第三個考量並非任一模型的失敗:兩者都不是為期兩週自主運行的正確答案,而兩家廠商都示範過正是如此。已發表的 16 天與 48 小時自主編碼示範,是由廠商自己執行、採用廠商挑選的任務,且未經獨立重現。它們值得了解,但不值得作為規劃依據。

Screenshot of the OrcaRouter model page for Kimi K3 (model ID kimi/kimi-k3), showing Moonshot AI's list pricing of $3.00 per million input tokens and $15.00 per million output tokens, a 1M token context window, and the vision, tools, JSON and reasoning capability tags.

兩者都執行,以及為什麼那才是真正的答案

成本差距與上下文差距指向相反的方向,這正是別只挑一個的理由。Kimi K3 在儲存庫規模的工作上值回票價——在那裡,1M 視窗意味著你不必切割輸入——也在任何必須自架的情境中值回票價。Grok 4.7 則在量大的情境中值回票價——高輪次的代理迴圈、工具呼叫密集的流程,以及速度與輸出成本佔主導地位的長時間終端機工作階段。

Kimi K3 已在 OrcaRouter 上,這使得這種分工成為一項路由決策,而非採購決策。它以 Moonshot 的牌價列於目錄中,而由於 OrcaRouter 以 0% 加價直接轉嫁供應商牌價,供應商一旦宣布降價,這裡當天即生效,而不必等到下一次合約續約。對於需要長上下文處理與執行處理相互協作、而非彼此競爭的工作負載——一個模型掌握整個儲存庫的視野,另一個模型據此行動——路由 DSL 能將多個模型組成單一呼叫,而模型融合則讓一組模型在任務值得額外花費時共同作答。一組 API 金鑰即可涵蓋 Kimi K3 以及200 多個其他模型,因此這種分工中的執行部分,可以來自對該工作最便宜、最快速的模型,而非恰好持有上下文的那個模型。

有一件事必須說清楚:Kimi K3 的開放權重可以下載,但 OrcaRouter 路由到的是託管端點。如果你的需求確實是地端推論,那是得在你自己的硬體上自架的專案,而不是一項路由決策——而且這是這個比較中唯一只有單一正確答案的情境。

裁決,以及唯一要記住的那個數字

如果你以成本和速度來選擇,Grok 4.7 勝出,而且差距並不小:輸入價格只有一半、輸出價格不到一半、服務速度更快,還有一個可以調低的推理旋鈕。如果你以脈絡長度、模態廣度,或能否自己擁有模型來選擇,Kimi K3 在相同條件下勝出。如果你單純以能力來選擇,獨立綜合評比顯示兩者只差兩分,你應該依據自己的評估來決定,而不是根據任一廠商的發表圖表。

要牢牢記住的數字是最上面那一個:$2/$6 對上 $3/$15。這個比較裡其他一切都可以商量,但這個比例不行。

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新