
Xiaomi MiMo-V2.6-Pro 對比 Grok 4.7:每項任務便宜 30 倍,而且兩者都不快
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 36 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 181 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
Xiaomi MiMo-V2.6-Pro 與 Grok 4.7 都在 2026 年 9 月 21 日推出,兩者在 Artificial Analysis Intelligence Index v4.3.2 上都落在 46,而且都被測量它們的那個頁面評為速度慢——MiMo-V2.6-Pro 為每秒輸出 43.6 個 token,對比中位數 67.1;Grok 4.7 在 xhigh effort 下則為 40。真正區分它們的是答案的成本。評估者的每項任務數字為:中國的開放 checkpoint 是 $0.13,Grok 4.7 模型是 $3.74,相差約 29 倍。這不是費率差異,或至少不只是費率差異:Grok 4.7 的輸出費率是每百萬 token $6.00,對比 $0.87,也就是七倍,而其餘倍數來自每個模型為了得出答案所消耗的 token 數量。
同一個月、同一個指數、同一個分數的兩個模型,定價卻像分屬市場的不同年代。有趣的問題不是哪一個勝出,而是那個 29× 之中,哪一部分是你實際上能繞過的——因為在這個配對裡,兩者恰好只有一個是你今天買得到的途徑,而它就是昂貴的那一個。
同一天,同樣的分數,不同的動物
Grok 4.7 於 2026 年 9 月 21 日發布,價格為每百萬輸入 token 2.00 美元、每百萬輸出 token 6.00 美元,具備 500,000 個 token 的上下文視窗、2026 年 5 月的知識截止點、75% 的快取折扣,並支援文字與圖像輸入、文字輸出。它在 xhigh 努力程度下於該指數取得 46 分,在 Grok Build 測試框架中的 Coding Agent Index 取得 56 分,並在 AA-Briefcase 上取得 1,657 Elo 分——在該排行榜上排名第四,落後於三個 Anthropic 項目,每項任務成本約為 Claude Opus 5 的一半。
Xiaomi MiMo-V2.6-Pro 是一個稀疏混合專家檢查點,總參數 1.02 萬億,其中活躍參數 1 億,採用 MIT 許可,上下文 100 萬 token,支援文字、圖像、語音和影片輸入,輸出文字,每百萬 token 收費 $0.43 和 $0.87,並提供 99% 快取折扣,在提示已預熱時可將有效輸入費率降至接近零。Artificial Analysis 在其指數中將其列為 114 個開放權重模型中的第一名,在成本方面列為 114 個中的第十二名。它可透過三個 API 供應商存取。它不在我們的路由中,我們不會在供應商完成上線前列出模型。
唯一能決定一切的那句話
• 每個索引任務成本 — MiMo-V2.6-Pro $0.13;Grok 4.7 $3.74 — 29 倍 • 輸出費率 — MiMo-V2.6-Pro 每 1M $0.87;Grok 4.7 每 1M $6.00 — 6.9 倍 • 索引執行時的輸出 token 數 — MiMo-V2.6-Pro 140M;Grok 4.7 240M,相較中位數 88M • 輸出速度 — MiMo-V2.6-Pro 43.6 t/s;Grok 4.7 40 t/s — 兩者皆低於中位數 • 上下文視窗 — MiMo-V2.6-Pro 1M;Grok 4.7 500K • 權重 — MiMo-V2.6-Pro 採 MIT 授權且可下載;Grok 4.7 為專有,僅提供 API
讀一下前兩行,差距的輪廓就很清楚了。依定價計算,兩者在輸出上相差 6.9 倍;在指標測試中,兩者每次回答的成本則相差 29 倍。中間的放大因子就是冗長度:Grok 產生了 2.4 億個輸出 token,而同級中位數為 8,800 萬個,MiMo-V2.6-Pro 則產生了 1.4 億個。這是在 6.9 倍費率劣勢之上,再疊加 1.71 倍的 token 劣勢,而 1.71 × 6.9 等於 11.8 —— 距離 29 倍剩下的部分來自輸入端,只要工作負載有任何重複前綴,MiMo-V2.6-Pro 的 99% 快取與 $0.0 快取讀取就能扛下主要作用。

冗長就是人們在估算時漏掉的那個數字。
成本模型通常是從費率表和假設的 token 數量建立起來的。但在這裡,這兩部分都錯了。費率表錯了,因為快取折扣不是註腳——99% 對比 75%,就是系統提示每次呼叫都讓你花錢,和幾乎不花你錢之間的差別。token 數量錯了,因為這兩個模型在相同工作上輸出的 token 數量並不相同,而評估器量到了這個差異:2.4 億對上 1.4 億,在完全相同的基準測試上有 1.71 倍的差距。
這兩者都不是你能從規格表上直接讀出的替代指標。Grok 4.7 的冗長度排名在同級 210 個模型中為第 94 名;MiMo-V2.6-Pro 的成本排名在其同級 114 個模型中為第 12 名。若團隊引用 Grok 4.7 的費率表,並假設工作負載的 token 用量中立,他們預測出的成本大約只會是該指數每項任務實際花費的四分之一。糾正之道也不是把指數成本當成你的估算值——它只是對單一基準測試形態的一種量測。而是要你在做出承諾之前,先測量自己兩邊的 token 數量,因為這兩個模型之間的差距在紙面上是 6.9 倍,在實務上卻是 29 倍,而對你的流量而言,這兩個數字只有一個是真的。

兩者都很慢,而那並不是平手。
Artificial Analysis 測得 Grok 4.7 的輸出速度為每秒 40 個 token,並稱其「名列最慢之流」;MiMo-V2.6-Pro 為 43.6,則被稱為「明顯偏慢」。這兩項讀數相當接近,因此速度不該成為兩者之間的決勝關鍵。但底下作為基準的中位數可不是這麼回事:MiMo-V2.6-Pro 所屬的開放權重陣營,中位數為 67.1。兩款模型都遠低於這個數字,而 MiMo-V2.6-Pro 的首個 token 回應時間(time to first token)為 3.17 秒,對比中位數的 2.31 秒;在互動式迴圈中,真正會讓人感到吃力的正是這個數字,而非批次處理情境。
所以,就延遲方面誠實的總結是:便宜 29 倍並不會替你買到更快的產品,而是買到一個更慢、但成本更低的產品——而如果你的使用者正盯著游標,3.17 秒的等待可能比省下的 token 代價更高。對於隔夜批次工作、離線評估,或任何以小時為單位計時的流程,這個取捨很直接,而那 29 倍幾乎是免費的。
路由器在此配對下能做與不能做的事
這是一組我們自家目錄確實一面倒的配對,而這點值得坦白說清楚。Grok 4.7 已在 OrcaRouter 上線,型號為 grok/grok-4.7,採用供應商自家的 $2.00 / $6.00 定價,最大輸出為 450K,並在 https://api.orcarouter.ai/v1 提供相容於 OpenAI SDK 的端點——所以如果這番比較讓你想要把 xAI 模型放在與其他一切相同的金鑰之下,這條路徑今天已經存在。Xiaomi MiMo-V2.6-Pro 並不在我們的路由中;至於那一邊,答案就是供應商自家的 API,或是你已經在用的三家列出供應商之一,我們不會假裝不是如此。
在這樣的比較中,路由器真正有價值的地方,在於那些不是模型本身的部分。只要一組金鑰就能跨 200+ 個模型,並以各供應商的定價、0% 加成計價,這意味著供應商降價會在當天就反映到你的帳單上,而不是等到下一次合約續約。自動容錯移轉意味著 40 t/s 的路由效能下降時,不會把你的管道一起拖垮。路由 DSL讓分流可以依據公開的每項任務成本來決定,而不是依據品牌忠誠度——高流量用便宜模型,困難呼叫用強大模型,並依每個請求來決定。而對於兩種模型都不太適合的工作負載,模型融合可以讓多個模型在單一呼叫背後執行。

這種比較通常會引發的問題
29× 對我的工作負載成立嗎?唯有當你的 token 組合與索引執行時相似才會成立。如果你的輸出很短、提示很長且已快取,這個倍數會向輸出端 6.9× 的費率差距收斂,並在輸入端擴大,此時 MiMo-V2.6-Pro 的 99% 折扣是決定性因素。如果你的輸出是冗長的推理軌跡,它會擴大到超過 29×,因為 Grok 4.7 的冗長懲罰與輸出長度成正比。
兩邊的 46 是同一個 46 嗎? 這是同一個指數、同一個版本,也是同一個量表——底層子分數分別是 46.32 和 46.45,相差 0.13 分,而該指數會把兩者都四捨五入為 46。Artificial Analysis 並未公布任一模型逐項評估的細分數據,因此這個綜合分數是現有最精細的粒度,而 0.13 分的差異不應被解讀為能力排名。
新專案應該預設採用哪一個?如果工作負載屬於批次處理、可容忍延遲且對成本敏感,那麼每項任務要價 $0.13 的 MiMo-V2.6-Pro 就是預設選擇,而且開放權重意味著你不會受制於單一供應商的定價。如果你特別需要 xAI 模型——Grok Build 測試框架的結果、AA-Briefcase 的排名位置、具備 2026 年 5 月知識截止點的 500K 上下文——Grok 4.7 目前在 OrcaRouter 上是可用的途徑,而每項任務的溢價正是換取這項特定能力所需付出的代價。這裡沒有任何一個模型能同時勝出這兩者。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
