
MiMo-V2.6-Pro 對比 Grok 4.6:兩家廠商都公布了 DeepSWE 成績,而兩者都不在排行榜上
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
兩家廠商、同一個基準、兩個不能相減的數字。SpaceXAI 的 Grok 4.6 發布資料顯示,在 DeepSWE v1.1 上達到 65.9%。小米的 MiMo-V2.6-Pro 資料則顯示,在 DeepSWE v1.1 上達到 72.57。合起來看,這會讓人以為較便宜、開放權重的模型以近七個百分點擊敗了專有的前沿模型。仔細看,它們幾乎沒有說明什麼,因為一個是廠商自家測試框架上的發布簡報百分比,另一個是小米自家評分器上強化學習執行結果的三次平均,而兩者都未提交至公開的 DeepSWE 榜單。真正經得起檢視的 MiMo-V2.6-Pro 與 Grok 4.6 比較,是在獨立指數上,而那裡給出的答案與廠商數字相反:46 對 44,小米占優,領先兩分。
Grok 4.6 於 2026 年 8 月 12 日由 SpaceXAI 發布,並且在此是既有的一方——一個已正式推出、被廣泛提供的前沿模型,擁有有據可查的價格表,以及數個月的獨立測量作為後盾。Xiaomi MiMo-V2.6-Pro 於 2026 年 9 月 22 日正式全面推出,其強化學習檢查點儲存庫在前一天出現,而它是新進者。兩者都具備推理能力,兩者都是為長時間執行的代理式工作而打造,而且它們之間的價格差距大到足以讓新進者的經驗不足成為唯一阻礙這項比較的因素。
每個模型實際上是什麼
Grok 4.6 為專有模型,接受文字與圖像輸入並回傳文字,知識截止日為 2026 年 2 月 1 日。其上下文視窗為 500,000 個 token,僅為其主要競爭對手的一半,也是其規格表上影響最為深遠的一項規格。其定價表列費率為:提示 token 低於 200,000 時,每百萬輸入 token 2.00 美元、每百萬快取輸入 0.50 美元、每百萬輸出 6.00 美元,並在此界線出現斷崖:達到或超過 200K 時,費率變為 4.00、1.00 與 12.00 美元,且較高費率級距會以整筆請求計費,而非僅計算超出界線的部分。優先處理會使標準費率加倍。Artificial Analysis 測得在最大努力模式下每秒 63.0 個輸出 token、首個 token 耗時 42.79 秒,以及執行完整索引需花費 2,351.83 美元。
Xiaomi MiMo-V2.6-Pro 是一款稀疏混合專家模型,總參數達 1.02 兆,每個 token 啟用 420 億參數,具備 100 萬 token 的上下文視窗,以及橫跨文字、圖像、影片與音訊的原生多模態能力。它採用 MIT 授權並提供可下載的權重,而小米維持上一代的定價,並未因新的檢查點而上調——每百萬輸入 token 0.43 美元、每百萬輸出 token 0.87 美元,快取折扣 99%,在 7:2:1 的快取命中/輸入/輸出混合下,綜合成本為 0.18 美元。Artificial Analysis 測得每秒 134.3 個輸出 token、首個 token 耗時 2.15 秒,以及執行該索引需 206.66 美元——每項任務 0.13 美元。
• 權重 —— MiMo-V2.6-Pro 採用 MIT 授權且可下載;Grok 4.6 為專有模型,僅提供 API
• 參數 — MiMo-V2.6-Pro 總計 1.02T/活躍 42B;Grok 4.6 未公開
• 上下文 — MiMo-V2.6-Pro 為 100 萬個 token;Grok 4.6 為 50 萬個,且在輸入達 20 萬個 token 時出現價格斷崖
• 模態 — MiMo-V2.6-Pro 接受文字、圖像、影片與音訊;Grok 4.6 公開的輸入介面為文字與圖像
• 指數分數 — MiMo-V2.6-Pro 46;Grok 4.6 44,兩者皆為 Artificial Analysis v4.3.2
• 定價 — MiMo-V2.6-Pro 每 1M 為 $0.43 / $0.87;Grok 4.6 為 $2.00 / $6.00,輸入超過 200K 時加倍
• 混合費率 — MiMo-V2.6-Pro 每 100 萬 $0.18;Grok 4.6 $1.35
• 執行索引的成本 — MiMo-V2.6-Pro $206.66;Grok 4.6 $2,351.83
• 速度 — MiMo-V2.6-Pro 每秒輸出 134.3 個詞元;Grok 4.6 63.0
• 首個 token 所需時間——MiMo-V2.6-Pro 2.15 秒;Grok 4.6 42.79 秒
• 知識截止 — MiMo-V2.6-Pro 尚未發布;Grok 4.6 2026年2月1日

兩家廠商都跑過的基準測試,以及為何它無法相提並論
DeepSWE v1.1 是由 Datacurve 執行的一項真實、公開的第三方程式設計代理評測,而它正是兩家公司都選擇用來發布成績的那一個任務系列。這讓它顯得很有吸引力。但它不該被當成正面對決來使用,原因並不是哪一家廠商在說謊——而是這兩個數字所描述的,是同一個任務名稱下不同的量測方式。
小米的 72.57 是在其自家測試框架上使用 mini-swe-agent 所得的三次平均結果,產生於一次強化學習訓練過程中,而非來自凍結的發布候選版本,並且與 58.4 的起始數字一併報告。該次訓練記錄為 30 個步驟,每個模型約 750,000 條軌跡,在不到六天內完成,已公開的支出約為 Pro 模型 262 萬美元。它尚未提交至 Datacurve 的排行榜。SpaceXAI 的 Grok 4.6 的 65.9% 是來自廠商自家評估集的發表簡報數字,並與同一基準上相對 Grok 4.5 的 11.9 個百分點提升並列報告——而公開排行榜上有一個已提交的 Grok 4.6 配置,約在 67%,與廠商數字接近到足以顯示該測試框架至少大致一致。小米的數字則並非如此,它完全沒有公開的對應結果。
所以誠實的說法是這樣:在公開榜單上,Grok 4.6 有列名,而 MiMo-V2.6-Pro 則缺席。在獨立綜合評比中,同一位評測者實際上對兩者都進行了測試,小米的模型領先兩分。這兩個事實並不矛盾。它們只是衡量不同的東西,而該引用的是第二個。
500K 上下文是決定真實工作負載的規格
以任何正常標準來看,五十萬個 token 都是很大的上下文視窗,但放到 2026 年卻顯得渺小。與 MiMo-V2.6-Pro 被歸為同一級的模型全都落在 1M,而這個實際後果正好顯現在 Grok 4.6 所主打的工作負載上。一個長時間運作的程式編寫代理若持有儲存庫、工具呼叫紀錄與逐步累積的計畫,單次工作階段中的提示就會突破 200,000 個 token——而一旦跨過這條線,Grok 4.6 的費率便會加倍,並溯及整筆請求。同樣的工作階段跑在 MiMo-V2.6-Pro 上,則可一路用到一百萬個 token 而不會跳級。
這既是規格上的差異,也是定價結構上的差異,而後者在比較表面費率時很容易被忽略。Grok 4.6 的混合價格為 $1.35,對比 MiMo-V2.6-Pro 的 $0.18,差距達 7.5 倍。若提示超過 200K,差距會擴大到接近 15 倍,因為 Grok 的費率會加倍,而 Xiaomi 的費率則維持不變。
反駁論點也同樣被記錄在案,而且它理應如此。Grok 4.6 的發布核心論述是回合效率,而非原始上下文量:在代理式評估中,它與 Claude Opus 5 在相同任務上相互較量,結果它大約在 53 個回合、約 5 億個輸入 token 內完成,而另一個模型則約需 103 個回合、20 億個 token,每項任務估計成本為 0.84 美元——是該比較中前沿模型裡最低的數字。一個只需繞迴圈一半次數的模型,不需要那麼多上下文,也不會燒掉那麼多 token。這是名副其實的架構優勢,也是 Grok 4.6 面對任何每 token 更便宜替代方案──包括這一個──時最強而有力的論據。

抵達每一個
Grok 4.6 已上架 OrcaRouter,型號為grok/grok-4.6,可透過單一 OpenAI 相容端點、以供應商定價零加成存取——因此 SpaceXAI 的價格若有變動,包括那個 200K 斷崖的調整,在我們這邊當天就會同步生效。Xiaomi MiMo-V2.6-Pro 並不在 OrcaRouter 上。沒有任何小米模型在架上,目前要取用它,只能透過小米自家平台,或收錄該模型的第三方目錄。把這件事明白說出來,比讓模型頁面暗示相反的情況更有用。
這種不對稱性在實務上值多少,是個成本低廉的實驗。Grok 4.6 是你可能已經在付費使用的模型。MiMo-V2.6-Pro 本週推出,指標提升兩點,費率卻只是其中一小部分,背後只有一條服務路由。值得回答的問題不是抽象上哪個更好,而是小米這款模型能在你自己的提示上承接多少 Grok 流量——而要靠開第二份合約、第二把金鑰和第二套帳務關係來回答,正是讓這項測試無法發生的摩擦。有了單一端點與跨供應商的自動容錯移轉,這項比較就只是一次設定變更;而這裡的容錯移轉那一半比平常更重要:一個本週才推出、且在 Artificial Analysis 擷取資料時只被一家 API 供應商列出的模型,不該在沒有退路的情況下放進正式環境路徑。

該選哪一個
當你最佳化的重點是回合效率時,就選 Grok 4.6——在冗長的代理迴圈中,模型能以一半步驟完成任務的能力,比它的每詞元費率更有價值——或者當你想要的是有數個月獨立評測數據背書、而非只有一週的模型時。它每秒 63 個詞元與 42.79 秒的首詞元時間,就互動用途而言,使它成為一款批次與離線工作負載的模型;而它 500K 的內容脈絡搭配 200K 的價格斷崖,則說明了提示應該保持簡短。
當你執行的是上下文吃重、重複性高的迴圈,而且會跨越 Grok 的 200K 斷崖時;當你需要低到讓人類願意等待的首字延遲時;當你想把權重放在自家基礎架構時;或者當用量大到讓 7.5 倍的混合費率差距成為決定性數字時,就選 MiMo-V2.6-Pro。它的兩分索引領先幅度小到不足以單獨成為理由;相較之下,執行同一套評估套件只需 $206.66,而對手要 $2,351.83,這才是更好的理由。
能讓這個懸而未決的問題塵埃落定的,是針對 MiMo-V2.6-Pro 提交的 DeepSWE 設定。Grok 4.6 已經有了。當 Xiaomi 的模型帶著明確載明的測試框架、信賴區間與每項任務成本出現在公開排行榜上,72.57 就不再只是廠商自報的數字,上述比較也會成為真正的比較——而且有鑑於該指數上兩點的差距,結果可能朝任一方向發展。
OrcaRouter 將 200+ 個模型置於單一 OpenAI 相容端點之後,以供應商標價提供且 0% 加成,因此供應商價格一有變動,當天即會生效。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
