
MiMo-V2.6-Pro 對比 Kimi K3:兩款兩兆參數的開放權重模型,每項任務成本相差十四倍
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
兩者都是來自中國實驗室的開放權重混合專家模型,具備 100 萬 token 的上下文視窗。兩者皆可下載。在 2026 年 9 月 22 日讀取的 Artificial Analysis Intelligence Index v4.3.2 上,MoonshotAI 的 Kimi K3 得分為 44,小米的 MiMo-V2.6-Pro 得分為 46。兩分。對兩者分別執行同一套評估的實測成本,Kimi K3 為 3,658.07 美元,MiMo-V2.6-Pro 為 206.66 美元——相差十七倍。如果你已經決定要在這個級別選用開放權重,那麼真正決定一切的,是那個比例,而不是那兩分。
Kimi K3 是這組配對中較成熟的一方:於 2026 年 7 月 16 日發布,完整權重接著在 7 月 27 日釋出,且背後已有數個月的獨立評測。小米 MiMo-V2.6-Pro 則於 2026 年 9 月 22 日正式全面推出,其強化學習檢查點儲存庫在前一天現身。因此,這項比較是介於一個定價高昂、經過驗證的開放模型,與一個定價平實的全新模型之間,而有趣之處在於,實測出的能力差距結果竟是如此之小。
每個模型實際上是什麼
Kimi K3 是一個 2.8 兆參數的開放權重多模態推理模型,發表時被描述為首個屬於三兆級別的開放模型。每個 token 會啟動 896 個專家中的 16 個——約 1,040 億個活躍參數——並運用 Kimi Delta Attention 與 Attention Residuals 來高效維持 100 萬 token 的上下文,每次請求最多可輸出 100 萬個 token。它具備原生視覺能力,並持續開啟推理。Moonshot 的第一方 API 收費為每百萬輸入 token 3.00 美元、每百萬快取輸入 0.30 美元,以及每百萬輸出 15.00 美元,採均一費率,不依上下文長度分級;Artificial Analysis 指出其快取折扣為 90%,混合費率為 2.31 美元。實測輸出速度為每秒 42.8 個 token——相較同級規模模型的中位數 77.9 明顯偏慢——首個 token 的延遲為 3.93 秒。
Xiaomi MiMo-V2.6-Pro 是一款稀疏混合專家模型,總參數達 1.02 兆,每個 token 啟動 42 億個參數,具備 100 萬 token 的上下文視窗,並原生支援文字、圖像、影片與音訊的多模態能力。其權重帶有 MIT 授權標籤。小米維持了上一代的定價,而非將新的檢查點向上調價,因此其定價為每百萬輸入 token 0.43 美元、每百萬輸出 token 0.87 美元,並提供 99% 快取折扣,混合價為 0.18 美元。它的實測輸出速度為每秒 134.3 個 token——在 114 款模型中速度排名第十一——首個 token 延遲為 2.15 秒。
• 啟用參數 — MiMo-V2.6-Pro 每 token 42B;Kimi K3 約 104B,啟用 896 個專家中的 16 個
• 總參數量 — MiMo-V2.6-Pro 1.02T;Kimi K3 2.8T
• 指數分數 — MiMo-V2.6-Pro 46;Kimi K3 44,兩者均為 Artificial Analysis v4.3.2
• 定價 — MiMo-V2.6-Pro 每 1M $0.43 / $0.87;Kimi K3 $3.00 / $15.00,快取輸入 $0.30
• 混合費率 — MiMo-V2.6-Pro 每 100 萬 $0.18;Kimi K3 $2.31
• 執行索引的成本 — MiMo-V2.6-Pro $206.66;Kimi K3 $3,658.07
• 速度 — MiMo-V2.6-Pro 每秒輸出 134.3 個 token;Kimi K3 為 42.8,而同級距的中位數為 77.9
• 首個 token 時間 — MiMo-V2.6-Pro 2.15 秒;Kimi K3 3.93 秒
• 上下文 — 兩者皆為 100 萬個 token;Kimi K3 每次請求可發佈高達 100 萬個 token 的輸出
• 權重 — 兩者皆可下載;MiMo-V2.6-Pro 帶有 MIT 標籤

速度是指數所隱藏的差異
這裡最沒意思的數字是兩分的綜合評分差距;最有趣的則是 134.3 對上每秒 42.8 個 token。生成速度快三倍的模型並不代表它好三倍,但這卻是某一類應用能否行得通的差別——而 Kimi K3 自家的 Artificial Analysis 頁面也標示出,它在同級規模中明顯偏慢。對於會做出數十次循序呼叫的長時程代理迴圈來說,吞吐量會像延遲一樣產生複合效應:每次呼叫三倍的差距不等於端到端三倍的差距,但這正是使用者會耐心等完一次工作階段,還是直接放棄的差別。
Kimi K3 的優勢在帳本的輸入端。它首個 token 的 3.93 秒比 MiMo-V2.6-Pro 的 2.15 秒慢,但並未慢到像兩者與最高推理投入的前沿推理模型之間那樣相差一個數量級。K3 為其規模付出代價之處在於生成,而生成正是你被計費的項目。
供應商編號,以及那個會被誤讀的
兩家實驗室各自用自家的測試框架公布了 DeepSWE v1.1 的數據,而這兩組數據正被當成可以互相比較般流傳。它們其實不能相比,而這個錯誤正是在這一對數據上造成最大傷害,因為這些數字看起來如此接近。
小米報告 MiMo-V2.6-Pro 在其強化學習訓練過程中,於 DeepSWE v1.1 上從 58.4 提升至 72.57,並使用 mini-swe-agent 以三次平均在小米自家評分器上評估。該次訓練紀錄為 30 個步驟、每個模型約 750,000 條軌跡,在不到六天內完成,公開支出約為 Pro 模型 262 萬美元,以及較小的 Flash 為 854,044 美元。對該次訓練的一種廣泛流傳解讀,將 Kimi K3 在同一基準上列為 68.51,這會使小米模型以四分勝出。那個解讀是社群數字,不是 Moonshot 的數字,而且這兩項測量使用不同指標——三次平均對比通過率——所以將它們相減是在不相符的尺度上做算術。兩家廠商都未針對這些模型向 Datacurve 的公開排行榜提交配置。
真正具有可比性的是指數,因為 Artificial Analysis 兩者都自己跑過:MiMo-V2.6-Pro 是 46,Kimi K3 是 44,版本為 v4.3.2,而兩者都沒有公布逐項評估的細分數據。這兩分的差距小到落在十項評估綜合指標的雜訊範圍內,因此誠實的結論是:就實測能力而言,這兩個模型實際上不相上下。
Kimi K3 的進階版能買到什麼
把成本差距解讀為純粹的利潤空間是錯誤的。Kimi K3 是 2.8 兆參數的模型,對比小米的 1.02 兆,而且它在每個 token 啟用的參數量約為後者的兩倍半。它是其規模級別中首個開放模型,並持有一組 MiMo-V2.6-Pro 根本還沒時間累積的獨立結果:根據 Artificial Analysis 自家的報告,它在發布時於 Intelligence Index 排名第三,僅次於 Claude Fable 5 與 GPT-5.6 Sol,GDPval-AA v2 為 Elo 1668,AutomationBench-AA 以 53% 位居第一,AA-Briefcase 以 Elo 1547 排名第二,Frontend Code Arena 以 1679 排名第一。這些是獨立測量,而非發布宣稱,它們所描述的是一個具備廣度的模型,而兩分的綜合差距並無法體現這種廣度。
產能問題也如影隨形。據報導,市場對 Kimi K3 的需求在發布時壓垮了服務容量,導致 API 訂閱暫時中斷,部分閘道也出現上游容量限制。一款難以取得的模型,就是一款難以在其上開發的模型,而這是可用性問題,而非品質問題。

一個端點,以及關於我們路由什麼的直接答案
Kimi K3 已在 OrcaRouter 上提供,型號為 kimi/kimi-k3 — 一組與 OpenAI 相容的金鑰,供應商定價以 0% 加成原價傳遞,因此 Moonshot 的價格一有變動,我們這邊當天就會同步生效,而跨供應商的自動容錯移轉,則能涵蓋這款模型自推出以來一直困擾它的容量限制。Xiaomi MiMo-V2.6-Pro 並未上架 OrcaRouter。沒有任何小米模型在 OrcaRouter 上,目前要取用它的途徑,是小米自家的平台或收錄它的第三方型錄之一。這點值得直接說清楚,而不是讓模型頁面暗示相反的情況。
這正是路由層存在的意義的絕佳範例。兩個開源模型,在雙方唯一都跑過的獨立衡量指標上打成平手,但每項任務的實測成本卻相差十七倍——這不是取捨,而是雙線道組態。把大部分流量放在便宜的那條線上,再依你自訂的條件判斷把長尾流量導向另一條,或是在某條路線效能下降時容錯移轉。當這些模型都藏在同一把金鑰之後,告訴你各自該分到多少流量的實驗,就只是你自己提示詞上的一項組態變更,而不是一場採購協商——而且如果小米在上市窗口關閉後調整 MiMo-V2.6-Pro 的價格,或 Moonshot 為了因應競爭而下調 K3 的費率,這兩步都會在當天就反映在我們這邊,而不是等到下一個計費週期。

該選哪一個
當你需要這個規模、且經過獨立實測的模型所帶來的廣度——視覺、跨大型程式碼庫的長程編碼、代理式工具使用——或者當你已經在運行它,而遷移成本確實存在時,就選 Kimi K3。它是兩者中特性刻畫得更詳盡的模型,而其 1M token 的輸出上限並不尋常。要為生成速度做好預算:以每秒 42.8 個 token 而言,就互動用途來說,它是批次與離線工作負載的模型,不論其推理品質暗示了什麼。
當吞吐量和單位經濟效益是限制條件時、當迴圈是上下文密集且重複時、當首個 token 延遲很重要時,或當你想在寬鬆的授權條款下把權重放在自己的硬體上時,就選 MiMo-V2.6-Pro。它是罕見的便宜模型同時也是快的那個,而在兩個模型唯一共同擁有的獨立評分上,它領先的幅度小到足以視為平手。
如果你有路由器,就兩個都選。要避免的失敗模式,是因為某個亮眼的比率就標準化採用其中一個:為一份 46-index 模型也能做得一模一樣的摘要工作,支付 Kimi K3 的費率;或者在你把所有東西都移到便宜路線之後,才發現一項儲存庫規模的程式設計任務需要 2.8T 模型。這兩者都不是模型問題,而兩者都是設定問題。
OrcaRouter 將 200+ 個模型置於單一 OpenAI 相容端點之後,以供應商標價提供且 0% 加成,因此供應商價格一有變動,當天即會生效。
