
MiMo-V2.6-Pro 對決 DeepSeek V4 Pro:兩大開源旗艦,指數僅差十分
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
小米 MiMo-V2.6-Pro 與 DeepSeek V4 Pro 是同一類事物——兆級參數的中國混合專家旗艦模型,MIT 授權,100 萬 token 上下文,開放權重讓你今天就能下載——而它們在 Artificial Analysis Intelligence Index v4.3.2 上相差十分,46 對 36。它們對於旗艦模型的用途也抱持不同看法。DeepSeek V4 Pro 於 2026 年 8 月 13 日發布,是純文字推理模型:1.6 兆參數,490 億啟用參數,且在其公布的介面中完全沒有視覺、音訊或視訊輸入。小米 MiMo-V2.6-Pro 於 2026 年 9 月 21 日發布,參數為 1.02 兆,啟用參數 420 億,可接受文字、圖像、影片與音訊。那個差異所決定的部署數量,比那十分還多;在你比較其他任何東西之前,這是最先該確定的事。
相同授權,不同機器
先從真正完全相同的地方談起,因為在兩個相互競爭的實驗室之間,相同之處比你想像的還多。兩者都以 MIT 授權標籤在公開儲存庫上發布,這意味著可進行商業部署、修改與進一步訓練,沒有營收門檻,也沒有用途限制條款。兩者都宣稱具備 100 萬 token 的上下文視窗。兩者都是稀疏混合專家設計——這種架構在這個規模已成為預設做法,而非差異化優勢。而且兩者背後的實驗室,在方法上所公開的資訊都比西方前沿實驗室來得少。
• 參數 — MiMo-V2.6-Pro 總計 1.02T / 啟用 42B;DeepSeek V4 Pro 總計 1.6T / 啟用 49B
• 輸入模態 — MiMo-V2.6-Pro 文字、圖像、影片、音訊;DeepSeek V4 Pro 僅支援文字
• 上下文 — 兩者皆為 1M tokens;DeepSeek V4 Pro 輸出上限為 384K tokens
• 指數分數 — MiMo-V2.6-Pro 在 Intelligence Index v4.3.2 上為 46;DeepSeek V4 Pro 在同一版本上為 36
• 每項 Index 任務的成本 — MiMo-V2.6-Pro $0.13;DeepSeek V4 Pro $0.67
• 表定價格 — MiMo-V2.6-Pro 每 100 萬個 token 為 $0.43 / $0.87;DeepSeek V4 Pro 依 Artificial Analysis 所列為 $1.32 / $3.96,且尚未計入 DeepSeek 自家的尖峰/離峰時段費率
• 速度 — MiMo-V2.6-Pro 134.3 輸出 token/秒;DeepSeek V4 Pro 97.4
• 首個詞元時間 — MiMo-V2.6-Pro 2.15 秒;DeepSeek V4 Pro 1.62 秒
把那份清單讀兩遍,因為有兩行是反直覺的。較小的模型得分高出十分——420 億個活躍參數擊敗 490 億,這不是四捨五入的差異,而是後訓練的成果,也是這項比較中最清楚的單一訊號:強化學習的品質已超越原始規模,成為真正的槓桿。而且較便宜的模型同時也是較快的那個,無論在吞吐量或每項任務成本上都是如此,這與通常的取捨正好相反。Xiaomi 不是在用折扣換取你的耐心。DeepSeek 的優勢在於首個 token 時間,1.62 秒對上 2.15 秒——這是真的,但也是 V4 Pro 唯一領先的類別。

為什麼相同的索引版本在這裡很重要
跨索引版本比較開放權重模型,正是大多數已發表比較出錯的原因,所以版本號絕非註腳。Artificial Analysis 在 2026 年 9 月將 Intelligence Index 重建為 v4.3,而分數在這條界線前後出現大幅變動——Claude Opus 5 在 v4.2 與 v4.3 之間掉了三分,開放權重陣營也重新洗牌。上述兩個數字都是 v4.3.2,這表示 46 和 36 可以直接互相比較。它們無法與你在其他地方看到、針對這兩個模型中任何一個所引用的較舊數字相比。
這不是假設。DeepSeek V4 Pro 在 2026 年 8 月曾於較早的指標量表上被廣泛報導為 53,我們當時的報導也沿用了這個數字。在 v4.3.2 上,同一個模型的讀數是 36。模型本身沒有任何改變;改變的是那把尺。如果你的試算表裡寫著 53,旁邊是 MiMo-V2.6-Pro 的 46,那麼你所做的比較會把你指向錯誤的模型。正確的配對是 46 對 36,而正確的結論是:那個晚五週發布、參數量只有三分之二的模型,明顯領先。
兩個實驗室之間的通報落差
還有第二個更微妙的差異,而這涉及每個實驗室願意接受檢查的內容。
MiMo-V2.6-Pro 的 46 分是 Artificial Analysis 測得的結果。該評測機構對已發布的模型執行了自家測試套件——十項涵蓋推理、知識、數學與程式設計的評估——並公布了結果,連同運行數據:134.3 個 token/秒、首個 token 耗時 2.15 秒、99% 快取折扣、每項索引任務 $0.13,以及總評測成本 $206.66。這是第三方針對 Xiaomi 模型給出的數字。
DeepSeek V4 Pro 的頭條代理型數據是 DeepSeek 自家的,而這些數據與獨立數據之間的落差已有紀錄。該公司的發布資料回報 Terminal-Bench 2.1 為 87.9、DeepSWE 為 62.7、CyberGym 為 83.3,以及 SWE-bench Verified 為 80.6。獨立測試則將 Terminal-Bench 2.1 置於 78.7——比廠商數據低約九分——並將 Artificial Analysis Coding Index 置於 68.8。那些廠商數字無一被重現,而 Terminal-Bench 落差之大,正是應把其餘數據視為宣稱而非實測的理由。
Xiaomi 也有同一個問題的自家版本。其儀表板顯示,MiMo-V2.6-Pro 在其強化學習訓練過程中於 DeepSWE v1.1 上從 58.4 提升到 72.57,該評估是在 Xiaomi 自家的測試框架上,以 mini-swe-agent 採三次平均進行。那不是排行榜提交,也沒有任何外部單位重跑過。因此,兩個模型在廠商基準測試上,都不是毫無隱憂地登場。差別在於,MiMo-V2.6-Pro 還附帶一項獨立綜合分數,而 DeepSeek 在對應時刻的發布並沒有這項分數——如果你是在兩者之間依據證據、而非行銷來做選擇,那麼這個不對稱就應該具有份量。

這在正式環境中的樣貌
模態差異才是實務上的分岔點,而它對 DeepSeek 有利的情形,並不如那十分的差距所暗示的那麼常見。如果你的管線需要接收螢幕截圖、轉為圖像的 PDF、影片影格或音訊,MiMo-V2.6-Pro 能在單一模型中原生處理,而 DeepSeek V4 Pro 則完全無法處理——你得在前面另外接一個視覺模型,這代表第二份合約、第二種故障模式,以及第二筆帳單。如果你的工作負載是純文字推理,那麼額外模態就是多餘的負擔,而你並未為此付費。
每個索引任務的成本是另一個必須考量的數字。$0.13 對上 $0.67,在受控且完全相同的一組任務上、以相同方式為兩者測量,差距達五倍。DeepSeek 採用尖峰/離峰計費時段,會依你呼叫的時機大幅壓低其實際費率,因此實際比例在離峰時段會縮小,在尖峰時段則會擴大——如果你的流量具突發性,且無法選擇流量何時到來,這個細節就很重要。
這正是 DeepSeek 這一邊擁有真正優勢的地方,而這與模型本身無關:它就在我們的平台上。DeepSeek V4 Pro 可透過 deepseek/deepseek-v4-pro 使用 OrcaRouter 金鑰,以供應商定價、0% 加成費用存取,並具備跨供應商的自動容錯移轉,還能疊加使用路由 DSL——因此尖峰/離峰的成本計算、供應商價差與備援路徑,全都是你可以設定的事,而不是你得自己打造的東西。MiMo-V2.6-Pro 不在我們的平台上,我們會直說:如今要存取它,得透過小米自家的平台,或是某個有收錄它的第三方目錄,而 Artificial Analysis 在取樣時只計到一家 API 供應商。單一條路徑不是能用於生產環境的路徑,這也正是把 MiMo-V2.6-Pro 視為現在先評估、之後再謹慎導入路由、並在其後準備其他備援模型的強力理由。
哪一個,以及何時?
如果你的工作僅限於文字,如果你需要 384K 的輸出上限,如果你想要兩者中最快的首個 token 時間,或者如果你已經在我們的平台上,想要一條具備故障轉移且無需新整合的兆級參數開放權重路線,就選擇 DeepSeek V4 Pro。它之所以是現任者是有原因的,而早五週推出意味著多了五週的工具、量化與部署配方,這是九月模型尚未累積的。
若任務是多模態、若每項任務成本主導你的單位經濟效益、若吞吐量比半秒延遲更重要,或者你想要目前獨立量測指標上的開放權重領導者,就選擇 MiMo-V2.6-Pro。兩者皆採用 MIT 授權,意味著權重問題無論如何都已底定——你可以任選其一在自家硬體上執行、微調,並以商業方式推出。
值得考慮的組態根本不是二選一。路由器讓你能保留 DeepSeek 通道,以離峰費率進行純文字推理,並為多模態請求新增 MiMo 通道,同時在較薄弱的路由前面設置備援。那不是避險;而是把每個請求匹配到真正能處理它的模型,這比選出一個贏家並冀望工作負載永遠不改變形態,是更便宜且更持久的做法。

這個比較尚無法回答的問題
兩款模型最常被引用的基準測試,都是由廠商自行執行且未經重現。對 DeepSeek V4 Pro 而言,這道落差自八月以來一直存在,也正是其獨立評測分數低於發表時數字的原因。至於 MiMo-V2.6-Pro,獨立綜合分數雖已存在,但代理式細項拆解卻沒有——Artificial Analysis 公布了 46 分,卻未公布其下各項評測的分布,而這正是能判斷一個模型該放進代理迴圈還是問答管線的細節。
在那份差距公布之前,且在有人重新執行小米的 DeepSWE 測試框架之前,站得住腳的立場比兩家實驗室的行銷宣傳都更狹窄:MiMo-V2.6-Pro 在獨立綜合指標與實測每項任務成本上領先,DeepSeek V4 Pro 則在成熟度、輸出長度、首個詞元延遲,以及可透過背後具備備援的路由觸及等方面領先。五週是很短的先行優勢,而這是 DeepSeek 唯一擁有的優勢。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
