
MiMo-V2.6-Pro 對比 Gemini 3.1 Pro:僅存在於某個索引版本中的 16 分差距
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
把 Xiaomi MiMo-V2.6-Pro 和 Gemini 3.1 Pro Preview 並列在 Artificial Analysis Intelligence Index 上,你會得到 46 對 30——對於一個輸入成本只有對方五分之一的模型而言,這是十六分的領先。若改把它們並列在兩家廠商各自於發布時公布的數字上,Gemini 3.1 Pro 則以十一分勝出。這兩種讀數都出自同一個評估者。它們之所以不一致,正是 2026 年 9 月比較模型時最值得理解的一件事:這個指數已在兩者底下被重建,而分數唯有與產生它的版本號並列時才有意義。
v4.3.2 綜合指標是目前的最新版本。它涵蓋十項評估——AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience 與 AA-LCR v1.1——而在這套指標上,於 2026 年 9 月 22 日讀取,小米的模型得分為 46,Google 的得分為 30。在 2026 年 2 月 19 日推出時,Gemini 3.1 Pro Preview 在當時的尺度上被報導為 57,登上榜首。那兩個 Gemini 數字並不是退步。它們是兩把不同的尺。
每個模型實際上是什麼
Gemini 3.1 Pro Preview 是 Google 的前沿推理模型,於 2026 年 2 月 19 日發布,七個月後仍帶著 preview 標籤。它擁有 1M-token 上下文視窗,輸出上限為 65,536 個 token——Artificial Analysis 列為 64K,而我們自家的模型頁面則列為 65K——接受文字、圖像、PDF、音訊與視訊輸入,輸出文字。它是專有模型,參數數量未公開,知識截止時間為 2025 年 1 月。Google 自家的 API 收費為:輸入低於 200K 時,每百萬輸入 token 2.00 美元、每百萬輸出 token 12.00 美元;超過 200K 時,調整為 4.00 美元與 18.00 美元;快取輸入則為 0.20 美元。
小米 MiMo-V2.6-Pro 於 2026 年 9 月 22 日正式全面推出,強化學習檢查點儲存庫則在前一天出現。它是一個稀疏混合專家模型,總參數達 1.02 兆,每個 token 啟用 420 億參數,具備 100 萬 token 上下文視窗、原生支援文字、圖像、影片與音訊的多模態能力,以及以 MIT 授權的可下載權重。小米維持前一代 MiMo-V2.5 的定價,而非將新檢查點的價格調漲:每百萬輸入 token 0.43 美元、每百萬輸出 token 0.87 美元,並提供 99% 快取折扣,且在 7:2:1 的快取命中/輸入/輸出混合比例下,混合費率為 0.18 美元。
• 權重 — Xiaomi MiMo-V2.6-Pro 採 MIT 授權且可下載;Gemini 3.1 Pro Preview 為專有模型,僅提供 API
• 參數 — MiMo-V2.6-Pro 總計 1.02T/活躍 42B;Gemini 3.1 Pro Preview 未公開
• 上下文 — 兩者皆為 1M tokens;Gemini 3.1 Pro Preview 的輸出上限為 65,536 tokens,MiMo-V2.6-Pro 則未公布同等上限
• 模態 — MiMo-V2.6-Pro 接受文字、圖像、影片與音訊;Gemini 3.1 Pro Preview 接受文字、圖像、PDF、音訊與影片
• 定價 — MiMo-V2.6-Pro 每 100 萬個 token $0.43 / $0.87;Gemini 3.1 Pro Preview 輸入低於 200K 時 $2.00 / $12.00,高於 200K 時 $4.00 / $18.00
• 快取 — MiMo-V2.6-Pro 99% 折扣;Gemini 3.1 Pro Preview 每 100 萬次快取讀取 $0.20
• 速度 — MiMo-V2.6-Pro 每秒輸出 134.3 個 token;Gemini 3.1 Pro Preview 每秒 121.8 個
• 首個權杖時間 — MiMo-V2.6-Pro 2.15 秒;Gemini 3.1 Pro Preview 63.62 秒
• 執行索引的實測成本 — MiMo-V2.6-Pro 為 206.66 美元,即每項任務 0.13 美元;Gemini 3.1 Pro Preview 為 1,310.21 美元,即每項任務 0.67 美元

預覽標籤才是真正的差異所在
以上全部都是規格。唯一會改變你該如何解讀整份比較的一行,就是「preview」這個詞。預覽模型是一種候選模型,Google 並未承諾會將其保留在該端點。對比較頁面而言,這件事的重要性不是十六點指數差距所能比擬的,因為一個你無法指望六個月後還在那裡的模型,不是你會用來標準化的模型——而 Google 自家的模型家族早已超越它。Gemini 3.6 Flash 與 Gemini 3.8 Flash 在程式編寫與代理式工作上,以更低成本位居 Gemini 3.1 Pro 之上,這也是為什麼一篇針對 3.1 Pro 發布的技術評論將其形容為明確屬於前一代。AA 頁面本身在智力方面將其列為 202 名中的第 71 名。
小米的模型則處於相反的境地。它在本週正式推出,權重以 MIT 授權釋出,而推論服務特性正是它最強的一環。每秒 134.3 個輸出 token 的表現,讓它在 114 個受測速度的模型中排名第十一,而 2.15 秒產生首個 token,約比 Gemini 3.1 Pro Preview 的 63.62 秒快上三十倍。對互動式應用而言,這不是打破僵局的關鍵。這是產品與展示品之間的差別,也是最可能在效能基準表上被忽略的那個數字。
錢實際上都花到哪裡去了
以每詞元計算的算術低估了這兩者之間的差距,因為這兩個模型完成同一項工作所消耗的詞元數量並不相同。更清楚的數字,是 Artificial Analysis 針對兩者各自跑完整套 Intelligence Index 所測得的成本:MiMo-V2.6-Pro 為 206.66 美元,Gemini 3.1 Pro Preview 為 1,310.21 美元。相同的測試套件、相同的測試框架、以相同方式測量——在完全相同的任務集上出現 6.3 倍的差距,而且這個差距已經把推理模型會產生大量詞元進行思考這件事納入考量。Gemini 3.1 Pro Preview 在整個索引中產生了 6,700 萬個輸出詞元;同價位帶模型的中位數是 9,000 萬個,因此它每分的成本其實比同級模型更經濟,但評估它所需的成本仍是小米這款模型的六倍。
接著讓一個正式環境迴圈跑在它上面。一次 30 步的代理程式執行,每一步讀取 200,000 個 token 的上下文、寫入 2,000 個 token,每次執行就是 600 萬個輸入 token 和 60,000 個輸出 token。在 Gemini 3.1 Pro Preview 上,若低於 200K 級距,這樣是 12.00 美元的輸入和 0.72 美元的輸出——每次執行 12.72 美元。在 MiMo-V2.6-Pro 上則是 2.58 美元和 0.05 美元——2.63 美元。在 Google 模型上,輸入一旦超過 200,000 個 token,輸入費率就會加倍到 4.00 美元,此時同一個迴圈在計算輸出之前就要花上 24.00 美元。快取會讓這兩個數字變動,但便宜模型 99% 的折扣,對上昂貴模型 0.20 美元的快取讀取,仍會讓昂貴模型在上下文密集的迴圈中高出一個數量級。

誠實陳述的路由問題
這裡有一個很容易弄錯的地方。Gemini 3.1 Pro Preview 在 OrcaRouter 上是 google/gemini-3.1-pro-preview,可透過一組與 OpenAI 相容的金鑰,以供應商定價、0% 加成存取——因此 Google 的價格一有變動,我們這邊當天就會反映,而不是等到下一個帳單週期。小米 MiMo-V2.6-Pro 不在 OrcaRouter 上。任何小米模型都不在,而直言不諱比讓模型頁面暗示相反情況更有用。今天要用它,得透過小米自家的平台,或某個收錄它的第三方目錄。
這種不對稱正是路由器在這項比較中佔有一席之地、而非只是附帶註腳的原因。這兩個模型並不是在爭奪相同的請求。Gemini 3.1 Pro Preview 是你可能已經在付費使用的現任者,而本頁要回答的問題是:這個新的低成本模型能否分走它一部分的流量。要妥當地進行這項測試,意味著把你自己的提示詞送到兩邊並比較回答,而不是去讀一份指標——而如果得為此另外開一份合約、另一把金鑰和另一段帳務關係,那種摩擦正是讓測試永遠無法付諸實行的原因。一把金鑰、兩條由我們決定路由的通道,比較就變成一次設定變更。自動容錯移轉則補上另一半:預覽模型可能在毫無預警下被下架或受到速率限制,而同一個端點後方的第二條通道,正是把這種情況從服務中斷變成路由決策的關鍵。

該選哪一個
當任務需要原生支援 PDF 與音訊輸入時、當你已經身處 Google 生態系之中時,或當你特別需要該模型的行為表現、且能承受預覽端點日後遭棄用的風險時,就選擇 Gemini 3.1 Pro Preview。它首個權杖的生成時間為 63 秒,這意味著無論行銷宣傳怎麼形容它的互動性,實務上它就是一款批次與離線工作負載模型。
當流量規模是限制條件、當迴圈吃重上下文且高度重複、當你想把權重放在自己的硬體上——MIT 授權允許商業部署、修改與進一步訓練——或者當首字延遲本身就是產品體驗的一部分時,就選 MiMo-V2.6-Pro。它是那種罕見的案例:既便宜又快速,而這種組合的價值遠超過那十六個指數分數所暗示的程度。
能改變這個局面的是 Gemini 3.1 Pro 的非預覽版後繼產品,或是有人用自家測試框架獨立重現小米公布的 DeepSWE 數據——Pro 為 72.57、Flash 為 65.68,且在整段強化學習流程中分別從 58.4 與 48.8 提升而來。這些數字是廠商自行回報,是在小米的評分器上以 mini-swe-agent 取三次平均所評估,並未提交至任何公開排行榜。在有人重新跑過這些數字之前,該引用的是 Artificial Analysis 的 46,而它與 30 是用同一把尺測量出來的。
OrcaRouter 將 200+ 個模型置於單一 OpenAI 相容端點之後,以供應商標價提供且 0% 加成,因此供應商價格一有變動,當天即會生效。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
