一張 MiMo-V2.6-Pro 對比 Qwen3.8-Max 的標題卡,展示兩張相對的規格卡:小米 MiMo-V2.6-Pro 的智慧指數 v4.3.2 為 46、每詞元 42B 活躍參數、每秒 134.3 個詞元,以及每 1M 混合計價 $0.18;對比 Qwen3.8-Max 的指數 45、每詞元 95B 活躍參數、每秒 39.2 個詞元,以及 $1.18。
Guides & Insights

MiMo-V2.6-Pro 對比 Qwen3.8-Max:一個指數點,六倍價格

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Qwen3.8-Max 是一個擁有 2.4 兆參數的模型,每個 token 會啟用其中 950 億個參數,且僅由單一供應商運行。Xiaomi MiMo-V2.6-Pro 是一個擁有 1.02 兆參數的模型,每個 token 啟用 420 億個參數,在同一項獨立指數上得分高出一分,而呼叫成本約只有六分之一。這些事實擺在一起顯得格格不入,而你要如何調和它們,正是這兩者之間抉擇的全部關鍵。長話短說:在 Artificial Analysis Intelligence Index v4.3.2 上,Xiaomi MiMo-V2.6-Pro 得分 46,Qwen3.8-Max 得分 45——在雜訊範圍內難分高下——而價目表顯示每百萬 token 分別為 0.43 美元與 0.87 美元,對比 2.00 美元與 6.00 美元。

每個模型實際上是什麼

Qwen3.8-Max 是阿里巴巴的旗艦模型,自 2026 年 8 月 3 日起全面推出,而在它問世時,是 Qwen 系列歷來所發布過最大的模型。它是一種稀疏專家混合(MoE)模型,建構於 Qwen 3.5 架構之上,總參數達 2.4 兆,每個 token 約有 950 億個活躍參數,具備 100 萬 token 的上下文視窗、最高 131,000 token 的輸出,以及涵蓋文字、圖像與影片的多模態輸入。阿里巴巴將國際費率調降至每百萬輸入 token 2.00 美元、每百萬輸出 token 6.00 美元,快取輸入為 0.25 美元,並宣稱這大約是 Claude Opus 5 輸入價格的 40%。隨後於 2026 年 9 月 2 日推出了一次小版本更新 Qwen3.8-Max-0902,而 Artificial Analysis 目前對其的基準測試分數為 45。

Xiaomi MiMo-V2.6-Pro 於 2026 年 9 月 22 日正式全面推出,也就是本文比較撰寫前的三天,其強化學習檢查點儲存庫則在前一天上線。它是稀疏混合專家模型,總參數達 1.02 兆,每個 token 啟用 420 億個參數,並具備同樣的 100 萬 token 上下文視窗、涵蓋文字、圖像、影片與音訊的原生多模態能力,權重以 MIT 授權條款發布。Xiaomi 維持上一代的定價,而非將新檢查點的價格向上調整,因此其標價為 $0.43 與 $0.87,並有 99% 快取折扣,混合價為 $0.18。

• 每個 token 的啟用運算量 —— Qwen3.8-Max 95B;Xiaomi MiMo-V2.6-Pro 42B,不到一半

• 總參數量 — Qwen3.8-Max 2.4T;Xiaomi MiMo-V2.6-Pro 1.02T

• 指數分數 — Xiaomi MiMo-V2.6-Pro 46;Qwen3.8-Max 45,兩者皆採用 Artificial Analysis v4.3.2

• 輸出速度 — Xiaomi MiMo-V2.6-Pro 134.3 tokens/秒;Qwen3.8-Max 39.2,同級中位數為 72.5

• 首個 token 耗時——Xiaomi MiMo-V2.6-Pro 2.15 秒;Qwen3.8-Max 2.93

• 定價 — Xiaomi MiMo-V2.6-Pro 每 1M $0.43 / $0.87;Qwen3.8-Max $2.00 / $6.00

• 混合費率 — Xiaomi MiMo-V2.6-Pro 每 100 萬 0.18 美元,快取命中/輸入/輸出為 7:2:1;Qwen3.8-Max 1.18 美元

• 權重 — Xiaomi MiMo-V2.6-Pro 以 MIT 授權且可下載;Qwen3.8-Max 則以專有端點形式提供,另附一款純文字開放權重版本,捨棄了 1M 上下文與視覺輸入

• 可及性 — 在 Artificial Analysis 上,每個各計為一個 API 供應商

比分是平手。速度則不然。

在一個十項評估的綜合分數上,一分之差不是任何人應該據以行動的差異,而更有用的訊號是它背後發生了什麼事。每個 token 啟用參數不到一半的模型得分略高,生成輸出速度快了三倍半——每秒 134.3 個 token,相對於 39.2,而同類推理模型的中位數是 72.5。Qwen3.8-Max 是該頁面上所測量的前沿級模型中最慢的,而這是每個 token 啟用 950 億參數的設計後果,而非服務上的意外。

延遲所揭示的故事,與參數數量所暗示的恰好相反。Qwen3.8-Max 抵達首個 token 耗時 2.93 秒,Xiaomi 則為 2.15 秒,而這個差距遠小於吞吐量差距——Qwen3.8-Max 是一旦開始輸出就慢,而不是起步慢。對於答案簡短的聊天介面,這種差異幾乎不會浮現。但對於會產生數萬個輸出 token 的代理迴圈,吞吐量就決定了整體的牆鐘時間,而 3.4 倍的差距會在這次執行的每一回合中不斷累積。

A two-column comparison scoreboard for Xiaomi MiMo-V2.6-Pro and Qwen3.8-Max covering Intelligence Index v4.3.2 (46 vs 45), active parameters (42B vs 95B per token), output speed (134.3 vs 39.2 tokens/second), time to first token (2.15s vs 2.93s), blended rate ($0.18 vs $1.18 per 1M) and weight availability (MIT, full multimodal vs a text-only release without the 1M context).

供應商表格在哪些地方不一致,以及為何那並非矛盾

阿里巴巴為 Qwen3.8-Max 公布了一張涵蓋範圍廣泛的成績表,而它確實很強:Terminal-Bench 2.1 為 86.6,SWE-bench Pro 為 67.7,PaperBench 為 93.0,GPQA Diamond 為 92.6,IFBench 為 82.8,OSWorld-Verified 為 86.1,Humanity's Last Exam 則為 43.6。這些是廠商在自家測試框架上跑出的數字,其中有些還是在阿里巴巴自家的評測基準上取得的,因此它們是宣稱而非實測——但這些宣稱是建立在廣為使用的評測基準之上,這使得它們在跨實驗室比較時,比某套量身打造的測試框架結果更具可比性。

小米的頭條數字是 DeepSWE v1.1 上的 72.57,高於 58.4 的基線,使用 mini-swe-agent 以三次平均、在小米自家的評分器上測得,該強化學習訓練由小米記錄為三十步、約 750,000 條軌跡,公布花費約 262 萬美元。它尚未提交到公開的 DeepSWE 排行榜,也沒有第三方重現過。把 72.57 拿來對比 Qwen 在 SWE-bench Pro 的 67.7,並宣稱小米以五分勝出,會是跨兩套不同基準、兩套不同測試框架和兩套不同評分慣例來解讀。恰好有一把尺規,是這兩個模型都由其製造者以外的人拿來對照過的,而它顯示 46 比 45。

Qwen3.8-Max 有兩個更關鍵的數字,根本就不是分數。阿里巴巴宣布權重會與 Qwen3.8-27B 一同開源,而實際落地的檢查點是純文字的,並不具備已上線服務的 Max 端點所擁有的完整 100 萬 token 上下文或視覺輸入。因此,「Qwen3.8-Max 是開放權重」和「Qwen3.8-Max 是多模態的 100 萬上下文端點」這兩種說法,都是關於不同產物的真確陳述;若部署計畫建立在第一種之上,卻期待第二種,一碰上現實就撐不下去。與此同時,0902 點版本在版本號未變的情況下,把模型推上某個公開網頁開發競技場的榜首——這提醒我們,你八月做過基準測試的模型,未必就是九月為你的請求提供服務的模型。

開放權重是否表示你可以自行託管其中任一個?

以 Xiaomi MiMo-V2.6-Pro 而言,原則上可以:MIT 授權,不需要商業協議。但實務上,一個 1.02T 參數、42B 活躍參數的檢查點需要多節點服務叢集,這與呼叫 API 是不同量級的投入。公開權重讓自行架設成為合法行為,但不代表便宜。

對於 Qwen3.8-Max 而言,答案比其名聲所暗示的來得狹隘。開源版本僅支援文字,且沒有完整的上下文視窗,因此自行託管它,得到的會是比 45 所測量版本實質上小得多的模型。如果你想要的是經過基準測試的配置,那麼提供服務的端點就是產品,而該端點是專有的。

呼叫任一個,以及決定它的運算

在 Artificial Analysis 的統計中,這兩款模型都只由單一 API 供應商提供,這對兩款旗艦模型而言並不尋常,也使得容錯移轉成為實際必須面對的問題,而非可有可無的附加選項。Qwen3.8-Max 在 OrcaRouter 上是以 qwen/qwen3.8-max 提供 —— 一個與 OpenAI 相容的端點,採用阿里巴巴自家的定價,零加成,因此上方的 $2.00 與 $6.00 會原樣傳遞,而阿里巴巴那一側一旦調整價格,我們這一側當天就會同步生效。我們自己的實測顯示,該端點的 p50 約為 3.3 秒,這才是規劃時應該依據的數字,而不是理論上的最佳情況;而備援鏈機制意味著,停滯的請求會在回應開始之前改重試到另一個上游。Xiaomi MiMo-V2.6-Pro 並未上架 OrcaRouter;小米沒有任何模型上架,目前要取用它的途徑是小米自家的平台,以及收錄它的第三方目錄。

成本算術才是這場對決真正分出勝負的地方,而且它不是表面費率所暗示的那種算術。在 7:2:1 的快取命中/輸入/輸出混合比例下,混合費率是每百萬 $0.18 與 $1.18——6.6 倍的差距,比 4.6 倍的輸入與 6.9 倍的輸出差距更大,因為小米的 99% 快取折扣比阿里巴巴的 88% 更深。Artificial Analysis 也記錄了 Xiaomi MiMo-V2.6-Pro 每項 Intelligence Index 任務的成本為 $0.13,對排行榜上每個模型都以相同方式測量。把相同工作負載跑過兩者,較便宜的模型反而是得分較高者,這是罕見得能寫下的事,也是這個比較並非走形式的原因。

The OrcaRouter model page for qwen/qwen3.8-max, showing the model's vendor, capability tags, context window and the per-million-token input and output rates passed through from Alibaba's list price.

誰應該切換,誰不應該

如果你今天用的是 Qwen3.8-Max,而且運作良好,那就沒有急迫的理由要搬遷。索引差距只是其中一點,視覺與長脈絡行為已在你的工作負載中獲得驗證,而且阿里巴巴仍在持續開發這條產品線——0902 更新正說明了這一點。搬遷的理由在於吞吐量與混合成本,而唯有當你的流量以輸出為主或屬於長時程作業時,這個理由才夠強烈:代理、程式碼生成,以及任何寫入遠多於讀取的應用。

如果你從零開始,根據已公開的證據,這個排序很難反駁。Xiaomi 模型更快、在各個面向都更便宜、採用 MIT 授權,而且在唯一一個獨立執行、同時涵蓋兩者的綜合評比中略微領先。反向考量是真實且具體的:僅有三天的正式環境歷史、單一的服務路徑,以及沒有公開的基準測試條目可供檢視。這樣的組合支持把它放在既有方案旁邊的軌道中評估,而不是取代既有方案——這正是路由配置的用途,也是為什麼有用的做法,是把候選方案與既有方案放在同一個金鑰後面,而不是從計分板上挑出贏家。

The Artificial Analysis model page showing the Intelligence Index v4.3.2 scores, output speed, latency and per-task cost that both models in this comparison are measured on.

什麼會改變這個答案?

三件事。為 Xiaomi MiMo-V2.6-Pro 增加第二與第三家供應商,將消除對它唯一還存在的結構性異議,並讓價格差距成為一項需要實際定奪的抉擇,而不只是誘人的選項。對 DeepSWE 配置進行一次獨立運行,要麼證實 72.57,要麼讓它退場,而無論哪種結果,都比這個數字本身更有價值。而 v4.3.2 上的逐項評估細分,將顯示每個模型在十項評估中分別贏得哪些——綜合分數就是綜合分數,一個在代理式編碼上領先的模型,和一個在檢索密集型問答上領先的模型,可能得到相同的指數分數,卻不適合彼此的工作。