
MiMo-V2.6-Pro 對比 Qwen3.8-Max:一個指數點,六倍價格
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen3.8-Max 是一個擁有 2.4 兆參數的模型,每個 token 會啟用其中 950 億個參數,且僅由單一供應商運行。Xiaomi MiMo-V2.6-Pro 是一個擁有 1.02 兆參數的模型,每個 token 啟用 420 億個參數,在同一項獨立指數上得分高出一分,而呼叫成本約只有六分之一。這些事實擺在一起顯得格格不入,而你要如何調和它們,正是這兩者之間抉擇的全部關鍵。長話短說:在 Artificial Analysis Intelligence Index v4.3.2 上,Xiaomi MiMo-V2.6-Pro 得分 46,Qwen3.8-Max 得分 45——在雜訊範圍內難分高下——而價目表顯示每百萬 token 分別為 0.43 美元與 0.87 美元,對比 2.00 美元與 6.00 美元。
每個模型實際上是什麼
Qwen3.8-Max 是阿里巴巴的旗艦模型,自 2026 年 8 月 3 日起全面推出,而在它問世時,是 Qwen 系列歷來所發布過最大的模型。它是一種稀疏專家混合(MoE)模型,建構於 Qwen 3.5 架構之上,總參數達 2.4 兆,每個 token 約有 950 億個活躍參數,具備 100 萬 token 的上下文視窗、最高 131,000 token 的輸出,以及涵蓋文字、圖像與影片的多模態輸入。阿里巴巴將國際費率調降至每百萬輸入 token 2.00 美元、每百萬輸出 token 6.00 美元,快取輸入為 0.25 美元,並宣稱這大約是 Claude Opus 5 輸入價格的 40%。隨後於 2026 年 9 月 2 日推出了一次小版本更新 Qwen3.8-Max-0902,而 Artificial Analysis 目前對其的基準測試分數為 45。
Xiaomi MiMo-V2.6-Pro 於 2026 年 9 月 22 日正式全面推出,也就是本文比較撰寫前的三天,其強化學習檢查點儲存庫則在前一天上線。它是稀疏混合專家模型,總參數達 1.02 兆,每個 token 啟用 420 億個參數,並具備同樣的 100 萬 token 上下文視窗、涵蓋文字、圖像、影片與音訊的原生多模態能力,權重以 MIT 授權條款發布。Xiaomi 維持上一代的定價,而非將新檢查點的價格向上調整,因此其標價為 $0.43 與 $0.87,並有 99% 快取折扣,混合價為 $0.18。
• 每個 token 的啟用運算量 —— Qwen3.8-Max 95B;Xiaomi MiMo-V2.6-Pro 42B,不到一半
• 總參數量 — Qwen3.8-Max 2.4T;Xiaomi MiMo-V2.6-Pro 1.02T
• 指數分數 — Xiaomi MiMo-V2.6-Pro 46;Qwen3.8-Max 45,兩者皆採用 Artificial Analysis v4.3.2
• 輸出速度 — Xiaomi MiMo-V2.6-Pro 134.3 tokens/秒;Qwen3.8-Max 39.2,同級中位數為 72.5
• 首個 token 耗時——Xiaomi MiMo-V2.6-Pro 2.15 秒;Qwen3.8-Max 2.93
• 定價 — Xiaomi MiMo-V2.6-Pro 每 1M $0.43 / $0.87;Qwen3.8-Max $2.00 / $6.00
• 混合費率 — Xiaomi MiMo-V2.6-Pro 每 100 萬 0.18 美元,快取命中/輸入/輸出為 7:2:1;Qwen3.8-Max 1.18 美元
• 權重 — Xiaomi MiMo-V2.6-Pro 以 MIT 授權且可下載;Qwen3.8-Max 則以專有端點形式提供,另附一款純文字開放權重版本,捨棄了 1M 上下文與視覺輸入
• 可及性 — 在 Artificial Analysis 上,每個各計為一個 API 供應商
比分是平手。速度則不然。
在一個十項評估的綜合分數上,一分之差不是任何人應該據以行動的差異,而更有用的訊號是它背後發生了什麼事。每個 token 啟用參數不到一半的模型得分略高,生成輸出速度快了三倍半——每秒 134.3 個 token,相對於 39.2,而同類推理模型的中位數是 72.5。Qwen3.8-Max 是該頁面上所測量的前沿級模型中最慢的,而這是每個 token 啟用 950 億參數的設計後果,而非服務上的意外。
延遲所揭示的故事,與參數數量所暗示的恰好相反。Qwen3.8-Max 抵達首個 token 耗時 2.93 秒,Xiaomi 則為 2.15 秒,而這個差距遠小於吞吐量差距——Qwen3.8-Max 是一旦開始輸出就慢,而不是起步慢。對於答案簡短的聊天介面,這種差異幾乎不會浮現。但對於會產生數萬個輸出 token 的代理迴圈,吞吐量就決定了整體的牆鐘時間,而 3.4 倍的差距會在這次執行的每一回合中不斷累積。

供應商表格在哪些地方不一致,以及為何那並非矛盾
阿里巴巴為 Qwen3.8-Max 公布了一張涵蓋範圍廣泛的成績表,而它確實很強:Terminal-Bench 2.1 為 86.6,SWE-bench Pro 為 67.7,PaperBench 為 93.0,GPQA Diamond 為 92.6,IFBench 為 82.8,OSWorld-Verified 為 86.1,Humanity's Last Exam 則為 43.6。這些是廠商在自家測試框架上跑出的數字,其中有些還是在阿里巴巴自家的評測基準上取得的,因此它們是宣稱而非實測——但這些宣稱是建立在廣為使用的評測基準之上,這使得它們在跨實驗室比較時,比某套量身打造的測試框架結果更具可比性。
小米的頭條數字是 DeepSWE v1.1 上的 72.57,高於 58.4 的基線,使用 mini-swe-agent 以三次平均、在小米自家的評分器上測得,該強化學習訓練由小米記錄為三十步、約 750,000 條軌跡,公布花費約 262 萬美元。它尚未提交到公開的 DeepSWE 排行榜,也沒有第三方重現過。把 72.57 拿來對比 Qwen 在 SWE-bench Pro 的 67.7,並宣稱小米以五分勝出,會是跨兩套不同基準、兩套不同測試框架和兩套不同評分慣例來解讀。恰好有一把尺規,是這兩個模型都由其製造者以外的人拿來對照過的,而它顯示 46 比 45。
Qwen3.8-Max 有兩個更關鍵的數字,根本就不是分數。阿里巴巴宣布權重會與 Qwen3.8-27B 一同開源,而實際落地的檢查點是純文字的,並不具備已上線服務的 Max 端點所擁有的完整 100 萬 token 上下文或視覺輸入。因此,「Qwen3.8-Max 是開放權重」和「Qwen3.8-Max 是多模態的 100 萬上下文端點」這兩種說法,都是關於不同產物的真確陳述;若部署計畫建立在第一種之上,卻期待第二種,一碰上現實就撐不下去。與此同時,0902 點版本在版本號未變的情況下,把模型推上某個公開網頁開發競技場的榜首——這提醒我們,你八月做過基準測試的模型,未必就是九月為你的請求提供服務的模型。
開放權重是否表示你可以自行託管其中任一個?
以 Xiaomi MiMo-V2.6-Pro 而言,原則上可以:MIT 授權,不需要商業協議。但實務上,一個 1.02T 參數、42B 活躍參數的檢查點需要多節點服務叢集,這與呼叫 API 是不同量級的投入。公開權重讓自行架設成為合法行為,但不代表便宜。
對於 Qwen3.8-Max 而言,答案比其名聲所暗示的來得狹隘。開源版本僅支援文字,且沒有完整的上下文視窗,因此自行託管它,得到的會是比 45 所測量版本實質上小得多的模型。如果你想要的是經過基準測試的配置,那麼提供服務的端點就是產品,而該端點是專有的。
呼叫任一個,以及決定它的運算
在 Artificial Analysis 的統計中,這兩款模型都只由單一 API 供應商提供,這對兩款旗艦模型而言並不尋常,也使得容錯移轉成為實際必須面對的問題,而非可有可無的附加選項。Qwen3.8-Max 在 OrcaRouter 上是以 qwen/qwen3.8-max 提供 —— 一個與 OpenAI 相容的端點,採用阿里巴巴自家的定價,零加成,因此上方的 $2.00 與 $6.00 會原樣傳遞,而阿里巴巴那一側一旦調整價格,我們這一側當天就會同步生效。我們自己的實測顯示,該端點的 p50 約為 3.3 秒,這才是規劃時應該依據的數字,而不是理論上的最佳情況;而備援鏈機制意味著,停滯的請求會在回應開始之前改重試到另一個上游。Xiaomi MiMo-V2.6-Pro 並未上架 OrcaRouter;小米沒有任何模型上架,目前要取用它的途徑是小米自家的平台,以及收錄它的第三方目錄。
成本算術才是這場對決真正分出勝負的地方,而且它不是表面費率所暗示的那種算術。在 7:2:1 的快取命中/輸入/輸出混合比例下,混合費率是每百萬 $0.18 與 $1.18——6.6 倍的差距,比 4.6 倍的輸入與 6.9 倍的輸出差距更大,因為小米的 99% 快取折扣比阿里巴巴的 88% 更深。Artificial Analysis 也記錄了 Xiaomi MiMo-V2.6-Pro 每項 Intelligence Index 任務的成本為 $0.13,對排行榜上每個模型都以相同方式測量。把相同工作負載跑過兩者,較便宜的模型反而是得分較高者,這是罕見得能寫下的事,也是這個比較並非走形式的原因。

誰應該切換,誰不應該
如果你今天用的是 Qwen3.8-Max,而且運作良好,那就沒有急迫的理由要搬遷。索引差距只是其中一點,視覺與長脈絡行為已在你的工作負載中獲得驗證,而且阿里巴巴仍在持續開發這條產品線——0902 更新正說明了這一點。搬遷的理由在於吞吐量與混合成本,而唯有當你的流量以輸出為主或屬於長時程作業時,這個理由才夠強烈:代理、程式碼生成,以及任何寫入遠多於讀取的應用。
如果你從零開始,根據已公開的證據,這個排序很難反駁。Xiaomi 模型更快、在各個面向都更便宜、採用 MIT 授權,而且在唯一一個獨立執行、同時涵蓋兩者的綜合評比中略微領先。反向考量是真實且具體的:僅有三天的正式環境歷史、單一的服務路徑,以及沒有公開的基準測試條目可供檢視。這樣的組合支持把它放在既有方案旁邊的軌道中評估,而不是取代既有方案——這正是路由配置的用途,也是為什麼有用的做法,是把候選方案與既有方案放在同一個金鑰後面,而不是從計分板上挑出贏家。

什麼會改變這個答案?
三件事。為 Xiaomi MiMo-V2.6-Pro 增加第二與第三家供應商,將消除對它唯一還存在的結構性異議,並讓價格差距成為一項需要實際定奪的抉擇,而不只是誘人的選項。對 DeepSWE 配置進行一次獨立運行,要麼證實 72.57,要麼讓它退場,而無論哪種結果,都比這個數字本身更有價值。而 v4.3.2 上的逐項評估細分,將顯示每個模型在十項評估中分別贏得哪些——綜合分數就是綜合分數,一個在代理式編碼上領先的模型,和一個在檢索密集型問答上領先的模型,可能得到相同的指數分數,卻不適合彼此的工作。
