
MiMo-V2.6-Flash 對上 Qwen3.8-Max:一場「下載」對「計量器」的較量,而只有其中一個有分數
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
有一個數字決定了這類比較通常會怎麼寫,而它並不是基準測試。Qwen3.8-Max是一款由 Artificial Analysis 持續測量的託管模型,因此在重新校準的 v4.3 量表上,它目前的智慧指數為 45,輸出速度為每秒 39.2 個 token,定價為每百萬輸入 token 2.00 美元、每百萬輸出 token 6.00 美元。MiMo-V2.6-Flash則是小米於 2026 年 9 月 21 日以可下載權重形式發布的模型,上述這些它一概沒有:沒有供應商價目表、沒有小米公布過的模型識別碼,也完全沒有 Artificial Analysis 頁面。所有關於 MiMo-V2.6-Flash 能力的公開資訊,都來自小米自家模型卡中的評測表格。沒有任何一個數字是由非小米員工重新跑過驗證的。
這種不對稱並不是模型的缺點。它是關於這兩者各自屬於哪一種購買行為的事實,而且會改變你從正面對決中實際能得出的結論。本文其餘部分要談的是你真正能比較的三件事——宣稱的形態、每個 token 的成本,以及授權條款——再加上一個真實、經獨立測量,且不屬於標題中任一模型的數字。
首先,是哪個 Qwen 3.8,又是哪個 MiMo?
那個標題裡的兩個名字都是假裝成檢查點的家族,而那些替換並非無害。
• Qwen3.8-Max — 阿里巴巴的託管旗艦模型,於 2026 年 8 月 3 日亮相。這是一款擁有 2.4 兆參數的稀疏混合專家模型,每個 token 約啟用 950 億個參數,具備 100 萬 token 的上下文,並支援文字、圖像與影片輸入。本文後續內容即以此模型作為對手。
• Qwen3.8-Max (0902) — 同一款模型於 9 月 2 日取得的日期化快照,以獨立項目形式提供,維持相同的 $2.00 與 $6.00 定價,以及 131,072 個 token 的輸出上限。Artificial Analysis 目前的頁面就是針對這個版本,這在你引用某個指數分數時格外重要。
• Qwen3.8-2.4T-A95B — 同一核心的開放權重檢查點,自 2026 年 8 月 12 日起可依 Qwen3.8-Max 授權條款下載。它僅支援文字,思考功能一律開啟,且原生上下文為 262K,而非一百萬。它不是標題中的那個模型。
• MiMo-V2.6-Flash — Xiaomi 的 309B 總參數、15B 活躍參數的稀疏混合專家檢查點,在 Hugging Face 上以 MIT 授權無限制開放,原生全模態,並宣稱具備 1M token 上下文。它是一次包含兩個檢查點的發佈中的效率成員,其旗艦為 MiMo-V2.6-Pro,總參數 1.02T、活躍參數 42B。
• MiMo-V2-Flash — 2025 年 12 月的模型。總量同為 309B,啟用量同為 15B,滑動視窗同為 128 個 token。不同的訓練執行、不同的基準測試表,以及 256K 上下文。任何將「MiMo-V2-Flash」與 Qwen 模型進行排名的頁面,都是在比較錯誤的世代,而單看規格表並不會告訴你這件事。
MiMo 的碰撞是兩個陷阱中較為犀利的那個,因為用來辨識該模型的數字,恰好也是 2025 與 2026 檢查點之間完全相同的數字。Qwen 的碰撞較為溫和,但附帶代價:開放的 2.4T 權重與託管 API 是不同的產物,適用不同的條款,而將兩者互換的比較,會在能力與授權兩方面都弄錯。
索引已重建,而大多數頁面仍印著的那個號碼卻消失了
以下是任何分數出現之前應留意的失效模式。
Artificial Analysis 於 2026 年 9 月 7 日將其 Intelligence Index 重新校準至 v4.3。該日期之前的分數與之後的分數無法互相比較,而 Qwen3.8-Max 的即時頁面帶有一個 已更新標記,表示結果經過重述。廣為流傳的 Qwen3.8-Max 58 分屬於舊量表。目前的 Qwen3.8-Max (0902) 為 45 分,在 Artificial Analysis 歸入該類別的 202 個模型中排名第 19。
這不是吹毛求疵。58 緊挨著 46,讀起來就是十二分的差距。同樣這兩個模型,放在同一個現行量表上,只相差一分——而且 46 甚至不是本文要談的模型:
• Qwen3.8-Max(0902),經獨立測量 —— 在 v4.3 上的 Intelligence Index 為 45。輸出速度為每秒 39.2 個 token,在 202 個中排名第 151,而該頁面本身亦指出這算是緩慢。每項 Intelligence Index 任務的成本為 $5.41。完成該指數所產生的輸出 token 數:190M。
• MiMo-V2.6-Pro,經獨立測量 — Intelligence Index 為 46,在開放權重類別的 114 個模型中排名第一。輸出速度為每秒 134.3 個 Token。每個 Intelligence Index 任務的成本為 $0.13。完成該指數所需的輸出 Token 數:140M。
• MiMo-V2.6-Flash,才是真正的主題——不存在 Artificial Analysis 頁面。沒有可引用的內容。
把這三份放在一起讀,誠實的總結對兩家廠商來說都不太舒服。大家都想要的那個比較基準——在中立尺度上讓 Flash 對上 Qwen3.8-Max——並不存在,也無法從廠商提供的表格中拼湊出來,因為兩家廠商在不同的時間、用不同的檢查點、跑了不同的測試框架,然後又拿自己去跟他們同樣跑過的其他公司模型相比。更大的真正存在的,是旗艦版 Qwen 與小米那個更大的檢查點之間那一分的差距,而每項索引任務的成本大約只有四十分之一。這是這場對決中最有意思的真實數字,而它講的是一個標題兩邊都沒點名的模型。

廠商表格會告訴你什麼、又不會告訴你什麼
兩家廠商都會公布數字。它們並不是同一種數字,把兩者逐欄並排比較,得到的是一張圖表,而不是一項發現——不過這些宣稱的形態仍然值得一讀,因為它會告訴你每一間實驗室各自優化了什麼。
• 程式碼代理——小米回報 MiMo-V2.6-Flash 在 DeepSWE v1.1 為 67.9、Terminal Bench 2.1 為 87.6、ProgramBench 為 26.0,以及 MiMo Code Bench 為 61.2。阿里巴巴回報 Qwen3.8-Max 在 SWE-bench Pro 為 67.7、Terminal-Bench 2.1 為 86.6。Terminal-Bench 的數字相當接近,因此決定名次先後的合理來說是測試框架,而非模型本身。
• 通用代理 — 小米為 Flash 回報 AutomationBench v1.0.6 52.3、Toolathlon-Verified 73.6、OSWorld-Verified 80.8,以及 Agents' Last Exam 27.6。阿里巴巴為 Qwen3.8-Max 回報 OSWorld-Verified 86.1、WideSearch 81.9,以及 Agent's Last Exam 52.4。在兩家實驗室都跑過的這兩項基準上,Qwen 回報的數字較為領先——而且是在阿里巴巴自家的測試框架上。
• 知識與安全——小米進行了 CyberGym(Flash 95.1)、MiMo Cyber Bench(77.2)、ExploitGym(6.0)、ExploitBench(25.3)和 SEC Bench Pro(47.5)。阿里巴巴進行了 GPQA Diamond(92.6)、Humanity's Last Exam(43.6)和 PaperBench(93.0)。兩者幾乎沒有重疊,因此幾乎無從比較。
廠商表格唯一真正能展現的有用之處,就是內部不一致,而 Xiaomi 的表格正有這樣一處。其公開的 RL 儀表板在九月期間直播了整段訓練過程,公布 MiMo-V2.6-Flash 為 65.68,在 DeepSWE v1.1 上使用 mini-swe-agent 測試框架、採三次平均。完成的模型卡列出 67.9,對應已發布的權重。那兩個數字分別描述的是訓練快照與已發布成品,而這兩分的差距,與 Xiaomi 兩個檢查點之間的差距一樣大。如果你自上週以來一直引用儀表板上的數字,那它已經過時了。
帳單,這正是這兩款模型不再能相提並論的地方。
這是決定部署的環節,而且差距並不接近。
• Qwen3.8-Max 採計量收費。在 Alibaba 的國際版價目表上,每百萬輸入 token 為 2.00 美元,每百萬輸出 token 為 6.00 美元,而 Artificial Analysis 測得的快取折扣為 88%,每項 Intelligence Index 任務的成本為 5.41 美元。Alibaba 中國地區的文件則列出相同兩項為每百萬人民幣 12 元與 36 元。你今天下午就能呼叫它,並拿到帳單。
• MiMo-V2.6-Flash 是一個下載項目。小米未在其自家網站上公布 MiMo-V2.6 世代的每 token 費率,也未宣布這兩個 checkpoint 的可呼叫識別碼,因此沒有可供計量的項目。取而代之的是橫跨 65 個分片的 172.9 GB FP8 權重資料(尚未計入 1M token 上下文的 KV cache),以及一個部署章節,建議以張量平行 16 搭配資料平行因子 2 來使用 SGLang,或採用張量平行 8 的 vLLM 配方——這是一項多節點服務作業。
• 第三方上架資訊不是價目表。目錄頁面確實載有 MiMo-V2.6 系列的數字,而 Artificial Analysis 只計入一家 API 供應商,該供應商以每百萬 $0.435 和 $0.87 的價格提供 MiMo-V2.6-Pro。那是供應商為較大檢查點所列的價格,不是 Xiaomi 的定價,而且 Flash 根本沒有這樣的刊登資訊。
所以這筆帳是相對於一項資本決策的按量計費項目。在每月數億個 token 的規模下,Qwen3.8-Max 是一筆可以預測的帳單,而 Flash 則是你會買來服務一個小米以外沒人測量過的模型的節點。在每月數十億個 token 的規模下,開源路線開始在成本上勝出,而這正是授權不再只是法律註腳、而成為採購考量因素的時刻。
這些授權並非相同的許可。
MIT 幾乎是開放權重中最寬鬆的授權。Qwen3.8-Max 授權並非 MIT,而這當中的差異可不是鬧著玩的。
MiMo-V2.6-Flash 以 MIT 授權條款發布,沒有營收門檻、沒有使用者人數觸發條件、沒有另行簽訂的商業協議,也沒有研究條款。商業部署、修改、再散布與進一步訓練皆獲允許,且該儲存庫不設任何存取限制。
Qwen3.8-Max 授權條款授予使用、修改、散布、再授權、銷售、部署、代管與微調的權利,但附帶兩項條件。或任何產品或服務,若月活躍使用者超過一億人,或每月營收超過二千萬美元,必須在其介面上顯著標示模型名稱。此外,凡屬模型即服務或 AI 工作助理的業務,若在任何連續十二個月內的總營收超過五千萬美元,則在商業使用前須另向 Alibaba 取得授權。內部使用則屬豁免情形,惟前提是該模型或其能力不得暴露給第三方。
對大多數團隊而言,這兩項條件都不具約束力。對一個成功的平台事業來說,其中一項卻會——而且它產生約束力的時刻,正是在模型已成為關鍵支柱的那一刻。另請注意,這些條件附屬於可下載的 2.4T 權重,而不是託管 API;在託管 API 的情況下,適用的是供應商條款。這兩條路徑背負著不同的義務,這也是為什麼不該把開放檢查點與託管版本拿來相比,彷彿它們是同一個產品。
OrcaRouter 適合的地方,以及不適合的地方
Qwen3.8-Max 可在 OrcaRouter 上路由,基礎項目與標註日期的 0902 快照皆支援,只需一組 API key,即可按供應商牌價、0% 加價直接轉嫁。這點在此處特別重要,原因有兩個。首先,0902 版本是獨立項目,而非悄然取代,因此路由 DSL 可將對可重現性敏感的流量固定到標註日期的快照,而其他一切則依循基礎層級——無需第二套整合、無需變更程式碼。其次,由於牌價是直接轉嫁而非加價,Alibaba 價目表的變動會在同一天反映到你這邊,而不是等到下一次合約續約;這正是讓上述按計量與按節點的計算在價格變動時保持誠實的原因。快取密集型工作負載也能保留供應商的快取折扣,而不會讓其中一部分被經銷商利潤吃掉。

MiMo-V2.6-Flash 在任何地方都無法路由,包括我們在內。我們不為任何小米模型提供路由,而小米自家卡片中的可用性說明指向小米自家的管道:MiMo API 平台、AI Studio、MiMo Code 以及桌面應用程式。如果你想要這個檢查點,你得下載 172.9 GB,還得自己找節點。

哪一個,以及何時?
如果想要不靠硬體就能取得的能力、如果你的用量還不確定,或者你想在正式投入前先有個獨立數字可參考,那就選 Qwen3.8-Max。同時要接受:在目前指數上,45 分屬於前緣中段的位置,而非頂尖;每秒 39.2 個 token 慢到在代理迴圈裡足以造成影響;而跑完 Intelligence Index 需要 1.9 億個輸出 token,大約是中位數的兩倍——在按輸出計價的那一端,冗長是要花錢的。
如果限制條件是授權條款、資料路徑,或是你能攤提的長期帳單——而且你手上有節點——那就選 MiMo-V2.6-Flash。沒有營收門檻的 MIT 條款,與帶有 MAU 門檻和營收分潤觸發條件的授權,確實是不同的許可;對一家預期會做大的公司來說,這正是選擇它的理由。為多節點服務編列預算,依據已發布的權重資料而非儲存庫頁面來估算規模,並把小米模型卡上的每個數字都當成廠商自行提報值,直到實驗室外部有人重新跑過驗證為止。
如果你是在今天、而不是下一季做決定,就先跑按用量計費的方案。用一個月的 Qwen3.8-Max,能告訴你你的工作負載實際上需要什麼。而一台節點,只會告訴你你原本希望它需要什麼。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
