OrcaRouter 模型雷達主視覺卡片,標題為「MiMo-V2.6-Flash 對決 Qwen 3.8」,副標為「一邊是下載,一邊是計量收費,而只有一方握有第三方評分」,左側面板為 MiMo-V2.6-Flash,顯示 309B 總參數 / 15B 活躍參數、MIT 授權、開放取用(ungated)以及「無獨立評分」,右側面板為 Qwen3.8-Max,顯示 2.4T 總參數 / 95B 活躍參數、每 1M 為 $2.00 輸入 / $6.00 輸出,以及 AA Index 45、目前規模,下方三個徽章分別寫著 Flash:2026 年 9 月 21 日發佈、Qwen:自 2026 年 8 月 3 日起計量收費,以及 Routable:僅限 Qwen3.8-Max。
Guides & Insights

MiMo-V2.6-Flash 對上 Qwen3.8-Max:一場「下載」對「計量器」的較量,而只有其中一個有分數

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

有一個數字決定了這類比較通常會怎麼寫,而它並不是基準測試。Qwen3.8-Max是一款由 Artificial Analysis 持續測量的託管模型,因此在重新校準的 v4.3 量表上,它目前的智慧指數為 45,輸出速度為每秒 39.2 個 token,定價為每百萬輸入 token 2.00 美元、每百萬輸出 token 6.00 美元。MiMo-V2.6-Flash則是小米於 2026 年 9 月 21 日以可下載權重形式發布的模型,上述這些它一概沒有:沒有供應商價目表、沒有小米公布過的模型識別碼,也完全沒有 Artificial Analysis 頁面。所有關於 MiMo-V2.6-Flash 能力的公開資訊,都來自小米自家模型卡中的評測表格。沒有任何一個數字是由非小米員工重新跑過驗證的。

這種不對稱並不是模型的缺點。它是關於這兩者各自屬於哪一種購買行為的事實,而且會改變你從正面對決中實際能得出的結論。本文其餘部分要談的是你真正能比較的三件事——宣稱的形態、每個 token 的成本,以及授權條款——再加上一個真實、經獨立測量,且不屬於標題中任一模型的數字。

首先,是哪個 Qwen 3.8,又是哪個 MiMo?

那個標題裡的兩個名字都是假裝成檢查點的家族,而那些替換並非無害。

• Qwen3.8-Max — 阿里巴巴的託管旗艦模型,於 2026 年 8 月 3 日亮相。這是一款擁有 2.4 兆參數的稀疏混合專家模型,每個 token 約啟用 950 億個參數,具備 100 萬 token 的上下文,並支援文字、圖像與影片輸入。本文後續內容即以此模型作為對手。

• Qwen3.8-Max (0902) — 同一款模型於 9 月 2 日取得的日期化快照,以獨立項目形式提供,維持相同的 $2.00 與 $6.00 定價,以及 131,072 個 token 的輸出上限。Artificial Analysis 目前的頁面就是針對這個版本,這在你引用某個指數分數時格外重要。

• Qwen3.8-2.4T-A95B — 同一核心的開放權重檢查點,自 2026 年 8 月 12 日起可依 Qwen3.8-Max 授權條款下載。它僅支援文字,思考功能一律開啟,且原生上下文為 262K,而非一百萬。它不是標題中的那個模型。

• MiMo-V2.6-Flash — Xiaomi 的 309B 總參數、15B 活躍參數的稀疏混合專家檢查點,在 Hugging Face 上以 MIT 授權無限制開放,原生全模態,並宣稱具備 1M token 上下文。它是一次包含兩個檢查點的發佈中的效率成員,其旗艦為 MiMo-V2.6-Pro,總參數 1.02T、活躍參數 42B。

• MiMo-V2-Flash — 2025 年 12 月的模型。總量同為 309B,啟用量同為 15B,滑動視窗同為 128 個 token。不同的訓練執行、不同的基準測試表,以及 256K 上下文。任何將「MiMo-V2-Flash」與 Qwen 模型進行排名的頁面,都是在比較錯誤的世代,而單看規格表並不會告訴你這件事。

MiMo 的碰撞是兩個陷阱中較為犀利的那個,因為用來辨識該模型的數字,恰好也是 2025 與 2026 檢查點之間完全相同的數字。Qwen 的碰撞較為溫和,但附帶代價:開放的 2.4T 權重與託管 API 是不同的產物,適用不同的條款,而將兩者互換的比較,會在能力與授權兩方面都弄錯。

索引已重建,而大多數頁面仍印著的那個號碼卻消失了

以下是任何分數出現之前應留意的失效模式。

Artificial Analysis 於 2026 年 9 月 7 日將其 Intelligence Index 重新校準至 v4.3。該日期之前的分數與之後的分數無法互相比較,而 Qwen3.8-Max 的即時頁面帶有一個 已更新標記,表示結果經過重述。廣為流傳的 Qwen3.8-Max 58 分屬於舊量表。目前的 Qwen3.8-Max (0902) 為 45 分,在 Artificial Analysis 歸入該類別的 202 個模型中排名第 19。

這不是吹毛求疵。58 緊挨著 46,讀起來就是十二分的差距。同樣這兩個模型,放在同一個現行量表上,只相差一分——而且 46 甚至不是本文要談的模型:

• Qwen3.8-Max(0902),經獨立測量 —— 在 v4.3 上的 Intelligence Index 為 45。輸出速度為每秒 39.2 個 token,在 202 個中排名第 151,而該頁面本身亦指出這算是緩慢。每項 Intelligence Index 任務的成本為 $5.41。完成該指數所產生的輸出 token 數:190M。

• MiMo-V2.6-Pro,經獨立測量 — Intelligence Index 為 46,在開放權重類別的 114 個模型中排名第一。輸出速度為每秒 134.3 個 Token。每個 Intelligence Index 任務的成本為 $0.13。完成該指數所需的輸出 Token 數:140M。

• MiMo-V2.6-Flash,才是真正的主題——不存在 Artificial Analysis 頁面。沒有可引用的內容。

把這三份放在一起讀,誠實的總結對兩家廠商來說都不太舒服。大家都想要的那個比較基準——在中立尺度上讓 Flash 對上 Qwen3.8-Max——並不存在,也無法從廠商提供的表格中拼湊出來,因為兩家廠商在不同的時間、用不同的檢查點、跑了不同的測試框架,然後又拿自己去跟他們同樣跑過的其他公司模型相比。更大的真正存在的,是旗艦版 Qwen 與小米那個更大的檢查點之間那一分的差距,而每項索引任務的成本大約只有四十分之一。這是這場對決中最有意思的真實數字,而它講的是一個標題兩邊都沒點名的模型。

Scoreboard card headed 'MiMo-V2.6-Flash vs Qwen3.8-Max', with paired rows for parameters (309B total / 15B active against 2.4T total / 95B active), licence (MIT, ungated, no revenue trigger, against a hosted API whose open 2.4T sibling uses the Qwen3.8-Max License), price per 1M (no vendor rate card against $2.00 in and $6.00 out with an 88% cache discount), independent score (None published, no Artificial Analysis page, against AA Index 45 on the v4.3 scale, 19th of 202 in class), DeepSWE v1.1 (67.9 on Xiaomi's own harness against Not published) and routability (No - nowhere, including OrcaRouter, against Yes - on OrcaRouter, base tier and the 0902 snapshot).

廠商表格會告訴你什麼、又不會告訴你什麼

兩家廠商都會公布數字。它們並不是同一種數字,把兩者逐欄並排比較,得到的是一張圖表,而不是一項發現——不過這些宣稱的形態仍然值得一讀,因為它會告訴你每一間實驗室各自優化了什麼。

• 程式碼代理——小米回報 MiMo-V2.6-Flash 在 DeepSWE v1.1 為 67.9、Terminal Bench 2.1 為 87.6、ProgramBench 為 26.0,以及 MiMo Code Bench 為 61.2。阿里巴巴回報 Qwen3.8-Max 在 SWE-bench Pro 為 67.7、Terminal-Bench 2.1 為 86.6。Terminal-Bench 的數字相當接近,因此決定名次先後的合理來說是測試框架,而非模型本身。

• 通用代理 — 小米為 Flash 回報 AutomationBench v1.0.6 52.3、Toolathlon-Verified 73.6、OSWorld-Verified 80.8,以及 Agents' Last Exam 27.6。阿里巴巴為 Qwen3.8-Max 回報 OSWorld-Verified 86.1、WideSearch 81.9,以及 Agent's Last Exam 52.4。在兩家實驗室都跑過的這兩項基準上,Qwen 回報的數字較為領先——而且是在阿里巴巴自家的測試框架上。

• 知識與安全——小米進行了 CyberGym(Flash 95.1)、MiMo Cyber Bench(77.2)、ExploitGym(6.0)、ExploitBench(25.3)和 SEC Bench Pro(47.5)。阿里巴巴進行了 GPQA Diamond(92.6)、Humanity's Last Exam(43.6)和 PaperBench(93.0)。兩者幾乎沒有重疊,因此幾乎無從比較。

廠商表格唯一真正能展現的有用之處,就是內部不一致,而 Xiaomi 的表格正有這樣一處。其公開的 RL 儀表板在九月期間直播了整段訓練過程,公布 MiMo-V2.6-Flash 為 65.68,在 DeepSWE v1.1 上使用 mini-swe-agent 測試框架、採三次平均。完成的模型卡列出 67.9,對應已發布的權重。那兩個數字分別描述的是訓練快照與已發布成品,而這兩分的差距,與 Xiaomi 兩個檢查點之間的差距一樣大。如果你自上週以來一直引用儀表板上的數字,那它已經過時了。

帳單,這正是這兩款模型不再能相提並論的地方。

這是決定部署的環節,而且差距並不接近。

• Qwen3.8-Max 採計量收費。在 Alibaba 的國際版價目表上,每百萬輸入 token 為 2.00 美元,每百萬輸出 token 為 6.00 美元,而 Artificial Analysis 測得的快取折扣為 88%,每項 Intelligence Index 任務的成本為 5.41 美元。Alibaba 中國地區的文件則列出相同兩項為每百萬人民幣 12 元與 36 元。你今天下午就能呼叫它,並拿到帳單。

• MiMo-V2.6-Flash 是一個下載項目。小米未在其自家網站上公布 MiMo-V2.6 世代的每 token 費率,也未宣布這兩個 checkpoint 的可呼叫識別碼,因此沒有可供計量的項目。取而代之的是橫跨 65 個分片的 172.9 GB FP8 權重資料(尚未計入 1M token 上下文的 KV cache),以及一個部署章節,建議以張量平行 16 搭配資料平行因子 2 來使用 SGLang,或採用張量平行 8 的 vLLM 配方——這是一項多節點服務作業。

• 第三方上架資訊不是價目表。目錄頁面確實載有 MiMo-V2.6 系列的數字,而 Artificial Analysis 只計入一家 API 供應商,該供應商以每百萬 $0.435 和 $0.87 的價格提供 MiMo-V2.6-Pro。那是供應商為較大檢查點所列的價格,不是 Xiaomi 的定價,而且 Flash 根本沒有這樣的刊登資訊。

所以這筆帳是相對於一項資本決策的按量計費項目。在每月數億個 token 的規模下,Qwen3.8-Max 是一筆可以預測的帳單,而 Flash 則是你會買來服務一個小米以外沒人測量過的模型的節點。在每月數十億個 token 的規模下,開源路線開始在成本上勝出,而這正是授權不再只是法律註腳、而成為採購考量因素的時刻。

這些授權並非相同的許可。

MIT 幾乎是開放權重中最寬鬆的授權。Qwen3.8-Max 授權並非 MIT,而這當中的差異可不是鬧著玩的。

MiMo-V2.6-Flash 以 MIT 授權條款發布,沒有營收門檻、沒有使用者人數觸發條件、沒有另行簽訂的商業協議,也沒有研究條款。商業部署、修改、再散布與進一步訓練皆獲允許,且該儲存庫不設任何存取限制。

Qwen3.8-Max 授權條款授予使用、修改、散布、再授權、銷售、部署、代管與微調的權利,但附帶兩項條件。任何產品或服務,若月活躍使用者超過一億人,或每月營收超過二千萬美元,必須在其介面上顯著標示模型名稱。此外,凡屬模型即服務或 AI 工作助理的業務,若在任何連續十二個月內的總營收超過五千萬美元,則在商業使用前須另向 Alibaba 取得授權。內部使用則屬豁免情形,惟前提是該模型或其能力不得暴露給第三方。

對大多數團隊而言,這兩項條件都不具約束力。對一個成功的平台事業來說,其中一項卻會——而且它產生約束力的時刻,正是在模型已成為關鍵支柱的那一刻。另請注意,這些條件附屬於可下載的 2.4T 權重,而不是託管 API;在託管 API 的情況下,適用的是供應商條款。這兩條路徑背負著不同的義務,這也是為什麼不該把開放檢查點與託管版本拿來相比,彷彿它們是同一個產品。

OrcaRouter 適合的地方,以及不適合的地方

Qwen3.8-Max 可在 OrcaRouter 上路由,基礎項目與標註日期的 0902 快照皆支援,只需一組 API key,即可按供應商牌價、0% 加價直接轉嫁。這點在此處特別重要,原因有兩個。首先,0902 版本是獨立項目,而非悄然取代,因此路由 DSL 可將對可重現性敏感的流量固定到標註日期的快照,而其他一切則依循基礎層級——無需第二套整合、無需變更程式碼。其次,由於牌價是直接轉嫁而非加價,Alibaba 價目表的變動會在同一天反映到你這邊,而不是等到下一次合約續約;這正是讓上述按計量與按節點的計算在價格變動時保持誠實的原因。快取密集型工作負載也能保留供應商的快取折扣,而不會讓其中一部分被經銷商利潤吃掉。

Screenshot of the OrcaRouter model page for Qwen3.8 Max, marked FEATURED, giving the model id qwen/qwen3.8-max, a 1M-token context, text, image and video input with text output, an input price of $2.00 and output price of $6.00 per 1M tokens, a p50 time to first token of 3.33 seconds, and seven-day traffic of 30.8M tokens.

MiMo-V2.6-Flash 在任何地方都無法路由,包括我們在內。我們不為任何小米模型提供路由,而小米自家卡片中的可用性說明指向小米自家的管道:MiMo API 平台、AI Studio、MiMo Code 以及桌面應用程式。如果你想要這個檢查點,你得下載 172.9 GB,還得自己找節點。

Screenshot of the Artificial Analysis model page for Qwen3.8 Max (0902), showing an Intelligence Index of 45 on the updated v4.3 scale ranked 19th of 202, output speed of 39.2 tokens per second ranked 151st of 202, a price of $2.00 per million input tokens and $6.00 per million output with an 88% cache discount and a $5.41 cost per Intelligence Index task, 190M output tokens generated on the index, and a 984k-token context window.

哪一個,以及何時?

如果想要不靠硬體就能取得的能力、如果你的用量還不確定,或者你想在正式投入前先有個獨立數字可參考,那就選 Qwen3.8-Max。同時要接受:在目前指數上,45 分屬於前緣中段的位置,而非頂尖;每秒 39.2 個 token 慢到在代理迴圈裡足以造成影響;而跑完 Intelligence Index 需要 1.9 億個輸出 token,大約是中位數的兩倍——在按輸出計價的那一端,冗長是要花錢的。

如果限制條件是授權條款、資料路徑,或是你能攤提的長期帳單——而且你手上有節點——那就選 MiMo-V2.6-Flash。沒有營收門檻的 MIT 條款,與帶有 MAU 門檻和營收分潤觸發條件的授權,確實是不同的許可;對一家預期會做大的公司來說,這正是選擇它的理由。為多節點服務編列預算,依據已發布的權重資料而非儲存庫頁面來估算規模,並把小米模型卡上的每個數字都當成廠商自行提報值,直到實驗室外部有人重新跑過驗證為止。

如果你是在今天、而不是下一季做決定,就先跑按用量計費的方案。用一個月的 Qwen3.8-Max,能告訴你你的工作負載實際上需要什麼。而一台節點,只會告訴你你原本希望它需要什麼。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新