
Xiaomi MiMo-V2.6-Pro-UltraSpeed 對上 Xiaomi MiMo-V2.6:同一個檢查點,十倍的價格
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro-UltraSpeed 與 Xiaomi MiMo-V2.6-Pro 並不是兩款模型。它們是同一款模型,以兩種方式販售。兩者都由小米在 2026 年 9 月發布的同一個一兆參數 MiMo-V2.6 檢查點所提供——即 Xiaomi MiMo-V2.6 系列的 Pro 層級,而同系列中較小的成員是 Xiaomi MiMo-V2.6-Flash。這兩款 Pro 產品之間的差異,完全在於 token 產出的速度有多快,以及你為它們付多少錢。標準層級每百萬輸入 token 要價 0.435 美元,每百萬輸出 token 要價 0.87 美元。UltraSpeed 層級則要價 4.35 美元與 8.70 美元。這在計量表的兩端都是乾淨俐落的十比一,而它換來的是約十倍輸出速度的宣稱——這是小米對自家服務堆疊所做的宣稱,且目前尚無獨立基準測試公布過任何數字。
所以,真正有趣的問題並不是哪個模型比較好,而是十倍的倍數究竟是不是換取十倍速度的正當價格;而在你把正式生產路徑押上去之前,這其實有一段值得一讀的前例。
快速層級是服務決策,而非模型決策
Xiaomi 自家對 UltraSpeed 產品線的定位是:它在品質上與標準模型一致,只在吞吐量上有所不同。這點比聽起來還重要,因為它消除了面對新層級時通常會猶豫的原因。你不是在賭一個不同檢查點的個性、拒絕行為或格式怪癖。你賭的是,相同的權重透過更激進的服務設定運行後,對你的提示詞會表現出相同的行為。如果這一點成立,在兩個層級之間切換就只是設定變更,而不是移轉。
這個服務配置的內部究竟包含什麼,在這一代尚未有文件記載。先前的 UltraSpeed 層級建構於 2026 年 6 月的 MiMo-V2.5-Pro 檢查點上,小米當時將其描述為僅在專家層使用 FP4 量化、採用稱為 DFlash 的區塊平行推測解碼方案,以及稱為 TileRT 的執行環境,並在單一 8-GPU 節點上運行。小米尚未公布 V2.6 層級的對等細節。請將先前的技術堆疊視為理解速度如何達成的背景脈絡,而非目前實際運行內容的描述。
它所在的陣容很短。與兩個 Pro 等級並列的還有 MiMo-V2.6-Flash,這是較小的兄弟版本,總參數為 3,090 億、活躍參數為 150 億。Pro 是稀疏混合專家旗艦:Artificial Analysis 將其列為總參數 1.0 兆、每個 token 活躍參數 420 億、上下文視窗達 100 萬 token,並採用 MIT 授權,權重發佈於 Hugging Face。這些就是必須記住的數字,因為整個比較都建立在它們之上。
什麼是實際上已驗證的,而什麼不是

上方這兩欄之間的不對稱,是本文中最重要的一件事。關於這組配對,幾乎所有可測量的項目,都已在慢的那一側
Artificial Analysis 已對 MiMo-V2.6-Pro 進行基準測試,並為其公布 46 的智慧指數——在它將該模型歸入的 114 個模型類別中拿下最高分。透過 Xiaomi 的 API 測得每秒 134.3 個輸出 token,類別中位數為 77.9;首個 chunk 時間為 2.15 秒,中位數為 2.34 秒。它列出每項智慧指數任務成本為 0.13 美元、輸入價格享有 99% 快取折扣,以及輸出冗長度為 1.4 億個 token。這些是針對具名配置的獨立數據,而它們是這項比較唯一扎實的吞吐量錨點。
對 UltraSpeed 而言,已驗證的清單短得多:
• 輸出速度——約為標準層級的十倍,這點由小米提出,並被列出此方案的平台沿用。尚無第三方針對這個特定層級公布每秒 token 數的測量結果。
• 價格——每百萬輸入 token 4.35 美元,每百萬輸出 token 8.70 美元,兩者皆為標準層級的十倍。這兩項費率旁並未列出快取層級。
• 品質——「與原版相符」,這又是供應商的說法。目前尚未發表任何針對 UltraSpeed 端點的獨立評估,因此品質維持不變的主張是未經檢驗,而非已被推翻。
• 上下文與模態 — 1,048,576 個 token,以及原生文字、圖像、影片與音訊輸入,繼承自基礎檢查點。
還有一個廠商基準測試值得特別點名,正因為它流傳的方式。小米公開的強化學習儀表板曾在 2026 年 9 月直播 V2.6 後訓練執行,其中回報 DeepSWE v1.1 分數:Pro 執行結果為 72.57,Flash 為 65.68。這些數字來自小米自家的離線評估,使用 mini-swe-agent 測試框架、取三次平均;它們從未提交至公開排行榜,也尚未在實驗室外被重現。如果你看過 72.57 被當作排行榜分數引用,那是個穿著排行榜外衣的廠商數字。

先例:上一次小米收的是三倍,而非十倍
這並非小米首次推出速度等級,而前一代是整個脈絡中最有用的對照——因為倍率變了。
MiMo-V2.5-Pro-UltraSpeed 於 2026 年 6 月問世,以 V2.5-Pro 檢查點為基礎打造,定價約為標準模型輸出費率的三倍。小米當時的宣傳說法與現在如出一轍:輸出速度約為十倍。當時的報導指出,在單一八 GPU 節點上,可持續達到約每秒 1,000 個 token 的吞吐量,峰值接近 1,200,不過該模型頁面本身列出的範圍更廣,為 500 至 1,000——而這些全都未經獨立驗證。使用權限需透過申請表取得,而非開放註冊。
把兩者並排一比,重點就在這個轉變。速度倍數維持在約十倍。價格倍數則從三倍變成十倍。對同一種升級來說,這是截然不同的交易條件,而 Xiaomi 尚未公布這項變更的解釋。這可能反映服務確實更昂貴——更大的檢查點、更積極的解碼配置,或推出時更緊縮的容量。這也可能反映某個僅推出一天的方案在上市期間的定價。它目前還沒有的,是一個你可以查證的公開理由。
對任何用過 V2.5 級別的人來說,有個實務上的差異值得特別點出:那個版本是需要通過審核才能試用的封閉測試。V2.6 級別則列為透過小米自家 API 及多個第三方平台全面開放使用,依公布費率提供,且無需申請步驟。無論其他方面還有什麼改變,想試用的門檻確實降低了。
在真實工作負載下,十倍的成本是多少?
百分比會掩蓋這件事的實際形貌,因此以下是對一次具體代理執行所做的計算——這次執行在其生命週期內讀取 2,000 萬個輸入 token,並產生 200 萬個輸出 token。這是沉重但不罕見的代理式工作負載,模型會反覆進行工具呼叫,並重新讀取自身的上下文。
• 標準層級,輸入 — 2,000 萬個 token,每百萬 $0.435:$8.70。
• 標準層級,輸出 — 2M tokens,每百萬 $0.87:$1.74。
• {{1}}標準層級{{/1}},總計 — 每次執行 $10.44。
• UltraSpeed 層級,輸入 — 2,000 萬個 token,每百萬 $4.35:$87.00。
• UltraSpeed 等級,輸出 — 200 萬個 token,每百萬 $8.70:$17.40。
• UltraSpeed 等級,總計 — 每次執行 $104.40。
差額是 $93.96,而且它正好是整份帳單的十倍,而不是帳單中某一項的十倍,因為兩個費率會一起變動。現在來看帳本的另一邊。在 Artificial Analysis 為標準層測得的每秒 134.3 個輸出 token 下,產生 200 萬個輸出 token 需要略超過四小時的純生成時間。若速率提高為十倍,則約需二十五分鐘。因此,這多出的 $94 在這次執行中換回大約三個半小時的實際時間——如果你想這樣說,相當於每省下一小時約 $27。
這筆取捨划不划算,完全取決於實際耗時對你有多大價值,而有一個細節會打破直覺解讀。在 Artificial Analysis 的頁面上,標準方案的輸入價格享有 99% 快取折扣,這意味著在會重複讀取相同脈絡的工作負載上,帳單中輸入的那一半可能幾乎歸零。UltraSpeed 的刊載價格只列出兩項主要費率,沒有快取層級。如果你的工作負載高度依賴快取,實際倍數就不是十倍——而是糟糕得多,因為你會在原本幾乎不用付費的那一側失去折扣。如果你的工作負載以輸出為主且很少使用快取,十倍才接近實際數字。在相信任一個數字之前,先衡量你自己的組成比例。
開放權重的不對稱性
這兩個層級之間存在一項結構性差異,與價格或速度都無關,而且其重要性可能超過這兩者。
MiMo-V2.6-Pro 以 MIT 授權條款推出,權重發布於 Hugging Face。這允許商業部署、修改與進一步訓練,也意味著標準模型有一個任何供應商都無法撤除的價格下限:如果託管費率變得不合理,你可以自行提供該檢查點的服務。你不會在自有硬體上達到小米的吞吐量,而且你得為 GPU 付費,但這個選項確實存在,而它為託管方案的收費設下了上限。
UltraSpeed 沒有這樣的價格底線。沒有 UltraSpeed 權重,因為這個層級賣的是服務堆疊,而不是模型——檢查點就是已經公開的那一個,而你租用的是小米快速運行它的能力。這是完全可以正當販售的東西,也與市場上所有其他速度層級的形態一致。這確實意味著,十倍費率除了其他跑相同開放權重的供應商之外,沒有任何競爭制衡;而且如果價格再次變動,也沒有自行託管的退路。

請將這點對照可用性現況來解讀。標準檢查點可透過小米自家管道與數個第三方平台取得,而且也可供下載。UltraSpeed 層級可透過小米自家 API 與數個第三方平台取得,而這是取得它的唯一方式。對任何正在權衡長期依賴的人來說,這種可選性上的差異,值得與每 token 費率一併納入價格考量。
誰應該拿哪個
這個決策的分野很明確:你的成本有多少來自輸出 token,以及你的延遲預算有多少是花在生成而非排隊上。
• 當工作負載輸出量大、快取用量少且具互動性時,就採用 UltraSpeed——例如長篇生成、模型在工具呼叫之間撰寫大量推理的代理迴圈,或任何有真人在請求另一端等待的情況。
• 當工作負載是快取密集型、可容忍批次處理,或對邊際成本敏感時,請採用標準層——大量分類、在固定語料庫上進行檢索增強式問答、夜間評估作業,以及任何四小時的生成時間無妨的情況,因為沒有人在看。
• 當你希望能有自行託管的選項時,請選擇標準方案。若你的合規態勢要求必須擁有可自行持有的權重,那麼無論價格多高,UltraSpeed 都無法提供給你。
• 先測量,再決定要不要採用任何一方。十倍這個說法是這裡的關鍵支撐數字,而目前它只是廠商聲稱。花一個下午把你自己的提示詞跑過這兩個層級,得到的資訊會比任何已公布的數字更多,因為唯一有人獨立驗證過的吞吐量數字,是屬於比較中較慢的那一方。
關於最後一點,測試服務層級的機制與測試模型相同,而這正是路由層發揮價值之處。 OrcaRouter 在單一 API 金鑰後提供超過 200 個模型,並以供應商定價、0% 加成轉嫁,因此 供應商的價格變動會在同一天反映到您這邊,而不是等到下一次合約續約。自動容錯移轉意味著您仍在評估的層級絕不會獨自落在正式環境路徑上,而路由 DSL 讓您可以將某一類請求送往快速端點,其餘則送往標準端點,而無需維護兩套整合。這些都不特別需要 Xiaomi 的模型——重點在於,當各層級都位於同一把金鑰之後時,像這樣的層級決策要逆轉成本很低。
「什麼能解決這件事?」
關於 MiMo-V2.6-Pro-UltraSpeed 與 MiMo-V2.6-Pro 的比較,誠實的狀況是:其中一半有實測依據,另一半則只是聲稱。標準版有獨立的 Intelligence Index、獨立的吞吐量數據,以及已公開的開放權重。快速版則有價格、上下文視窗,以及廠商承諾它只是同一個模型跑得更快。
有三件事可以弭平這個差距。在 UltraSpeed 端點上進行獨立吞吐量測量——Artificial Analysis 是透過 Xiaomi 的 API 測量標準層級,因此同樣的做法可行,只是尚未發生。為快速層級制定快取策略,因為缺少這項策略,正是讓十倍帳單在快取密集型工作上變成更糟情況的原因。以及任何關於 V2.6 服務堆疊的已發布細節,一如 Xiaomi 為 V2.5 世代記載 FP4 專家、DFlash 和 TileRT 的方式。
在那之前,十倍的價格是實實在在的,十倍的速度則只是一種宣稱。如果你的工作負載以輸出為主,而且有人在等,那麼這個宣稱值得用你自己的提示詞實測一番——也值得在一層能讓你在它站不住腳時、同一個下午就切換回來的架構後面測試。
