
MiMo-V2.6-Pro 對上 GPT-5.6 Sol:每個指數點,每項任務的成本高出十五倍
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 36 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 181 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
在 Artificial Analysis Intelligence Index v4.3.2 上,於 2026 年 9 月 25 日讀取,GPT-5.6 Sol 在最高努力程度下得分 47,而小米的 MiMo-V2.6-Pro 得分 46。一分。真正區分它們的數字不是分數,也不是每 token 費率——而是單一索引任務的成本,Artificial Analysis 公布 GPT-5.6 Sol 為 $1.99,MiMo-V2.6-Pro 為 $0.13。為了區區一分,要多花十五倍的錢。而且截至這次讀取,評估機構針對該模型的自家頁面帶有棄用通知,因為 GPT-6 Sol 已取代了它。
Xiaomi 於 2026 年 9 月 21 日發布了 MiMo-V2.6-Pro 的權重與技術報告,就在本次閱讀的四天前;OpenAI 於 2026 年 7 月 9 日推出了 GPT-5.6 Sol。上述這兩個事實都是自這個配對上次被撰寫以來的新消息,而且它們指向相反的方向。棄用通知指出,這項比較是針對一個 OpenAI 已經汰換掉的模型。每項任務的數字顯示,當兩個模型都以標價報價時,看起來像是捨入誤差的東西,在真實工作負載上,卻是整個決策的關鍵。這兩者哪個重要,取決於你是在購買模型還是在替換模型。
這兩頁現在所說的內容
GPT-5.6 Sol 於 2026 年 7 月 9 日發布,是 GPT-5.6 系列的旗艦。其定價為在 OpenAI 第一方 API 上每百萬輸入 token 4.00 美元、每百萬輸出 20.00 美元,並提供 90% 的快取折扣;該頁面記錄到在這次索引執行中產生了 9,000 萬個輸出 token,而中位數為 8,800 萬。它測得每秒 73 個輸出 token,同一頁面稱此速度高於平均,中位數為 72 t/s。其索引條目在同類 210 個模型中排名第 19。
小米 MiMo-V2.6-Pro 是一個稀疏混合專家檢查點,總參數達 1.02 兆、啟用參數 420 億,以 MIT 授權,具備 100 萬 token 的上下文視窗,支援文字、圖像、語音與影片輸入,並輸出文字。其定價為每百萬 token 0.43 美元與 0.87 美元,並享有 99% 快取折扣——是 Sol 輸入費率的十分之一,輸出費率的二十三分之一。它在 index run 中產生了 1.4 億個輸出 token,並測得每秒 43.6 個輸出 token,其頁面形容這相對於 67.1 t/s 的中位數明顯偏慢。
• 索引任務成本 — MiMo-V2.6-Pro $0.13;GPT-5.6 Sol $1.99 — 差距達 15 倍 • 定價 — MiMo-V2.6-Pro 每 1M $0.43 / $0.87;GPT-5.6 Sol 每 1M $4.00 / $20.00 • 快取折扣 — MiMo-V2.6-Pro 99%;GPT-5.6 Sol 90% • 索引執行時的輸出 token 數 — MiMo-V2.6-Pro 140M;GPT-5.6 Sol 90M • 輸出速度 — MiMo-V2.6-Pro 43.6 t/s,對比中位數 67.1;GPT-5.6 Sol 73 t/s,對比中位數 72 • 上下文與權重 — MiMo-V2.6-Pro 1M 且採 MIT 授權;GPT-5.6 Sol 1M 且為專有

棄用通知是更具影響力的那一行。
Artificial Analysis 現在打開 GPT-5.6 Sol 頁面時,會顯示一則方框提示:「此模型已棄用。我們僅針對預設的 10k 輸入 token 工作負載繼續進行效能基準測試」,接著是一句話,說明 OpenAI 已推出更新的模型 GPT-6 Sol(max),應改為考慮該模型。因此,指數上的 47 是一個已不再是購買首選的模型所測得的讀數。這並不表示這個讀數有錯——它與 46 是在同一個指數、同一天、相同的 effort 設定下測得——但它改變了這項比較的目的。它不再是「我該用哪一款旗艦」,而是「在專有模型排行榜的頂端還是它的那一刻,站上頂端要付出什麼代價」。
這種重新詮釋的重要性比聽起來更高,因為評估器頁面上的棄用通知,是少數幾個能讓供應商的產品節奏以資料變更、而非新聞稿形式顯現的地方之一。分數已凍結;模型並未提供。任何你針對 47 打造的東西,都是在針對一份快照打造。

為什麼每項任務的數字才是應該用來建模的依據
以每個符元計價會美化便宜模型,並在並非符元中立的工作負載上造成誤導。索引任務成本是另一種衡量方式:它是評估器為了從每個模型取得一個答案實際花費的成本,其中同時納入了費率,以及模型選擇產生的符元數量。MiMo-V2.6-Pro 在索引執行中產生的符元比 Sol 多——1.4 億對 9,000 萬,約為 1.6 倍——而每項任務成本仍為 $0.13,相較於 $1.99。在輸出上,費率優勢約為二十三倍;冗長懲罰為 1.6 倍;兩者相乘便是每項任務十五倍的差距。
那才是成本模型該建立在其上的算術,也是當你把 $0.87 拿來跟 $20.00 比較就停住時,會看不見的算術。它也會告訴你,什麼情況會推翻這個結論。如果你的工作負載以極短的輸出為主,Sol 的 Token 數量會朝你的數量萎縮,而二十三倍的費率差距會發揮大部分作用,因此真正的倍數會朝費率差距靠攏,而不是遠離它。如果你的工作負載以冗長的推理軌跡為主,MiMo-V2.6-Pro 的 1.6× 冗長度會複合累加,$0.13 就會變成上限,而不是估計值。對外公布的數字是對某個基準測試形狀的測量值,不是你能交給財務部門的報價。
延遲線是誠實的制衡力量
以每秒 43.6 個輸出 token 的速度來看,MiMo-V2.6-Pro 比同日測得 73 的 GPT-5.6 Sol 更慢——也比它自家頁面拿來對比的模型更慢,而那些模型的中位數是 67.1。它的頁面也白紙黑字這麼寫:「明顯偏慢」。對批次處理流程而言,這是可以計價的吞吐量成本。對互動式代理來說,這是產品決策,而每項任務便宜十五倍並不會讓慢速模型變快。如果你的限制是每回合的預算,而不是每月帳單,那麼真正關鍵的比例是 43.6 對上 73,而 MiMo-V2.6-Pro 輸了這一局。
這在路由器上的落點
這種配對真正有用的形態並不是「二選一」,而是兩個模型都回應同一份指標,且評測方會公布各自每項任務的成本,因此可以依實測成本而非廠商等級來做分配。在 OrcaRouter 上,目錄涵蓋 200+ 個模型,用一把金鑰、以各供應商的定價、0% 加價取得——供應商降價當天就會反映到你的帳單,無須重新協商第二份合約——而且 路由 DSL 讓工作負載能依任務而非依品牌,把大量且便宜的呼叫導向某個模型,把困難的呼叫導向另一個。自動容錯移轉則涵蓋較便宜路徑效能降級的情況。Xiaomi MiMo-V2.6-Pro 不在我們的路由上——在供應商完成上架之前,我們不會列出該模型——因此就比較的這一邊而言,誠實的答案是廠商自家的 API,或是你已經有合作關係的任一託管平台。

下週前要怎麼處理這個
2026 年 9 月 25 日有兩件事改變了,而其中只有一件與價格有關。GPT-5.6 Sol 在測得 47 的那個指數上帶有棄用通知,這使它退出採購決策的考量,僅留作基準參考。MiMo-V2.6-Pro 每項指數任務測得 $0.13,相較於 Sol 的 $1.99,換取一分指數分數要花十五倍的錢——而且它是每秒 43.6 個 token,比它所比較的模型更慢,也比同級中位數更慢。在任一數字成為決策之前,先用你自己的流量檢驗這兩個數字:每任務成本是一項量測值,不是費率;延遲是一項量測值,不是主觀意見。如果你的輸出簡短且非互動,那麼採用開放檢查點的理由會比指數差距所顯示的更強。如果你的輸出很長,或你的使用者正在等待,那麼十五倍的節省為你換來的是更慢的產品,而這是一筆只有你的工作負載能定價的取捨。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
