
MiMo-V2.6-Pro 對決 GPT-5.6 Sol:一分指數差距,二十二倍的混合費率
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
On the Artificial Analysis Intelligence Index v4.3.2, read on 22 September 2026, the vendor's GPT-5.6 Sol at maximum effort scores 47 and Xiaomi's MiMo-V2.6-Pro scores 46. One point. The blended rates Artificial Analysis publishes for the two — a 7:2:1 cache-hit, input, output mix — are $3.08 for GPT-5.6 Sol and $0.18 for MiMo-V2.6-Pro. Twenty-two times the money for one index point is the entire shape of this matchup, and the interesting question is not whether the point is worth it. It is which specific requests the point lives in, because the aggregate does not tell you.
這對組合之所以值得比較,正因為它們顯然不屬於同一類別。GPT-5.6 Sol 是一款專有的前沿模型,具備多代理模式,以及與之相稱的價目表。Xiaomi MiMo-V2.6-Pro 則是以 MIT 授權的開放權重檢查點,於 2026 年 9 月 22 日發布,強化學習儲存庫在前一天上線,而它的定價卻像中階模型。一個兆參數的開放模型能與 OpenAI 的旗艦模型只差一分,這才是新聞。至於你要怎麼運用這個事實,則是另一個決定。
這兩個模型,說得直白些
GPT-5.6 Sol 於 2026 年 7 月 9 日發布,是 GPT-5.6 系列的旗艦模型,與 Terra 和 Luna 一同推出,OpenAI 會將單純的gpt-5.6別名指向它。它屬於專有模型,接受文字與圖像輸入並回傳文字,支援從 none 到 xhigh 的推理強度,以及 Sol 專屬的「ultra」多代理模式,知識截止日期為 2026 年 2 月。其定價為 OpenAI 第一方 API 每百萬輸入詞元 4.00 美元、每百萬輸出詞元 20.00 美元,快取輸入為 0.50 美元,並具備 100 萬詞元的上下文視窗。Artificial Analysis 測得每秒 77.3 個輸出詞元,首個詞元耗時 127.21 秒,執行完整索引的成本為 3,464.84 美元。
Xiaomi MiMo-V2.6-Pro 是一款稀疏混合專家模型,總參數達 1.02 兆,每個 token 啟用 420 億參數,具備 100 萬 token 的上下文視窗,並原生支援文字、圖像、影片與音訊等多模態。小米維持了上一代的定價,而未隨新的檢查點向上調價,因此這個規模的模型每百萬 token 的價格為 $0.43 與 $0.87,並享 99% 的快取折扣。Artificial Analysis 實測輸出速度為每秒 134.3 個 token,首 token 延遲 2.15 秒,跑完整套索引的費用為 $206.66——每項任務 $0.13。
• 權重 — MiMo-V2.6-Pro 採 MIT 授權且可下載;GPT-5.6 Sol 為專有,僅提供 API
• 參數 — MiMo-V2.6-Pro 總計 1.02T/42B 啟用;GPT-5.6 Sol 未公開
• 上下文 — 兩者皆為 1M token;GPT-5.6 Sol 的輸出上限為 128K
• 模態 — MiMo-V2.6-Pro 接受文字、圖像、影片與音訊;GPT-5.6 Sol 已公佈的輸入介面為文字與圖像
• 定價 — MiMo-V2.6-Pro 每 1M $0.43 / $0.87;GPT-5.6 Sol $4.00 / $20.00,快取輸入 $0.50
• 混合費率 — MiMo-V2.6-Pro 每 100 萬 $0.18;GPT-5.6 Sol $3.08
• 每個索引任務的實測成本 — MiMo-V2.6-Pro 為 $0.13;GPT-5.6 Sol 完整索引為 $3,464.84
• 速度 — MiMo-V2.6-Pro 每秒輸出 134.3 個 token;GPT-5.6 Sol 每秒輸出 77.3 個
• 首個詞元時間 — MiMo-V2.6-Pro 2.15 秒;GPT-5.6 Sol 127.21 秒
• 推理控制——GPT-5.6 Sol 提供 none/low/medium/high/xhigh/max,外加一種 ultra 多代理模式;MiMo-V2.6-Pro 則未公布對等的層級選項

那個點實際上所在的位置
十項評估綜合分數上的一分差距,在總體層面是捨入誤差,在單項層面卻是鴻溝。這套評測涵蓋 AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience 與 AA-LCR v1.1——推理、知識、數學與程式設計——而兩家廠商都沒有針對這兩個模型公布逐項評估的細分結果。這項資訊的缺失,對本頁雙方而言都是實質限制,值得如實說明,而不是用綜合分數粉飾過去。
公開紀錄所顯示的內容具有方向性,並指向代理式工作正是差距集中的所在。GPT-5.6 Sol 的發布資料回報,在涵蓋 55 個領域、長期用於專業工作流程評估的 Agents' Last Exam 上達到 53.6%,OpenAI 稱之為新高;在 SWE-Bench Pro 上為 64.6%;在 Terminal-Bench 2.1 上為 88.8%;在電腦操作的 OSWorld 2.0 上為 62.6%。其 BrowseComp 分數 90.4% 在 ultra 模式下升至 92.2%,該模式以約四倍的 token 成本執行四個平行子代理。這些都是廠商在其自家測試框架上公布的數字,而慣常的但書對每一項都適用——但這些正是單一百分點的綜合差距最不可能平均分布的分類,而小米並未針對 MiMo-V2.6-Pro 公布可相比的代理式細分數據。
制衡點在於,MiMo-V2.6-Pro 自家廠商的數據完全屬於不同的任務家族。Xiaomi 報告指出,該模型在其強化學習訓練過程中,於 DeepSWE v1.1 上從 58.4 進展到 72.57,並使用 mini-swe-agent 以三次平均的方式在 Xiaomi 自家的評分器上進行評估,且從未提交至公開排行榜。將 72.57 與任何 Sol 的數字並列,將是捏造一種不存在的比較。兩個模型實際上被同一個評估者跑出的唯一數字,就是 46 和 47。
成本比較,妥善完成
每個 token 的算術計算低估了差距,因為這兩個模型完成同一項工作所消耗的 token 數量並不相同。公正的單一數字,是 Artificial Analysis 對兩者各自執行其完整指標所測得的成本:MiMo-V2.6-Pro 為 206.66 美元,GPT-5.6 Sol 為 3,464.84 美元。相同的測試套件、相同的測試框架、以完全相同的方式測量——在受控任務集上有 16.8 倍的差距,而這個差距本身已經涵蓋了 Sol 是推理模型、會輸出 token 來思考的事實。
現在來看一個正式生產環境的迴圈。一次 30 步的代理程式執行,每步讀取 200,000 個 token 的上下文,並寫入 2,000 個 token,每趟執行就是 600 萬個輸入 token 與 60,000 個輸出 token。在 GPT-5.6 Sol 的定價表上,那是 $24.00 的輸入與 $1.20 的輸出——在快取之前,每趟執行 $25.20。在 MiMo-V2.6-Pro 上則是 $2.58 與 $0.05——$2.63。快取會改變這兩者:Sol 的快取輸入價格為 $0.50,而 MiMo-V2.6-Pro 提供 99% 折扣,但在上下文密集的迴圈中,仍讓昂貴模型貴上一個數量級,而這正是代理程式所執行的迴圈。
比較中延遲的那一半比價格的那一半更鮮明,卻較少受到關注。GPT-5.6 Sol 量測到首個 token 需時 127.21 秒。MiMo-V2.6-Pro 則量測到 2.15 秒。這是五十九倍的差距,而這個數字決定了互動式產品究竟可不可能存在。以最高投入程度運作的 Sol,實務上就是個批次模型——你提交,你等待,你再回來。如果你的應用程式會在第一個 token 上阻塞,那麼無論指數怎麼說,選擇早已替你做好了。

一鍵,兩車道
兩個模型都能透過單一 OrcaRouter 金鑰,以供應商定價、0% 加價取得——GPT-5.6 Sol 即為openai/gpt-5.6-sol,這是我們通往該模型的自家路由。由於我們不加任何加價、直接沿用供應商的定價,因此任一方價格若有變動,我們這邊當天就會同步生效,而不必等待重新報價。
路由 DSL 正是這組搭配變得有趣、而不只是方便的地方。兩個模型在指數上只差一點,其中一個每項任務的成本卻貴上十六倍,它們不是二選一的替代方案——而是一種雙線道配置。把工作負載的大宗送進便宜的車道,再依你自己定義的述詞,把尾端流量導向昂貴的那條:自我檢查失敗的請求、符合複雜度規則的請求、失敗成本高於 token 成本到某個程度、多到讓這層保險顯得划算的請求。容錯移轉是它的另一半。Sol 的服務管道廣泛;MiMo-V2.6-Pro 本週才發布,而 Artificial Analysis 取得資料時,只有單一家 API 供應商將其列出,對於一個你會放進正式生產路徑的模型來說,這是條很單薄的路由。能夠回退的路由器,才讓便宜車道可以安心採用,也才讓昂貴車道成為選項、而非必須。

該選哪一個
當任務的失敗成本遠高於 token 成本時,就選用 GPT-5.6 Sol——具有真實副作用的長時程代理式工作、電腦使用自動化、錯誤呼叫比緩慢呼叫更糟糕的工具使用,以及任何你已經花錢請人檢查輸出的情況。那筆 3,464.84 美元的 index run 並不是避開它的理由;那是這個層級的價格,而這個層級的存在有其原因。
當吞吐量是限制條件時、當工作負載偏重上下文且高度重複時、當你需要首字延遲低到讓人類願意等待時、當你想把權重放在自己的基礎設施中——MIT 允許商業部署、修改與進一步訓練——或者當單位經濟效益唯有在每千個 token 五分之一美分時才成立時,就選 MiMo-V2.6-Pro。它每秒 134.3 個 token 的速度,讓它能以大多數兆參數開源模型做不到的方式供互動使用,而這是一種能力,不是折扣。
如果你有路由器的話,就兩者都選,因為對「哪個更好」這個問題,誠實的答案是:一分的綜合差距不是定論——它衡量的是它們平均而言有多相似,以及它們在尾端可能有多不同。要避免的失敗模式是:因為比率是 22 倍就標準化採用便宜模型,結果在第三個月才發現某類請求需要昂貴的那個,卻沒有路徑把它路由到那裡。鏡像的失敗則是:為一項 46-index 模型也能做得一模一樣的摘要工作,支付 Sol 的費率。兩者都不是模型問題。兩者都是設定,而設定正是你可以在某個週二下午改變的部分。
OrcaRouter 將 200+ 個模型置於單一 OpenAI 相容端點之後,以供應商標價提供且 0% 加成,因此供應商價格一有變動,當天即會生效。
