
MiMo-V2.6-Pro 對決 Claude Opus 5:便宜 21 倍,指數落後 5 點
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 632 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 187 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 112 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
小米 MiMo-V2.6-Pro 與 Claude Opus 5 是同一筆交易的兩端,而這筆交易是有代價的。在 Artificial Analysis Intelligence Index v4.3.2 上,Claude Opus 5(最高投入程度)得分 51,小米 MiMo-V2.6-Pro 得分 46。在價目表上,Claude Opus 5 每百萬輸入 token 要價 $5.00、每百萬輸出 token 要價 $25.00;MiMo-V2.6-Pro 則要價 $0.43 與 $0.87。做個除法,答案就是輸入 11.6 倍、輸出 28.7 倍——而若看 Artificial Analysis 為兩者各自公布的混合費率,則是 21 倍。五個指數分數,代價是二十一倍的錢。這究竟是划算還是浪費,完全取決於你的工作負載怎麼運用這第五分,而大多數團隊在投入之前,從來沒把這件事弄清楚。
這兩個模型,說得直白些
Claude Opus 5 是 Anthropic 的專有旗艦模型,於 2026 年 7 月 24 日發布,具備 100 萬個 token 的上下文視窗,參數數量並未公開。小米 MiMo-V2.6-Pro 是一款稀疏混合專家模型,總參數達 1.02 兆,啟用參數為 420 億,具備 100 萬個 token 的上下文視窗,原生支援文字、圖像、視訊與音訊多模態,並以 MIT 授權釋出權重。
• 權重 — MiMo-V2.6-Pro 採 MIT 授權且可下載;Claude Opus 5 為專有、僅提供 API
• 參數 — MiMo-V2.6-Pro 總計 1.02T / 42B 啟用;Claude Opus 5 未公開
• 上下文 —— 兩者皆為 100 萬 tokens;Claude Opus 5 在 Messages API 上的輸出上限為 128K,在 Batch API 上則為 300K
• 模態 — MiMo-V2.6-Pro 接受文字、圖像、影片與音訊;Claude Opus 5 所公布的輸入介面為文字與圖像
• 定價 — MiMo-V2.6-Pro 每 100 萬 tokens 為 $0.43 / $0.87;Claude Opus 5 為 $5.00 / $25.00
• 快取 — MiMo-V2.6-Pro 列出 99% 的快取折扣;Claude Opus 5 的快取讀取為每 1M $0.50,寫入為 $6.25,TTL 為 5 分鐘
• 每個 Intelligence Index 任務的實測成本 — MiMo-V2.6-Pro $0.13;Claude Opus 5 $5.86
• 服務 — MiMo-V2.6-Pro 每秒輸出 134.3 個 token,首個 token 延遲 2.15 秒;Claude Opus 5 每秒 57.9 個 token
最後那一組配對,正是最容易被漏掉的那一組。較便宜的模型同時也是較快的模型——在輸出吞吐量上快上 2.3 倍——因為它運行在小米及其合作夥伴所掌控的硬體上,而且能夠積極地進行批次處理。在最大努力模式下,Claude Opus 5 是推理模型,每個 token 做的工作更多;速度差距不是缺陷,而是不同的產品。但這確實意味著,便宜的那條路線並不是用延遲來換取折扣。它付出代價的地方,是五個指數點,以及那第五點所棲身的任務長尾。

這五個點實際上在哪裡
十項評測的綜合分數上出現五分差距,這差距並非平均分布,而總合分數掩蓋了真正重要的事。兩個模型都跑在同一套 v4.3.2 測試套件上,其中包含 AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience 與 AA-LCR v1.1。已公布的頁面並未拆分出兩個模型各自的逐項評測分數,這對本比較的雙方而言都是實質限制,值得直說,而不是粉飾帶過。
有案可查的內容僅具方向性。Claude Opus 5 在最高強度設定下,於 v4.3 測試套件中的 Terminal-Bench 4.0 拿下 49.0%,落後於 GPT-6 Astra 的 59.1% 與 Claude Fable 5.1 的 52.0%。在 AutomationBench-AA 上,Opus 5 於 28.3% 的工作流程中完成每一項目標且未違反護欄,GPT-6 Astra 為 41.6%,Fable 5.1 為 32.1%。這些是硬性的代理式數據,而它們正是五分綜合差距最不可能平均分布的類別——MiMo-V2.6-Pro 自身的索引條目並未公布可相比的代理能力細分。
同時,兩家公司各自公布的廠商數據彼此無法相比,而箇中原因值得直說。Anthropic 的發布資料回報 SWE-bench Verified 為 96.0%、SWE-bench Pro 為 79.2%;有一名追蹤者指出,Opus 5 推出時並未附上獨立的 SWE-bench 項目,而且也沒有針對它經過獨立稽核的 SWE-bench Verified 數字。小米的資料則回報,MiMo-V2.6-Pro 在其 RL 訓練過程中,於 DeepSWE v1.1 上從 58.4 提升到 72.57,且是在小米自家的測試框架上、以 mini-swe-agent 取三次平均,並未提交至公開的 DeepSWE 排行榜。兩套廠商測試框架、兩項不同任務,毫無重疊。把 96.0% 與 72.57 並列,然後據此得出結論,等於憑空發明了一種根本不存在的比較。

成本比較,妥善完成
按 token 計算的數字低估了差距,因為這兩個模型完成同一項工作時,所消耗的 token 數量並不相同。Artificial Analysis 測量了兩者實際執行完整 Intelligence Index 的成本:MiMo-V2.6-Pro 為 $0.13,Claude Opus 5 為 $5.86。這是在一組受控且完全相同的任務上出現的 45 倍差距,而且這是目前可取得最公平的單一數字,因為兩者是以相同方式測量的。
現在拿一個合理的正式生產迴圈來對照它。一次 30 步的代理執行,每一步讀取 200,000 個 token 的上下文,並每一步寫入 2,000 個 token,等於每次執行有 600 萬個輸入 token 和 60,000 個輸出 token。以 Claude Opus 5 的定價計算,那是 $30.00 的輸入與 $1.50 的輸出——在任何快取之前,每次執行 $31.50。在 MiMo-V2.6-Pro 上,則是 $2.58 的輸入與 $0.05 的輸出——$2.63。有了兩家供應商都提供的快取折扣,輸入端在任一款模型上都會大幅壓低,而比率只是位移,並不會消失:便宜模型上 99% 的快取折扣,對比昂貴模型上 $0.50 的快取讀取,仍然會讓昂貴模型在上下文密集的迴圈中領先一個數量級。
這正是支持設置便宜通道、反對全面切換的全部論據。如果你的工作負載是長時間運行的代理迴圈,會反覆重讀同一份上下文數百次,那麼每次執行的成本差異可不是四捨五入的誤差——那是「你能負擔得起為每位使用者執行」與「你負擔不起」之間的差別。這就是把 MiMo-V2.6-Pro 放在你大部分流量前面的理由。這並不是刪掉 Claude Opus 5 的理由,因為第五個指數點能回本的那些任務,從本質上說,正是便宜模型一旦失敗就會代價高昂的任務。

路由決策在這裡看起來是什麼樣子
Claude Opus 5 可透過單一 OrcaRouter 金鑰取得,價格為供應商定價、0% 加價,模型代號為anthropic/claude-opus-5,而您會拿來與它比較的前沿模型,也同樣並列在這把金鑰之下。由於我們以不加價的方式直接轉傳供應商的定價,無論哪一方的價格有變動,當天就會反映在我們這邊,而不必等待重新報價。真正有意思的地方在於路由 DSL:您可以將這兩個模型組成單一次呼叫,而不是在兩者之間取捨;把工作負載的大部分送到便宜的那條通道,並將尾端任務——也就是自我檢查未通過,或符合複雜度判定條件的任務——導向昂貴的那一條。容錯移轉則是另一半。Claude Opus 5 的供應商覆蓋範圍廣泛;MiMo-V2.6-Pro 在 Artificial Analysis 收錄時,僅由單一 API 供應商提供,對於一個您會放進正式環境路徑的模型而言,這是一條單薄的路由。路由器能夠退援,才讓便宜通道得以安全採用。
值得直說,因為很容易誤以為相反:我們並不代管 MiMo-V2.6-Pro。今天要取用它,得透過 Xiaomi 自家平台,或某個將它收錄其中的第三方目錄。這裡談的路由選擇論點,是在說你如何把這類模型與我們確實有提供的模型搭配使用,而不是宣稱它是我們自家的模型之一。
該選哪一個
當任務的失敗成本遠超過 token 成本,以至於五個指數分數不過是便宜的保險時,就該選擇 Claude Opus 5——具有真實副作用的長程代理式工作、錯誤呼叫比緩慢呼叫更糟的工具使用,以及任何你已經付錢請人檢查輸出成果的情境。每指數任務 $5.86 這個數字並不是避開它的理由;那是這個等級的價格,而這個等級的存在自有其道理。
當吞吐量是限制條件時,選擇 MiMo-V2.6-Pro;當工作負載脈絡繁重且高度重複時;當你想把權重放在自己的基礎架構中時——MIT 授權允許商業部署、修改與進一步訓練——或是當你正在打造某個唯有每千個 token 五分之一美分才能讓單位經濟效益成立的東西時。它每秒 134.3 個 token 的速度,讓它在互動式使用上切實可行,而這是大多數兆級參數開源模型做不到的。
兩個都選——如果你有路由器的話,因為對「哪個比較好」最誠實的答案是:它們並不是在搶同一批請求。真正要避免的失敗模式,是代價最大的那一種:因為檯面上的比例是 21x,就把標準統一押在便宜模型上,結果第三個月才發現某一類特定請求非得用貴的那個不可,而且沒有任何路徑可以把請求導過去。第二種失敗模式則是它的鏡像——為了一份摘要工作付 Opus 5 的價錢,而 46-index 模型做出來的結果一模一樣。這兩者都不是模型問題,兩者都是配置問題,而配置正是你在某個週二下午就能改動的那個部分。
