OrcaRouter 模型雷達主視覺卡片,用於 MiMo-V2.6-Pro 與 Claude Opus 5 之間的比較,副標題為「五個指數點。二十一倍的價格。」,每個模型各有一塊面板。
Guides & Insights

MiMo-V2.6-Pro 對決 Claude Opus 5:便宜 21 倍,指數落後 5 點

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

小米 MiMo-V2.6-Pro 與 Claude Opus 5 是同一筆交易的兩端,而這筆交易是有代價的。在 Artificial Analysis Intelligence Index v4.3.2 上,Claude Opus 5(最高投入程度)得分 51,小米 MiMo-V2.6-Pro 得分 46。在價目表上,Claude Opus 5 每百萬輸入 token 要價 $5.00、每百萬輸出 token 要價 $25.00;MiMo-V2.6-Pro 則要價 $0.43 與 $0.87。做個除法,答案就是輸入 11.6 倍、輸出 28.7 倍——而若看 Artificial Analysis 為兩者各自公布的混合費率,則是 21 倍。五個指數分數,代價是二十一倍的錢。這究竟是划算還是浪費,完全取決於你的工作負載怎麼運用這第五分,而大多數團隊在投入之前,從來沒把這件事弄清楚。

這兩個模型,說得直白些

Claude Opus 5 是 Anthropic 的專有旗艦模型,於 2026 年 7 月 24 日發布,具備 100 萬個 token 的上下文視窗,參數數量並未公開。小米 MiMo-V2.6-Pro 是一款稀疏混合專家模型,總參數達 1.02 兆,啟用參數為 420 億,具備 100 萬個 token 的上下文視窗,原生支援文字、圖像、視訊與音訊多模態,並以 MIT 授權釋出權重。

• 權重 — MiMo-V2.6-Pro 採 MIT 授權且可下載;Claude Opus 5 為專有、僅提供 API

• 參數 — MiMo-V2.6-Pro 總計 1.02T / 42B 啟用;Claude Opus 5 未公開

• 上下文 —— 兩者皆為 100 萬 tokens;Claude Opus 5 在 Messages API 上的輸出上限為 128K,在 Batch API 上則為 300K

• 模態 — MiMo-V2.6-Pro 接受文字、圖像、影片與音訊;Claude Opus 5 所公布的輸入介面為文字與圖像

• 定價 — MiMo-V2.6-Pro 每 100 萬 tokens 為 $0.43 / $0.87;Claude Opus 5 為 $5.00 / $25.00

• 快取 — MiMo-V2.6-Pro 列出 99% 的快取折扣;Claude Opus 5 的快取讀取為每 1M $0.50,寫入為 $6.25,TTL 為 5 分鐘

• 每個 Intelligence Index 任務的實測成本 — MiMo-V2.6-Pro $0.13;Claude Opus 5 $5.86

• 服務 — MiMo-V2.6-Pro 每秒輸出 134.3 個 token,首個 token 延遲 2.15 秒;Claude Opus 5 每秒 57.9 個 token

最後那一組配對,正是最容易被漏掉的那一組。較便宜的模型同時也是較快的模型——在輸出吞吐量上快上 2.3 倍——因為它運行在小米及其合作夥伴所掌控的硬體上,而且能夠積極地進行批次處理。在最大努力模式下,Claude Opus 5 是推理模型,每個 token 做的工作更多;速度差距不是缺陷,而是不同的產品。但這確實意味著,便宜的那條路線並不是用延遲來換取折扣。它付出代價的地方,是五個指數點,以及那第五點所棲身的任務長尾。

Two-column scoreboard card headed 'MiMo-V2.6-Pro vs Claude Opus 5 — the scoreboard'. The Xiaomi MiMo-V2.6-Pro column lists Intelligence Index v4.3.2 score 46, list price $0.43 / $0.87 per million tokens, measured cost per index task $0.13, serving speed 134.3 tokens per second, size 1.02T total and 42B active parameters, MIT-licensed downloadable weights, and text, image, video and audio input. The Claude Opus 5 column lists index score 51, list price $5.00 / $25.00, measured cost per index task $5.86, serving speed 57.9 tokens per second, undisclosed size, proprietary API-only weights, and text and image input.

這五個點實際上在哪裡

十項評測的綜合分數上出現五分差距,這差距並非平均分布,而總合分數掩蓋了真正重要的事。兩個模型都跑在同一套 v4.3.2 測試套件上,其中包含 AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience 與 AA-LCR v1.1。已公布的頁面並未拆分出兩個模型各自的逐項評測分數,這對本比較的雙方而言都是實質限制,值得直說,而不是粉飾帶過。

有案可查的內容僅具方向性。Claude Opus 5 在最高強度設定下,於 v4.3 測試套件中的 Terminal-Bench 4.0 拿下 49.0%,落後於 GPT-6 Astra 的 59.1% 與 Claude Fable 5.1 的 52.0%。在 AutomationBench-AA 上,Opus 5 於 28.3% 的工作流程中完成每一項目標且未違反護欄,GPT-6 Astra 為 41.6%,Fable 5.1 為 32.1%。這些是硬性的代理式數據,而它們正是五分綜合差距最不可能平均分布的類別——MiMo-V2.6-Pro 自身的索引條目並未公布可相比的代理能力細分。

同時,兩家公司各自公布的廠商數據彼此無法相比,而箇中原因值得直說。Anthropic 的發布資料回報 SWE-bench Verified 為 96.0%、SWE-bench Pro 為 79.2%;有一名追蹤者指出,Opus 5 推出時並未附上獨立的 SWE-bench 項目,而且也沒有針對它經過獨立稽核的 SWE-bench Verified 數字。小米的資料則回報,MiMo-V2.6-Pro 在其 RL 訓練過程中,於 DeepSWE v1.1 上從 58.4 提升到 72.57,且是在小米自家的測試框架上、以 mini-swe-agent 取三次平均,並未提交至公開的 DeepSWE 排行榜。兩套廠商測試框架、兩項不同任務,毫無重疊。把 96.0% 與 72.57 並列,然後據此得出結論,等於憑空發明了一種根本不存在的比較。

Screenshot of the OrcaRouter model page for Claude Opus 5, showing the 1M-token context window, a 128K maximum output, input pricing of $5.00 per million tokens and output pricing of $25.00 per million, cache reads at $0.50 per million and cache writes at $6.25 per million on a five-minute TTL, and the provider uptime table listing the routes behind the model.

成本比較,妥善完成

按 token 計算的數字低估了差距,因為這兩個模型完成同一項工作時,所消耗的 token 數量並不相同。Artificial Analysis 測量了兩者實際執行完整 Intelligence Index 的成本:MiMo-V2.6-Pro 為 $0.13,Claude Opus 5 為 $5.86。這是在一組受控且完全相同的任務上出現的 45 倍差距,而且這是目前可取得最公平的單一數字,因為兩者是以相同方式測量的。

現在拿一個合理的正式生產迴圈來對照它。一次 30 步的代理執行,每一步讀取 200,000 個 token 的上下文,並每一步寫入 2,000 個 token,等於每次執行有 600 萬個輸入 token 和 60,000 個輸出 token。以 Claude Opus 5 的定價計算,那是 $30.00 的輸入與 $1.50 的輸出——在任何快取之前,每次執行 $31.50。在 MiMo-V2.6-Pro 上,則是 $2.58 的輸入與 $0.05 的輸出——$2.63。有了兩家供應商都提供的快取折扣,輸入端在任一款模型上都會大幅壓低,而比率只是位移,並不會消失:便宜模型上 99% 的快取折扣,對比昂貴模型上 $0.50 的快取讀取,仍然會讓昂貴模型在上下文密集的迴圈中領先一個數量級。

這正是支持設置便宜通道、反對全面切換的全部論據。如果你的工作負載是長時間運行的代理迴圈,會反覆重讀同一份上下文數百次,那麼每次執行的成本差異可不是四捨五入的誤差——那是「你能負擔得起為每位使用者執行」與「你負擔不起」之間的差別。這就是把 MiMo-V2.6-Pro 放在你大部分流量前面的理由。這並不是刪掉 Claude Opus 5 的理由,因為第五個指數點能回本的那些任務,從本質上說,正是便宜模型一旦失敗就會代價高昂的任務。

Cost card headed 'The same agent run, priced twice', listing a stated assumption of a 30-step agent run reading 200,000 tokens of context per step and writing 2,000 tokens per step for 6M input and 60K output tokens per run; MiMo-V2.6-Pro at $0.43 / $0.87 costing $2.58 input plus $0.05 output for $2.63 per run before caching; Claude Opus 5 at $5.00 / $25.00 costing $30.00 input plus $1.50 output for $31.50 per run before caching; a per-token ratio of 11.6x on input, 28.7x on output and 21x on the blended rate; a measured $0.13 against $5.86 per Intelligence Index task, a 45x gap; and the caching comparison of a 99% cache discount against a $0.50 cache read and $6.25 cache write.

路由決策在這裡看起來是什麼樣子

Claude Opus 5 可透過單一 OrcaRouter 金鑰取得,價格為供應商定價、0% 加價,模型代號為anthropic/claude-opus-5,而您會拿來與它比較的前沿模型,也同樣並列在這把金鑰之下。由於我們以不加價的方式直接轉傳供應商的定價,無論哪一方的價格有變動,當天就會反映在我們這邊,而不必等待重新報價。真正有意思的地方在於路由 DSL:您可以將這兩個模型組成單一次呼叫,而不是在兩者之間取捨;把工作負載的大部分送到便宜的那條通道,並將尾端任務——也就是自我檢查未通過,或符合複雜度判定條件的任務——導向昂貴的那一條。容錯移轉則是另一半。Claude Opus 5 的供應商覆蓋範圍廣泛;MiMo-V2.6-Pro 在 Artificial Analysis 收錄時,僅由單一 API 供應商提供,對於一個您會放進正式環境路徑的模型而言,這是一條單薄的路由。路由器能夠退援,才讓便宜通道得以安全採用。

值得直說,因為很容易誤以為相反:我們並不代管 MiMo-V2.6-Pro。今天要取用它,得透過 Xiaomi 自家平台,或某個將它收錄其中的第三方目錄。這裡談的路由選擇論點,是在說你如何把這類模型與我們確實有提供的模型搭配使用,而不是宣稱它是我們自家的模型之一。

該選哪一個

當任務的失敗成本遠超過 token 成本,以至於五個指數分數不過是便宜的保險時,就該選擇 Claude Opus 5——具有真實副作用的長程代理式工作、錯誤呼叫比緩慢呼叫更糟的工具使用,以及任何你已經付錢請人檢查輸出成果的情境。每指數任務 $5.86 這個數字並不是避開它的理由;那是這個等級的價格,而這個等級的存在自有其道理。

當吞吐量是限制條件時,選擇 MiMo-V2.6-Pro;當工作負載脈絡繁重且高度重複時;當你想把權重放在自己的基礎架構中時——MIT 授權允許商業部署、修改與進一步訓練——或是當你正在打造某個唯有每千個 token 五分之一美分才能讓單位經濟效益成立的東西時。它每秒 134.3 個 token 的速度,讓它在互動式使用上切實可行,而這是大多數兆級參數開源模型做不到的。

兩個都選——如果你有路由器的話,因為對「哪個比較好」最誠實的答案是:它們並不是在搶同一批請求。真正要避免的失敗模式,是代價最大的那一種:因為檯面上的比例是 21x,就把標準統一押在便宜模型上,結果第三個月才發現某一類特定請求非得用貴的那個不可,而且沒有任何路徑可以把請求導過去。第二種失敗模式則是它的鏡像——為了一份摘要工作付 Opus 5 的價錢,而 46-index 模型做出來的結果一模一樣。這兩者都不是模型問題,兩者都是配置問題,而配置正是你在某個週二下午就能改動的那個部分。