為「Claude Haiku 5.5 對上 Xiaomi MiMo-V2.6-Flash」生成的標題卡,兩個模型名稱分列分隔線兩側,標語為「每個 token 更便宜,每項任務更便宜,但依然不是同一個決策」,置於頁尾「費率卡由供應商公布;任務成本依據 Artificial Analysis。」之上。真正的 OrcaRouter 標誌合成於右下角。
Guides & Insights

Claude Haiku 5.5 對上 Xiaomi MiMo-V2.6-Flash:當價目表與實測帳單不一致時

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

若照表面數字來看這兩份價目表,Claude Haiku 5.5 對上 Xiaomi MiMo-V2.6-Flash 看起來會是 Xiaomi 模型的一面倒大勝:每百萬個 token 是 $0.14 與 $0.28,對上 $0.10 與 $0.50,在輸出上以固定費率取得 1.8 倍優勢,而不是超過 100,000 個 token 後會級距調升的費率。接著看看獨立任務實際跑起來要多少成本,排序就翻轉了——MiMo-V2.6-Flash 完成一項任務只要 $0.06231,而 Haiku 完成同一項任務要 $0.2128,但 Haiku 在同一排行榜上得分高出 15%,而且完成任務的實際耗時只要三分之一。這四種說法都沒有錯;它們衡量的是不同事物。本文要談的是,其中哪一項能預測你的帳單,以及每一項在什麼地方不再有用。

這兩張費率卡

先從各廠商公布的數字開始,因為那些是會被拿來比較的數字,而它們大多不是真正重要的那些:

• 價格 — Claude Haiku 5.5:10 萬個 token 以內每百萬個 $0.10 / $0.50,超過則為 $0.50 / $2.50(Anthropic 定價表);Xiaomi MiMo-V2.6-Flash 均一價 $0.14 / $0.28(廠商定價表)

• 上下文視窗 — Claude Haiku 5.5 為 1,000,000 個 token,MiMo-V2.6-Flash 為 1,000,000 個,兩者皆由廠商公布

• 最大輸出 — 在 Haiku 上為 128,000 個 token(Batch 上為 300,000);未宣傳為 MiMo-V2.6-Flash 的獨立上限

• 架構 — Haiku 未公開;MiMo-V2.6-Flash 為 309B 總參數、15B 啟用參數、混合專家(Mixture-of-Experts),由廠商公布

• 授權條款 — Haiku 為封閉且僅提供 API;MiMo-V2.6-Flash 為 MIT(由廠商發布)

• 獨立指數 — Claude Haiku 5.5 為 43.395,MiMo-V2.6-Flash 則為 37.884(Artificial Analysis)

那些行中有三行決定了大多數實際購買,而且它們指向三個不同方向。在輸出價格上,X​iaomi 模型較便宜——在短上下文下為 $0.28 對 $0.50。在輸入價格上,Haiku 在低於 100,000 個 token 時較便宜,超過時則貴得多。在上下文視窗方面,X​iaomi 模型宣稱有兩倍的空間。這三者中只有一個——也就是最後那一個——才算得上是能力宣稱,而 Haiku 在 100,000 個 token 處的固定費率級距,意味著這項價格比較存在一道接縫,而單一組數字會將它掩蓋。

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Xiaomi MiMo-V2.6-Flash — the scoreboard'. Left column Claude Haiku 5.5: input price (short) $0.10 per million, output price (short) $0.50 per million, context window 1,000,000 tokens, weights closed and API-only, cost per task $0.2128, seconds per task 426. Right column Xiaomi MiMo-V2.6-Flash: input price (flat) $0.14 per million, output price (flat) $0.28 per million, context window 1,000,000 tokens, weights open under MIT, cost per task $0.0623, seconds per task 1,320. Footer reads 'Task costs and timings per Artificial Analysis; prices vendor-published.' The real OrcaRouter logo is composited bottom-right.

實測帳單

價目表為 token 定價。實際工作要花錢。Artificial Analysis 讓兩個模型執行同一套任務,並公布完成每項任務的實際花費;這與每 token 價格是不同的量,而且往往也是不同的排名:

• 每項成本 — MiMo-V2.6-Flash $0.06231 對比 Claude Haiku 5.5 $0.2128

• 每項任務的輸出 token 數 — MiMo-V2.6-Flash 77,792 對比 Claude Haiku 5.5 162,164

• 每項任務的實際耗時 — MiMo-V2.6-Flash 1,320.08 秒 vs Claude Haiku 5.5 426.26 秒

• 智慧指數 — Claude Haiku 5.5 43.395 對 MiMo-V2.6-Flash 37.884

• Terminal-Bench Hard — Claude Haiku 5.5 0.329 對 MiMo-V2.6-Flash 0.227

這五項數字全都出自 Artificial Analysis,取自該榜單本身在 2026 年 10 月初的模型頁面;當一項決策必須經得起他人查核時,這些就是該採用的數字。

每項任務的成本差距比價目表所示還大,而原因就在第二行。Claude Haiku 5.5 花費 162,164 個輸出符元來完成一項任務,而 MiMo-V2.6-Flash 只需 77,792 個就能完成——大約是 2.1 倍的符元量,主要是因為它預設會進行冗長推理。一個每輸出符元便宜 1.8 倍、且每項任務輸出符元數不到一半的模型,最終並不會只便宜 1.8 倍;在這個特定測試套件上,它最終會便宜將近一個數量級。這是本頁最重要的一件事,而沒有任何地方的價目表會公布這件事。

實際耗時卻往相反方向發展,這點值得誠實以對。MiMo-V2.6-Flash 每項任務耗費 1,320 秒,而 Haiku 為 426 秒——儘管前者測得的輸出速度較高,達每秒 56.69 個 token,耗時仍是三倍之長,因為 Haiku 的推理在這套測試集上並非瓶頸,情況不像單看原始 token 速率所預測的那樣。若某項工作負載受延遲所限,而非受成本所限,便宜模型未必就自動是正確選擇,而獨立排行榜是這兩個數字唯一並存之處。

A screenshot of the Artificial Analysis model page for MiMo-V2.6-Flash, marked 'Open weights model' and 'Released September 2026', showing its Intelligence Index rank of #8 of 117, a speed measured at 56.7 output tokens per second, and the comparison summary.

這十五點實際上究竟位於何處

43.395 對上 37.884,在 Intelligence Index 上是百分之十五的差距,而這是這場對決中最支持 Haiku 的論點。這是否重要,完全取決於任務。在 Terminal-Bench Hard 上,兩者分別是 0.329 與 0.227——相對差距更大,而且落在排行榜中偏向代理式、多步驟的那一側,在該處百分之十五的指數差距往往會複合成任務完成度上更大的差異。在一般推理與知識的子基準上,兩者比整體指數所暗示的更接近,而 MiMo-V2.6-Flash 在其中幾項上領先。

實用的解讀:在難度曲線的底部,這兩個模型可以互換,應由成本差異來決定。在頂端——長程代理、程式碼庫,以及任何失敗任務必須重新執行的情況——Haiku 的十五分是任務完成與任務花費相同金錢兩次之間的差異,而便宜模型的每任務成本優勢可能以一種排行榜平均值無法顯示的方式反轉。這就是你必須執行自己的評估,而不是閱讀別人的指標的情況,因為沒有已發布的平均值能解決這個問題。

MIT 授權條款有何價值

MiMo-V2.6-Flash 以 MIT 授權推出——這是開放授權中最寬鬆的一種,沒有商業使用上限,也沒有相同方式分享條款。這比 Qwen Community Licence 給出更強的授權,也意味著 309B/15B MoE 權重可以被任何想這麼做的人自行託管、微調與重新散布。對於限制在於推論必須跑在自己硬體上的團隊,或是用量高到擁有 GPU 勝過租用 token 的團隊而言,這不是註腳——這是比較中唯一真正重要的一行,因為 Claude Haiku 5.5 根本無法由你自行運行。

這也改變了故障樣態。由單一供應商及其雲端合作夥伴提供的閉源模型,會在他們停擺時一起停擺;而以 MIT 授權、由多個獨立主機託管的模型,則可以在這些主機之間進行容錯移轉,前提是有某個機制負責執行容錯移轉。對於只想用 API、別無他求的團隊來說,這兩點都不是選擇 MiMo-V2.6-Flash 的理由。但對於並非如此的團隊來說,兩者都是決定性因素。

值得自行查證的供應商說法

MiMo 系列是 Xiaomi 的,而 Xiaomi 在發表資料中公布自家速度與品質數據。那些是廠商數據,在撰寫本文時尚未被重現,而獨立排行榜目前測得該模型的表現低於廠商說法所指向的位置——在該指數上為 37.884,在 Terminal-Bench Hard 上為 0.227,相較之下 Haiku 為 0.329。這並不是在指控什麼;這只是廠商自家測試框架與第三方測試框架之間正常的落差,也是每次轉述數據時都應標明哪個數字來自哪一方的原因。

值得在你自己的流量上做的檢查,只需花一個下午,而且比任何排行榜都更能回答這個問題。用你自己的提示,把同樣的二十個任務跑過兩個模型,記錄每個任務在每個模型上的輸入 token、輸出 token 與實際耗時,再乘以上面的費率。決定結果的四個數字全都是你可以衡量的:輸入 token、輸出 token、秒數,以及任務是否成功。獨立榜單上的每任務成本反映的是通用測試套件的情況;你的會不一樣,而兩者之間的差異通常就是囉嗦程度,而這正是費率表所隱藏的東西。如果 Haiku 預設進行推理,替你換來原本得付費重試才能完成的任務,那麼即使每任務價格是 3.4 倍也很便宜。如果不是,你就是在為沒有改變答案的 token 付費。

透過單一端點同時取得兩者

OrcaRouter 並未提供 Claude Haiku 5.5 或 Xiaomi MiMo-V2.6-Flash;若要使用這些模型,得透過供應商自家的 API 及幾個第三方平台取得。我們實際提供的是周邊陣容:qwen/qwen3.8-flash每百萬 token 為 $0.15 與 $0.47,以及z-ai/glm-5.3-flash每百萬 token 為 $0.15 與 $0.50,兩者皆按供應商定價,並與超過 200 款模型的目錄共用同一組金鑰與同一份帳單,該目錄具備直通式定價與自動容錯移轉。

這一點對這場對決有很具體的影響:當你正在二選一的兩個模型,恰好是你無法路由的那些,勝負通常只能靠在真實流量上並排運行來決定——這意味著要讓它們和你確實在路由的模型並存可用,而且雙方都不必多簽一份合約或導入第二套 SDK。把候選模型放上正式環境的路徑,後面擺一個可用的模型當備援,讓請求送進路由層挑中的任何一個,再讓你自己的 token 紀錄產出那張價目表不肯給你的每項任務成本數字。獨立評測委員會的測試套件只是替代指標;你的工作負載才是真正的量測。

A screenshot of the OrcaRouter models index, headed 'Models — 207 models' with the line '16 providers: one API key, one bill', a filter row for input modalities, context length, input price, status, series and supported parameters, and the first steps of the 'How to call any model' walkthrough.

那通電話

如果工作負載屬於高流量、短輸出,且能容忍偶爾重試,那麼 Xiaomi MiMo-V2.6-Flash 是更便宜的模型,且差距比其價目表所標示的還要大——每項任務 $0.06231,相較之下為 $0.2128——而 MIT 授權則提供了 Haiku 所沒有的退場出口。如果工作負載屬於長程且具代理性,Claude Haiku 5.5 領先的十五個指數點以及快上三倍的任務完成速度,值得付出那樣的倍數,而且一旦把重試計算在內,成本差距就會縮小或逆轉。

唯一不該做的,就是只憑價目表來做選擇。這裡有兩個模型,每 token 的價格差距不到兩倍,但換算到每項完成的任務上,卻相差了一個數量級,而這兩個數字當中,只有一個會出現在供應商給你看的那一頁上。

超過 200 款型號的型錄

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新