Muse Spark 1.2 對比 Claude Haiku 4.5:綜合價格相同,思考理念截然相反
Guides & Insights

Muse Spark 1.2 對比 Claude Haiku 4.5:綜合價格相同,思考理念截然相反

作者

Jim Song

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Artificial Analysis 對Muse Spark 1.2的定價為每百萬個混合 tokens 0.78 美元,而Claude Haiku 4.5的定價為 0.77 美元。一分錢之差,來自兩個在其他方面毫無共識的實驗室。Meta 的模型無法停止推理;Claude Haiku 4.5 只在你要它推理時才推理。Meta 提供你 1,048,576 個 tokens 的上下文;Claude Haiku 4.5 提供你 200,000 個。Meta 於 2026 年 8 月 5 日推出這個模型,作為一個附帶終端代理的編碼模型;Claude Haiku 4.5 於 2025 年 10 月推出,作為一個由更大模型指揮的快速、廉價的工人。每個 token 的價格相同,但機器截然不同。

That coincidence is the useful place to start a comparison, because it removes the variable people usually decide on and forces the question to be about shape instead. What follows uses independent numbers where they exist — Artificial Analysis for index scores and lab latency, OrcaRouter's own seven-day production telemetry for real-traffic latency — and flags vendor-reported figures as such, including one benchmark headline of the vendor's that has no third-party counterpart.

規格對比,一次一個維度

價格 — Muse Spark 1.2 每百萬 tokens 輸入 $1.25 / 輸出 $4.25;Claude Haiku 4.5 每百萬 tokens 輸入 $1.00 / 輸出 $5.00。Meta 在輸入上較便宜,Claude Haiku 4.5 在輸出上較便宜。

Cache — 在 Muse Spark 1.2 快取命中時,每百萬次 $0.15,享 88% 折扣;在 Claude Haiku 4.5 快取讀取時,每百萬次 $0.10,享 90% 折扣;快取寫入則以 $1.25 計費。

上下文 — 1,048,576 個 token 對比 200,000 個。相差 5.2 倍,是兩者之間最大的單一差距。

最大輸出 — Claude Haiku 4.5 宣稱有 64,000 token 的上限;Muse Spark 1.2 端點則完全沒有最大完成長度限制,這點相當不尋常,值得實測而非臆測。

推理 — 在 Muse Spark 1.2 上為必選,提供五種推理努力等級,從 minimal 到 xhigh,預設為 medium;在 Claude Haiku 4.5 上則為選用,該模型在您開啟延伸思考並設定思考預算之前,屬於非推理模型。

輸入內容 — Meta 支援文字、圖片、影片、音訊和 PDF;Claude Haiku 4.5 接受文字和圖片。兩者皆回傳文字。

權重與提供者 — 兩者皆已關閉。Muse Spark 1.2 僅透過 Meta 自家的 Model API 提供服務;Claude Haiku 4.5 則可從供應商及一般雲端轉售商與聚合商取得。

年齡 — Muse Spark 1.2 才剛推出數天。Claude Haiku 4.5 自 2025 年 10 月 15 日起已投入生產,知識截止日期為 2025 年 7 月,累積了九個月的實戰經驗。

指數差距確實存在。但大家會引用的那個數字並非如此。

Artificial Analysis 在 Intelligence Index 上給 Muse Spark 1.2 打了 54 分,在 185 個模型中排名第 13。而 Claude Haiku 4.5 目前的成績則是 24 分。把兩者並列,你就得到了一個標題;但當你仔細檢視這些成績的實際內涵,這個標題就站不住腳了。

54 是 Muse Spark 1.2 在 xhigh 下評測的結果,也就是它最昂貴的推理設定。24 是 Claude Haiku 4.5 以非推理模型身分評測的結果——關閉思考——而 Artificial Analysis 將它標記為預估值,而非已完成執行的結果。在同一個指數的較早版本、也就是 v4.1 重新加權之前,Artificial Analysis 給出 Claude Haiku 4.5 在開啟推理時為 55、關閉推理時為 42。那些舊數字同樣無法與 54 相比,因為指數版本會重新縮放,v3 時代的分數並不等於 v4.1 的分數。

所以,誠實的說法比排行榜所呈現的更為狹隘:Muse Spark 1.2 以最大努力運行時,在當前指數上獲得 54 分;目前尚無 Claude Haiku 4.5 開啟延伸思考的已發布 v4.1 分數,因此這兩者在全力運作下尚無對等的比較。任何向你展示 54 對 24 的人,都是在拿全力深思的模型與被指示不要深思的模型做比較。

當供應商公布數字時,那是一個具體的數字:Claude Haiku 4.5 在 SWE-bench Verified 上得分 73.3%,這是 50 次試驗、128K 思考預算下的平均值。那是供應商的數據,而其中的思考預算對一款以速度為賣點的模型來說相當龐大——但這是業界引用於前沿模型的同一項評測,它讓 Haiku 躋身於其價格所無法暗示的檔次。Meta 對 Muse Spark 1.2 的對應宣稱是 Terminal-Bench 2.1 得分 82.9%,以及 DeepSWE v1.1 得分 59.3%,同樣由廠商自行執行,使用 Meta 自己的測試框架,每個競爭對手都與其自身的代理產品配對。兩家廠商、兩套基準測試,沒有重疊。目前沒有任何一項評測能讓這兩個模型在同一評估者之下都擁有公布的分數。

四個延遲數字,兩個不同的故事

延遲是「相同價格」框架不再只是好奇、而是開始成為決策的關鍵點,同時也是測量來源最為關鍵的地方。

在基準測試框架中,Artificial Analysis 記錄到 Muse Spark 1.2 在 xhigh 下的首次 token 時間為 26.12 秒,而 Claude Haiku 4.5 僅需 1.00 秒。這是 26 倍的差距——若這便是全貌,比較早已分出勝負。

在生產環境中,情況則反轉。在 OrcaRouter 上為期七天的實際流量中——呼叫者使用他們實際想要的任何努力程度——Claude Haiku 4.5 顯示 p50 首次輸出 token 時間為 3.84 秒,p95 為 10.00 秒,每秒 214 個 token,錯誤率為 1.0%。Muse Spark 1.1(目錄中 Meta 模型的版本)顯示 p50 為 1.84 秒,p95 為 6.00 秒,每秒 519 個 token,且無記錄到錯誤。在實際流量上,Meta 的模型是較快的那個。

這兩組數字都是真實的,但它們衡量的東西不同。實驗室數字是每個模型在冷快取下進行最大程度深思的結果,這是對天花板能力的公平測試,但對聊天框來說卻不是好的測試。生產環境數字則包含了快取命中、簡短提示、低努力等級,以及真實應用會做的所有其他事情,這是對中位數的公平測試,但對最壞情況完全沒有測試。陷阱在於引用其中一個數字,卻用另一個數字來推理。如果你在評估面向用戶的逾時設定,p95 就是你要的數字。如果你想知道一個深度代理步驟在實際時間(wall-clock)上的成本,基準測試的數字更接近真實情況——而誠實的警告是,Muse Spark 1.2 本身還沒有這樣的生產環境數字,因為它太新了,還沒有被廣泛分流。

兩個實驗室都賣給了你一個子代理。它們指的是不同的東西。

供應商對 Claude Haiku 4.5 的推銷說法在層級架構上非常明確:Sonnet 等級的模型負責規劃與編排,Haiku 實例則在底層平行執行。便宜、快速、可拋棄、一次大量部署。產品設計也遵循這個邏輯——20 萬 token 的上下文視窗對範圍限定的子任務綽綽有餘,且刻意不足以涵蓋整個程式庫;思考功能預設關閉,因為一個會深思的 worker 就是一個會消耗 orchestrator 金錢的 worker;而供應商自己的行銷也將即時聊天、客戶服務與配對程式設計列為目標應用。

Meta 對 Muse Spark 1.2 的宣傳說詞,同時宣稱了同一層級結構的兩端。Meta 的文案指出,該模型既可以作為負責收集上下文、規劃與委派的主要代理(primary agent),也可以作為在其之下平行執行的子代理(subagent)。與它一同推出的終端代理 Muse Code,在可精確重播的事件日誌執行環境中,於隔離的工作樹(worktree)內,為每個任務協調多個持續存在的子代理。百萬 token 的上下文視窗與持續在線的推理能力,是規劃者所需要的;而對於扇出(fan-out)式的工作者來說,這些恰恰是你絕不會選擇的,因為每個平行實例都在為你未曾要求的深思熟慮付出代價。

從架構而非行銷的角度來解讀,那才是真正的差異:該供應商打造了一個執行者,卻指望你自備編排者;Meta 打造了一個編排者,並宣稱它也能運作。如果你已經在運行一套階層體系,有趣的實驗不是在這兩者之間做選擇,而是讓 Muse Spark 1.2 負責規劃、Claude Haiku 4.5 負責執行——這種組合型態是任一家供應商都不會打包賣給你的。

每個真實步驟的花費是多少

每百萬token的費率在推理模型上什麼都決定不了,因為模型自己決定要花多少token。改為按步驟計價。

處理一個限定範圍的程式碼任務:輸入 60,000 個 token 的儲存庫上下文,輸出 3,000 個 token 的修補程式。冷啟動時,Claude Haiku 4.5 的輸入成本為 $0.060,輸出成本為 $0.015 — 7.5 美分。Muse Spark 1.2 的成本為 $0.075 加上 $0.013 — 8.8 美分。兩者差距小到可視為雜訊,正好符合混合費率所承諾的結果。

現在把混合費率所隱藏的部分加進來。Muse Spark 1.2 無法關閉推理功能,在其預設的中等設定下,類似這樣的步驟在修補前很可能會產生數千個推理令牌——這些都計為輸出。加上 3,000 後,同樣的步驟是 $0.075 + $0.026 = 10.1 美分,比 Haiku 在相同輸入下高出約 35%。Claude Haiku 4.5 在關閉思考時,不需要為推理支付任何費用,維持在 7.5 美分;若設定較大的思考預算,則會超過 Muse Spark 1.2,因為 Claude Haiku 4.5 每百萬輸出收費 $5.00,而 Meta 為 $4.25。

快取再次改變了重點。讓儲存庫的上下文保持穩定以命中快取,使 Haiku 的輸入成本降至 $0.006,Muse Spark 1.2 的降至 $0.009 —— 輸入端完全不再重要,整個比較變成了輸出 token 的爭奪戰,也就是比拼每個模型思考了多少。在一個重複使用上下文的工作負載中,快取鍵的穩定性比模型選擇更有價值,這對這兩個模型都成立。

1M 視窗是唯一數字湊不攏的地方。任何真正需要在單次呼叫中使用超過 200,000 個 token 的內容,無論開價多少都無法在 Claude Haiku 4.5 上執行。你要嘛分塊並編排——這是廠商的本意——要嘛改用有足夠空間的模型。

無需第二份合約即可嘗試兩者

Claude Haiku 4.5 已收錄於 OrcaRouter 目錄,價格為 $1.00 與 $5.00——這是供應商的定價,因為 OrcaRouter 採用 0% 加成,將供應商價格原封不動地轉傳,這也表示供應商一旦調整價格,我們這端會在當天立即同步生效,而非等到下一個合約週期。上述的生產環境延遲數據正是來自同一個路由層。

Muse Spark 1.2 不在目錄中。目前只有 Meta 的 Model API 可以呼叫它,因此如今要進行真正的正面比較,意味著一次整合透過我們,另一次直接與 Meta 整合。Muse Spark 1.1 是託管的,價格與 Meta 對 1.2 收取的 $1.25 和 $4.25 相同,因此它可以合理地代表該系列的成本和延遲特性,但無法代表 1.2 所宣稱的程式設計增益。當 1.2 變得可路由時,比較就變成對同一個金鑰的單行模型字串變更——而對於上述的 orchestrator-plus-worker 實驗,路由 DSL 就是將規劃器和扇出工作者整合到單一呼叫中的方式,而不是自行建構交接。

依工作的樣貌來挑選,而非分數。

選擇Claude Haiku 4.5當工作範圍明確且使用者在等待時。支援代理程式、分類、萃取、聊天、配對程式設計補全,以及代理程式階層中的平行工作者層級。它是個可靠的選擇,擁有九個月的實戰歷史;思考功能為選配,因此你只在需要時才為深思付費;200K 的上下文長度也足以應付幾乎任何有明確範圍的子任務。其公布的 SWE-bench Verified 結果顯示,它的能力遠比價格所暗示的更強大,前提是你願意投入該結果所使用的思考預算。

選擇 Muse Spark 1.2當工作單位是整個儲存庫,而非單一請求時。多檔案重構、長時間除錯、全專案生成,以及無人盯梢等待的長期代理迴圈。百萬 token 的上下文視窗解決了 Haiku 無論付出任何代價都無法克服的切塊問題;而那套對聊天而言是敗筆的強制推理,在錯誤計劃的代價高於緩慢計劃時,正是正確的預設。

決定因素不是索引編號。改問兩個問題:單次呼叫是否曾經需要處理超過 200,000 個 token?是否有真人正在等待第一個 token?第一個答「是」,指向 Meta。第二個答「是」,指向供應商。兩者皆「是」,表示你需要兩個模型——這個誠實答案出現的頻率,比任一家供應商的行銷所願意承認的更高。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

聯絡我們

加入我們的社區

DiscordEmailXGitHubYouTube