Muse Spark 1.2 對比 DeepSeek V4 Flash:四大指標換來九倍帳單
Guides & Insights

Muse Spark 1.2 對比 DeepSeek V4 Flash:四大指標換來九倍帳單

作者

Jim Song

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

72.02 美元和 637.85 美元。這些是 Artificial Analysis 將DeepSeek V4 FlashMuse Spark 1.2在相同的九個基準測試上運行所花費的金額,而這兩個模型在 Intelligence Index 上的得分相差四分——50 對 54。Meta 的模型更好,但讓它執行相同工作的成本卻高出 8.9 倍,且為封閉權重、僅由一家供應商提供,還比 DeepSeek V4 Flash 年輕五天。四分差距是否值得這一切,完全取決於你在建構什麼;而這次比較的目的,主要是讓這個問題變得可以回答。

這兩個模型在相隔不到一週內相繼推出——DeepSeek V4 Flash(build 0731)於2026年7月31日,Muse Spark 1.2於8月5日——兩者皆定位於長時程代理工作。以下所有指數分數、延遲數據與評估成本皆來自Artificial Analysis,該機構自行運行基準測試並公布帳單。若某項數字來自Meta或廠商自行發布的文件,而非獨立測試結果,文中會明確標註。

決定這點的四個數字

智慧指數 — Muse Spark 1.2 54(185 個中的第 13 名),DeepSeek V4 Flash 50(同類 101 個中的第 3 名,類別中位數為 25)。

每百萬個Token的綜合價格 — $0.78 對比 $0.06,相差十三倍。

相同九項基準測試套件的成本 — $637.85 對比 $72.02。

可在何處運行——一個供應商、封閉權重,對比六個API供應商加上可自行託管的MIT授權權重。

同一套件,兩張截然不同的帳單

評估成本欄位是兩個模型可用的最誠實成本比較,因為這是相同的工作,以每個模型自身的費率計價,且每個模型花費多少 token 由其自行決定。Muse Spark 1.2 完成 Intelligence Index 需要 637.85 美元。DeepSeek V4 Flash 需要 72.02 美元——比 Artificial Analysis 衡量過的所有其他知名模型都便宜,這項發現本身在八月初引發了一陣媒體報導。

這個差距之所以有趣,是因為它發生儘管DeepSeek V4 Flash 模型更加冗長,而不是因為這個原因。執行測試套件時,DeepSeek V4 Flash 輸出了 2.1 億個輸出 token,而 Muse Spark 1.2 輸出 9,500 萬個——是其兩倍以上。Meta 的模型在相同任務上顯著更具 token 效率,而這完全無關緊要,因為 DeepSeek V4 Flash 每百萬輸出 token 收費 0.28 美元,而 Meta 收費 4.25 美元。15 倍的價格優勢吞噬了 2.2 倍的冗長劣勢,根本不會注意到。

這是你在建構自己的成本模型時應該納入考量的一點。Token 效率是真實存在的特性,推理模型在這方面的差異可能相差數倍,但在目前的市場價差下,它只是二階項。費率表才是決定因素,只有當兩個模型在價格上差距約在 3 倍以內時,它才會翻轉。

這四個點所在之處——以及無人發表過的內容

這場對決令人不安的部分在於:Intelligence Index 是由九項評估組成的綜合指標,涵蓋代理(agents)、程式設計、一般能力與科學推理,而 Artificial Analysis 尚未公布 Muse Spark 1.2 的逐項基準細項。因此,「54 對 50」目前只是一個沒有細部分解的標題。這四分的差距可能是程式設計能力的落差、長上下文能力的落差、抗幻覺能力的落差,或是四個小落差在你實際工作負載上彼此抵銷,化為無形。

每家廠商自己的數據填補了部分空白,但彼此之間無法交叉驗證。Meta 報告 Muse Spark 1.2 在 Terminal-Bench 2.1 上達到 82.9%(高於 1.1 的 76.2%),DeepSWE v1.1 則為 59.3%(高於 53.0%)——這些結果是在 Meta 自家的測試框架上跑出來的,採用 pass@1、五次嘗試,每個受測模型都搭配其各自的 agent 產品。V4 Flash 的發布將該模型定位為一次訓練後升級,針對 agent 與終端機工作進行調校,採用 284B 總參數 / 13B 啟用參數的專家混合架構。目前沒有任何一項基準測試是兩家實驗室都發布了可比較數據的,也沒有任何第三方重現過其中任何一組結果。

獨立確立的範圍狹窄,但值得直言不諱:在單一評估者執行的一項綜合指標上,Muse Spark 1.2 以 8.9 倍的成本領先 4 分。任何比這更精細的內容,都仍屬廠商素材。

Muse Spark 1.2 有三種付款方式,DeepSeek 則有一種半。

這裡的價格比較異常棘手,因為 Meta 發佈兩張費率表,而供應商自行運送砝碼。

Meta 標準層級 — 每百萬輸入 $1.25,每百萬快取輸入 $0.15,每百萬輸出 $4.25,速率上限約為每分鐘 3,000 次請求。

Meta 貢獻者層級 — 輸入 $0.10,快取輸入 $0.002,輸出 $0.20,以允許 Meta 使用你的流量來訓練未來的 Meta 模型作為交換,速率上限為每分鐘 60 次請求。

DeepSeek V4 Flash 定價 — 輸入 $0.14、輸出 $0.28、快取命中 $0.003(98% 折扣,是同級距中所有模型裡快取費率最激進的),來自六家相互競爭的 API 供應商。

DeepSeek V4 Flash 自架 — MIT 授權的開放權重,所以價格是你自己的硬體,天花板是你自己的算力。

將第二行和第三行一起看,排名就會反轉:在貢獻者等級中,Muse Spark 1.2 是每個 token 的價格比 DeepSeek V4 Flash 更便宜,價格為 $0.10/$0.20,對比 $0.14/$0.28,同時分數高出四分。這是整個比較中最激進的定價,幾乎沒有人能夠使用它,因為每分鐘 60 次請求僅是標準預算的 2%,基本上排除了任何生產環境的扇出(fan-out)。它的定價是針對評估和小團隊工作,而你的提示詞(prompts)就是貨幣。這個取捨是否適用於你,是屬於法務部門的資料治理決策,而不是你在設定檔中替換的某個條目。

開放權重的一方則相反。MIT 權重代表價格下限完全不是由供應商設定——如果你的用量足以證明 GPU 的投資合理,就沒有人能調漲你的費率、淘汰你的模型,或更改條款。這種選擇權在 Meta 那邊無論哪個層級都沒有對應的方案。

一家供應商對比六家

Muse Spark 1.2 僅由 Meta 的 Model API 提供,別無其他管道。沒有第三方託管、沒有量化選項、沒有後備路徑,而且——在撰寫本文時——沒有 OpenRouter 的列表、沒有 Hugging Face 的儲存庫,也沒有 OrcaRouter 目錄中的條目。單一供應商的封閉模型本質上就是單點故障;而對於一個才推出五天的模型來說,並無正常運行時間紀錄可供你感到安心。

DeepSeek V4 Flash 是相反的情況。今天有六家 API 供應商提供它,權重採用 MIT 授權,而且它被收錄在 OrcaRouter 目錄中,輸入價格為 0.15 美元,輸出價格為 0.29 美元——供應商列表價格,以 0% 加價直接轉售——並在供應商之間自動故障轉移,因此單一主機衰退不會拖垮整個工作負載。這就是選擇較便宜模型的實際理由,與它的分數無關:你可以遷移它、鏡像它,或完全離開,而這些選項都不需要新的整合。

對於今日的 Muse Spark 1.2,一次評估意味著第二份合約、第二張帳單,以及第二條 SDK 路徑。Meta 的模型值得就其本身的優點來測試,但請務必清楚:運行它的營運成本不僅僅是 token 價格。

延遲,以真實流量測量

在基準測試中,Artificial Analysis 記錄到 DeepSeek V4 Flash 的首個 token 延遲為 1.33 秒,而 Muse Spark 1.2 在其 xhigh 推理設定下為 26.12 秒,輸出速度分別為每秒 103.3 和 165.0 個 token。Meta 的模型一旦開始生成,速度更快,但啟動需要很長時間——這正是以最大努力進行強制深思的典型表現。

生產數據講述了同一個故事的較溫和版本。在OrcaRouter上為期七天的實時路由中,DeepSeek V4 Flash的首個token的p50時間為439毫秒,p95為1.96秒,速度為每秒111個token,錯誤率為1.6%。Muse Spark 1.2沒有對應的生產數據,因為它尚未在任何地方路由;最接近的可用替代指標Muse Spark 1.1,其p50為1.84秒,p95為6.00秒。亞秒級中位響應是DeepSeek V4 Flash所屬的類別,而沒有任何Muse Spark版本進入該類別。

兩個模型都宣稱約一百萬個 token 的上下文——兩者皆為 1,048,576,其中 DeepSeek V4 Flash 將生成上限設為 384,000 個 token,而 Muse Spark 端點則宣稱完全沒有生成上限。就上下文而言,這場較量在紙面上打成平手,而兩者的實際表現皆未經驗證。

轉換前值得提出的三個問題

自行託管 DeepSeek V4 Flash 實際上是否比每百萬個 token 0.15 美元更便宜?

通常不會,而這正是重點。一個擁有284B參數、13B活躍參數的混合專家模型,需要強大的多GPU運算能力才能以合理的延遲提供服務,而每百萬輸入代幣0.15美元的託管價格,除非是極高且非常穩定的流量,否則很難被擊敗。對大多數團隊來說,MIT授權的價值不在於他們會自行託管——而在於他們確實可以做到,這限制了任何供應商的收費上限,並消除了棄用風險。把它視為保險,然後購買託管的代幣。

貢獻者等級是否讓 Muse Spark 1.2 成為更便宜的型號?

在價目表上,是的;但在實務上,僅限於每分鐘請求數低於 60 且你被允許捐贈其資料的工作負載。若兩個條件都成立——例如研究尖峰、內部工具、基於合成輸入的基準測試框架——那麼,在每個 token 價格更低的情況下,領先四個指數點的模型確實是更划算的購買選擇,你應該選它。若任一條件不成立,標準方案才是真實價格,而標準方案的價格是 V4 Flash 模型混合費率的 13 倍。

四個指數點聽起來很少。什麼時候會很重要?

當錯誤持續疊加。在單次分類或摘要呼叫中,四分的綜合指標差距往往難以察覺,為此支付 9 倍價格是說不過去的。但在五十步的 agent 迴圈中,每一步看似微小的成功率差異,會相乘放大成整個執行流程需要重新啟動的頻率出現巨大差異——而重新啟動付出的是整個軌跡的代價,不是一步而已。這才是 Meta 定價站得住腳的情況。同時,在這種情況下,你應該在自己的任務上實測,而不是相信綜合指標,因為沒有人公布能為 1.2 定案的 agentic 子指標。

判決,以及附帶的條件

對於幾乎所有成本是實際約束的工作負載,DeepSeek V4 Flash 是正確的預設選擇:在一個綜合指數上落後四分,混合成本便宜十三倍,生產環境中位數延遲低於一秒,六個供應商,MIT 權重,且沒有任何供應商能單方面更改條款。目前,它是已知模型中跑完整套基準測試最便宜的一個,而它達到這個地位並非因為表現不佳。

Muse Spark 1.2 只有在某一特定型態的工作中才算值得這個價格:長時程的代理式編碼。在這種工作中,失敗的軌跡代價高昂,額外的深思熟慮會被攤銷在數分鐘的工作時間裡,而非由等待中的使用者即時感受到;同時,你也能接受單一供應商,並且不需要獨立拆解這四個分數點各自由什麼組成。Meta 在四個月內推出了三個模型,並在此期間上升了十一個指數點,因此這個論點或許很快就會變得更有力——但今天,它所依賴的仍然是由廠商自行執行的編碼基準測試,以及一個綜合分數。

「如果你本週要做出選擇,請在你自己的代理迴圈上各跑五十步,並比較每美元完成的軌跡數,而非每美元的 token 數。單是這項測量,就比其中發表的每一項基準測試都更能回答這個比較。」

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

聯絡我們

加入我們的社區

DiscordEmailXGitHubYouTube