
Meta Muse Spark 1.1 評測:依然是最快的那一款,但已不再便宜
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 984 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 195 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
四個星期以來,Meta Muse Spark 1.1 的賣點就是算術:每百萬輸入 token 1.25 美元,輸出 4.25 美元,而且這是個原生多模態模型,在執行工具方面比同價位幾乎任何產品都更好。接著在 2026 年 8 月 5 日,Meta 推出了 Muse Spark 1.2,同時也推出了 Muse Code——這是它的第一個終端編碼代理——並為這個新模型附加了一項 1.1 從未有的東西:貢獻者等級,輸入每百萬 token 0.10 美元,輸出 0.20 美元。輸入價格便宜十二倍,輸出便宜二十一倍,條件是讓 Meta 用你的提示詞來訓練。Muse Spark 1.1 的價格一分一毫都沒動。它的地位卻動了。
這是現在評論這款模型時必須誠實面對的框架。Muse Spark 1.1 沒有被棄用、沒有被重新定價,而且仍然是 Meta 兩個推理檢查點中速度更快、文件更齊全的那一個——但它不再是租用 Meta 模型最便宜的方式,而且 Meta 目前最用力推銷的 agent 並不能跑在它上面。這篇評測涵蓋 1.1 是什麼、它在哪些方面有可量測的優勢、八月發布改變了什麼,以及它在哪些更狹窄的工作上仍然是正確的選擇。數字若來自 Meta 自己的評估,句子會直接說明;若來自 Artificial Analysis 或生產流量,也會照實標註。
快速判決
• 它是什麼 — 一個原生多模態推理模型(文字、圖像、影片、PDF 和音訊輸入,文字輸出),具有可設定的推理強度,專為執行工具和操作電腦而設計。封閉權重,由 Meta 提供。
• 價格 — 每百萬個 token 輸入 $1.25 / 輸出 $4.25,快取命中時為 $0.15。自推出以來未調整,仍約為 GPT-5.6 Sol 輸出價格($5/$30)的四分之一,以及 Claude Opus 4.8($5/$25)的六分之一。
• 智慧 — 在 Artificial Analysis 智慧指數中獲得 51 分,在 185 個同類中排名第 22,而同類中位數為 32。這是一項獨立測量結果,並非 Meta 的宣稱。
• 優勢 — 工具使用與代理式推理,加上真正的速度:每秒 213.5 個輸出 tokens,在 Artificial Analysis 的 185 個模型中排名第 2。
• 缺點——純推理與原始編碼僅屬中等水準,長上下文記憶未達前沿,且輸出冗長:完成 Intelligence Index 需耗費 94M 輸出 token,而中位數為 65M。
• 新的注意事項 — Muse Spark 1.2 現在分數高出三分,而且在貢獻者等級上,價格只要二十分之一。1.1 剩下的優勢是延遲,而且這個優勢很大。
Meta在8月5日發布了什麼——以及它對1.1做了什麼
Muse Code 是一款終端機編碼代理程式,目前處於測試階段,可透過一行 shell 指令碼在 macOS 與 Linux 上安裝(無 Windows 版本),並以 muse 二進位檔執行。它能處理大型程式碼庫中的完整軟體工程任務:規劃變更、撰寫程式碼、驗證結果。Meta 的賣點是架構上的凝聚力——代理程式與模型是一起訓練的,而不是事後拼湊而成——而其功能清單直接鎖定 Claude Code 與 Codex:背景代理程式(在你關閉終端機後仍持續運作)、事件紀錄恢復、平行子代理程式工作樹,以及預設啟用核准機制的作業系統沙盒。Meta 為其發布的示範是一個 GPU 核心最佳化迴圈,在 NVIDIA Hopper 硬體上執行了超過 1,000 次工具呼叫,時間長達 24 小時。
Muse Code 運行的是 Muse Spark 1.2,而非 1.1。這是任何閱讀這篇評論的人首先會遇到的實際影響:如果你想要 Meta 的代理程式,你就必須使用新的檢查點。
第二個後果是定價,而這是比較有趣的一點。Meta 發布了 1.2 版本,內含兩個不同的模型 ID,而非一個:
• 標準(muse-spark-1.2)— 每百萬個代幣(tokens)輸入費用為 $1.25,快取輸入費用為 $0.15,輸出費用為 $4.25。與 Muse Spark 1.1 相同。Meta 承諾此層級的提示與完成內容不會用於改善其產品。
• 貢獻者(muse-spark-1.2-contributor)— 輸入 $0.10、快取輸入 $0.002、輸出 $0.20。作為交換,您授予 Meta 使用您的提示詞和完成內容來訓練未來模型的許可。
• Muse Spark 1.1 — 沒有貢獻者等級。它維持標準定價,且 Meta 並未宣布棄用。
Meta 自身對貢獻者層級的說明是,它「比即用即付層級還要便宜超過 10 倍」,這其實低估了它:實際倍數是輸入端 12.5 倍、輸出端 21.25 倍,而快取輸入的價格接近免費,僅 $0.002。這就是這次發布所產生的「低價」頭條,而這僅屬於 1.2。

價格故事,改寫
在您圍繞每個輸出 token 0.20 美元的價格重編預算之前,請先閱讀貢獻者層級其餘的條款,因為那些才是它之所以便宜的原因。速率限制從標準層級明文規定的每分鐘 3,000 次請求,降到貢獻者層級的每分鐘 60 次——這個上限允許開發者在筆電上進行實驗,但禁止生產環境的代理程式大軍。而且資料交換並非形式上的程序:您的提示詞和模型輸出會成為訓練素材。對於任何處理客戶資料、專有原始碼或任何受保密義務約束內容的人,貢獻者層級並非同一產品的更便宜版本;它是不同的產品。Meta 在同步發表時也承認了這點,為付費方案上的企業客戶新增了零資料保留選項。
所以誠實的比較不是「1.1 售價 $4.25 對比 1.2 售價 $0.20」。而是:在標準定價下,這兩個模型的成本完全相同,而 1.2 是得分較高的那一個。$0.20 的價位是一個真實且激進的優惠,但它針對的是個人和實驗用途,而且僅在較新的模型上提供。
實際驅動兩種模型帳單的,是快取,而不是標價費率。以一個代表性的代理步驟為例:輸入 60,000 個 token 的儲存庫或文件上下文,輸出 3,000 個 token 的規劃與回答。冷啟動時,輸入成本為 $0.075,輸出成本為 $0.013——合計約 8.8 美分,也就是一千個步驟要 $88。若保持上下文前綴穩定,使其命中快取(每百萬 token $0.15),輸入成本便會驟降至 $0.009,使每一步約為 2.2 美分,一千個步驟的總成本為 $22。這 75% 的差異,完全取決於你的代理框架是否重複使用穩定的前綴,還是每輪都重建提示詞。如果你在閱讀這篇評論後要採取一項工程行動,請優先確保快取鍵穩定性,而非模型選擇。
關於你租用它之處的一點結構性說明。Muse Spark 1.1 在 OrcaRouter 目錄中的價格為 $1.25 和 $4.25,並另有 $0.15 的快取讀取費用——與 Meta 收取的數字相同,因為 OrcaRouter 採取 0% 加價,直接轉傳提供者的列表價格,因此供應商的價格變更在當天就會同步到這裡。Muse Spark 1.2 尚未列入目錄,並由 Meta 直接提供。這對你可能即將要進行的比較很重要:GPT-5.6 Sol、Claude Opus 4.8、Grok 4.5 和 Gemini 3.1 Pro 全都以列表價格共用同一把金鑰,因此你可以在單一評估集上將它們與 Muse Spark 1.1 進行基準比較,無需第二份合約,而且你試算表上的數字就是發票上的數字。
Muse Spark 1.1 實際上是什麼
Muse Spark 是 Meta Superintelligence Labs 的旗艦推理產品線,該實驗室是 Mark Zuckerberg 在 Alexandr Wang 麾下成立的團隊。這標誌著一項戰略逆轉:Meta 的 Llama 系列模型原本採用開放權重,而 Muse 家族——包括 Spark,以及影像與影片生成器——則採封閉式,並以產品和 API 的形式交付。Spark 1.0 於 2026 年 4 月 8 日推出;1.1 於 7 月 9 日緊隨其後,與 Meta Model API 的公開預覽一同發布。對開發者而言,實際的變化在於 Meta 現在成為第一方 API 供應商,直接與兩家既有 API 供應商競爭,而不只是權重發布者——而 8 月 5 日推出的程式碼代理,正是迄今為止最明確的佐證。
版本 1.1 是一次實質性的升級,而非單純的小幅更新。在 Artificial Analysis 上,其智能指數在三個月內提升了 8 分,從 43 分升至 51 分。編碼指數上升 12 分達到 71 分,SciCode 提升至 58%,Humanity's Last Exam 則提升至 45%。Meta 表示,最大的進步體現在工具使用、電腦操作、編碼及多模態理解方面——這與一個旨在「行動」而非僅「回答」的模型特性相符。
就上下文而言,先前的混淆已告釐清:Artificial Analysis 和 OrcaRouter 都將視窗列為 1,048,576 個 token,而 Meta 描述的是模型會主動壓縮的視窗。不過,持有百萬個 token 並不等於能從中回想起內容,1.1 的長上下文檢索分數約 54.1,顯示其回憶能力僅屬普通。應將視窗視為一種容量,而非保證。
推理強度:即時、沉思,以及下方的刻度盤
在 Meta 的消費者介面上,Muse Spark 暴露兩種具名模式:Instant 在無需延伸推理的情況下立即回答,就像標準的聊天回合;Contemplating 則使用一種從強化學習借來的「思維壓縮」技術並行執行多個代理器,Meta 將它定位於在嚴苛的科學與分析工作中與 DeepMind Deep Think 和 GPT-5.4 Pro 競爭。透過 API,同樣的能力以可設定的推理努力參數呈現——Artificial Analysis 在模型最昂貴的 xhigh 設定下發布其分數。
把那個旋鈕視為成本槓桿,而不是品質滑桿。平行代理推理消耗的 token 遠比單次處理多,而你看到的基準測試數字是在最大努力下產生的。日常呼叫預設使用低端設定,將高努力保留給首次答錯代價高昂的情況。
評分方式:搭配工具時表現強勁,無工具時表現中游。
解讀 Muse Spark 1.1 最清楚的方式,是區分「開啟工具」與「關閉工具」。開啟工具時,它在代理型測試中領先:MCP Atlas 88.1 對上 Claude Opus 4.8 的 82.2、JobBench 54.7 對上 48.4、Legal Agent Bench 20.0 對上 Grok 4.5 的 12.9,以及 Humanity's Last Exam(開啟工具)62.1 對上 57.9。關閉工具時,它就表現平平——單純的 Humanity's Last Exam 大約落在 45 分,遠落後於 Gemini 3.1 Pro 在同一測試中約 77 分的成績。
在執行精確度方面,它也落後於領先者:OSWorld-Verified 電腦使用 80.8,對比 Opus 4.8 的 83.4;SWE-Bench Pro 編碼 61.5,對比 69.2;DeepSWE 1.1 長時程編碼 53.3,對比 GPT-5.5 的 67.0;BabyVision 視覺推理 76.3,對比 83.6。這些數據中有許多是廠商自行回報的,其中幾項來自 Meta 自己的評估,而且它們運行在不同的測試框架上——請將其視為方向性參考,並在您自己的任務上重新測試。

來自 Artificial Analysis 的獨立評估更為精簡且更有用。智能指數 51,在 185 個模型中排名第 22,而同類中位數為 32。速度為每秒 213.5 個輸出 token,在 185 個模型中排名第 2——這確實是一個真正的快速模型。價格排名第 31,快取命中價格為 0.15 美元,享有 88% 的折扣。冗長度方面,通過該指數需要 9400 萬個輸出 token,而中位數為 6500 萬,這正是實際帳單中相當大一部分的來源。在整個測試套件上評估它的總花費為 548.07 美元。
有一個值得留意的提醒:{{1}}Meta 標榜支援文字、圖片、影片、音訊和 PDF 輸入{{/1}},但{{2}}Artificial Analysis 針對 1.1 的技術規格卡只記錄了文字和圖片兩項評估{{/2}}。{{3}}兩者可以同時成立{{/3}}——{{4}}API 接受的功能比基準測試框架實際測試的更多{{/4}}——但{{5}}Meta 以外沒有人發表過影片或音訊工作負載的測試結果{{/5}}。{{6}}如果你是因為混合媒體分析而來到這裡,請預留時間自行驗證{{/6}}。
你該遷移到 1.2 嗎?延遲的答案
在編碼方面,Meta 表示肯定,且其數據內部一致:Terminal-Bench 2.1 從 76.2% 上升至 82.9%,DeepSWE v1.1 從 53.0% 上升至 59.3%,其內部編碼基準也從 68.3% 上升至 70.6%。這些是 Meta 自行執行的評測,在 Meta 自家的測試框架中以五次嘗試的 pass@1 計分——標準的注意事項仍然適用,即在供應商的測試框架中,競爭對手的模型往往未被充分調校。獨立地看,Artificial Analysis 將 Muse Spark 1.2 在 Intelligence Index 上的評分調整為 54,在 185 個模型中排名第 13,比 1.1 高出三分。
Meta 用來換取這些分數的是深思熟慮,而這在每一項時序測量中都顯而易見。Artificial Analysis 測得首次輸出 token 的時間,1.2 為 26.12 秒,而 1.1 為 2.90 秒——兩者皆在各自模型最高推理強度下。輸出速度從每秒 213.5 個 token 降至 165 個 token。冗長度略為上升,從 94M 增至 95M 個 token,而在相同的每 token 定價下,執行同一套基準測試的成本從 $548.07 升至 $637.85。最後這個數字最清楚說明了這項取捨:相同的價目表,多消耗了 16% 的 token,指數卻只多了三分。
請仔細解讀26秒的這個數據,因為很容易誤讀。這是 maximum effort 基準測試的測量結果,而 API 預設為中等設定。作為真實流量的參考點,OrcaRouter 上的 Muse Spark 1.1 —— 按照呼叫者實際請求的 effort 進行服務 —— 在為期一週的生產流量中,p50 首次輸出 token 的時間為 1.84 秒,p95 為 6.00 秒,錯誤率為零。maximum effort 下的基準延遲和 default effort 下的生產延遲是不同的量,兩者之間的差距通常超過一個數量級。
因此,這個決策可以根據工作負載的形態乾淨俐落地定案。如果你執行的是長時程編碼代理(coding agent),它們會把整個儲存庫保持在上下文中,並一次持續工作數分鐘,那麼 1.2 是更好的模型,而延遲成本會分攤到一個本來就不可能感覺即時的任務上。如果你提供的是任何互動式服務——聊天介面、有人類在等待的工具呼叫迴圈、以秒為單位衡量的延遲 SLO——Muse Spark 1.1 仍然是這個系列中形態更契合的模型,而且它的速度排名絕對不是捨入誤差。八月發布的一切都不會改變這點。
開發者體驗與限制
Meta Model API 仍處於公開預覽階段,不過八月的發布擴大全球存取範圍,並新增了企業級零資料保留選項。Meta 提供 OpenAI 風格的介面與 SDK 存取,而 Spark 已在 Meta AI 的「思考」模式中向消費者正式上線。速率限制現在是公開文件而非臆測——標準層級記載為每分鐘 3,000 次請求——但預覽狀態終究是預覽狀態,因此在容量受限的日子,請保留一條備援路徑。跨供應商的自動容錯移轉正是預覽級端點所需要的基礎設施,也是將預覽模型透過閘道路由不會增加成本、卻能為你多買一條路的原因。

透過 OrcaRouter,模型 ID 是 meta/muse-spark-1.1,且同時提供 /v1/chat/completions 與 /v1/responses,因此現有的 OpenAI 相容用戶端只需要一個基礎 URL 和一個模型字串,其他都不需要:
import openai as openai_client
client = openai_client.Client(base_url="https://api.orcarouter.ai/v1", api_key="YOUR_API_KEY")
= client.chat.completions.create(model="meta/muse-spark-1.1", messages=[{"role": "user", "content": "規劃並執行工具以解決此問題。"}])
print(response.choices[0].message.content)
它适合的地方——以及不適合的地方
適用範圍:工具運行與電腦操作自動化,且回應時間對使用者可見;在大規模資料上進行成本敏感的推理,而這些資料無法交給訓練集;混合文字、圖片、影片、PDF 或音訊的工作流程,並在媒體路徑上自行驗證;以及希望預設採用快速、便宜模型,並保留高階模型以處理最困難步驟的團隊。
不適合的場景:頂尖的程式碼準確度與最困難的從零開始工程(這些仍然屬於 Claude Opus 4.8 和 GPT-5.6 Sol);不使用工具的純推理問題;Gemini 3.1 Pro 領先的視覺精確度任務;長期的大型程式庫工作(現在明確屬於 1.2 和 Muse Code 的職責);以及任何需要 Meta 最便宜 token 的用途,因為該等級在此模型上並不存在。
常見問題
既然 Muse Spark 1.2 已推出,Muse Spark 1.1 現在還可以使用嗎?
是的。Meta在8月5日發佈時宣布不會棄用、也不會重新定價——1.1仍以每百萬token 1.25美元和4.25美元的價格保留在Meta Model API上,且在OrcaRouter目錄中也是相同的價格。對該發佈的報導一致將其描述為沿用現有的API定價。話雖如此,Meta的工程關注點已明顯轉移:編碼代理、新基準和低價層級都繫於1.2。
我可以在 $0.10 的貢獻者方案上取得 Muse Spark 1.1 嗎?
不。貢獻者等級是較新檢查點 muse-spark-1.2-contributor 上的一個獨立模型 ID。沒有 1.1 的對應版本,因此最便宜的 Meta 推理 token 需要更換版本——並接受每分鐘 60 次請求的上限,以及允許 Meta 使用你的提示詞和完成內容來訓練。
我應該升級到 Muse Spark 1.2 嗎?
{{1}}如果您的工作負載是長期執行的程式碼或儲存庫規模的代理任務,那麼是的:在相同標準價格下,它在 Meta 自身的程式碼評測和 Artificial Analysis 的獨立指數上都獲得較高評分。{{/1}} {{2}}如果您的工作負載是互動式或對延遲敏感的,那麼不是:1.2 用三個指數點換取約九倍的首個 Token 時間和 23% 的輸出速度,而且其推理無法停用。{{/2}} {{3}}兩者都位於同一個 API 上,因此無論如何切換都只是模型字串的差異——這是最便宜的 A/B 測試,值得在做出決定之前用您自己的流量來執行。{{/3}}
Muse Spark 1.1 是開源軟體嗎?
不,這正是這條產品線的重點。與 Meta 的 Llama 模型不同,Muse 系列採用封閉權重,以產品和 API 形式交付。Hugging Face 上沒有權重,沒有自行託管途徑,也沒有第三方供應商——Meta 是唯一提供此模型的服務方,因此具備故障轉移機制的路由層才是應對單一供應商風險的實際方案,而非依賴第二家供應商。
一個版本之後的裁決
Muse Spark 1.1 是一款快速、便宜、真正多模態的智能體模型,擅長工具使用,而在純程式設計與推理方面坦白說只是中段班。八月,它所測量到的任何面向都沒有退化。改變的是它周圍產品家族的格局:Meta 現在以相同的標準價格提供一款得分更高的模型,一個讓願意用資料交換的開發者可以享受的大幅降價層級,以及一個既無法運行於 1.1、也無法運行於任何你能指向 1.1 之系統上的代理產品。
剩下的是範圍更窄但真實的建議。如果你需要 Meta 的推理品質達到人類可感知的速度——生產環境中首個 token 只需一秒,之後每秒 213 個 token——1.1 仍是該選的版本,而 1.2 增加的三個指數點不值得九倍的等待。如果你不需要那種速度,就再也沒有太多理由留在 1.1。無論如何,它就是一個模型字串,所以誠實的建議是:在你自己的評估集上各跑一天,讓延遲預算來決定。
本文中的比較4
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
