Muse Spark 1.2 和 Muse Code-1
Guides & Insights

Muse Spark 1.2 與 Muse Code:Meta 四個月內推出的第三款模型,與 Grok 4.5 打成平手

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Meta 發布了Muse Spark 1.2,於2026年8月5日,也就是 Muse Spark 1.1 發布四週後、首款 Muse Spark 發布約四個月後。這個版本帶來了前兩版所沒有的東西:Meta 自家的一款程式碼代理,Muse Code,以 beta 版形式發布,並與其賴以運行的模型共同訓練。而在那個既非 Meta 也非其競爭對手所能左右的排行榜上,這次發布使 Meta 與 SpaceXAI 打成平手——Muse Spark 1.2 與 Grok 4.5 如今在 Artificial Analysis Intelligence Index 上雙雙獲得 54 分。五天後,更重大的發展到來:8月10日,Meta 表示將開放 Muse Spark 1.2 的權重——這項公告若成真,將使該模型成為目前美國最強大的開放權重模型,足以與中國模型相抗衡。

在下列任何數字具有意義之前,有兩件事值得先加以區分。Intelligence Index 分數、延遲數值與 token 計數來自 Artificial Analysis;該機構自行執行評測並公開其帳目,因此這些數據是獨立的。Meta 在公告中主打的程式設計評測結果——Terminal-Bench 2.1、DeepSWE v1.1 及一項內部基準——則由 Meta 自行在其測試框架上執行,並讓每個受測的競爭模型搭配各自的 agent 產品。這兩類數字都有參考價值,但它們並非同一種證據;本文將兩者分開看待。

Meta 實際上發布了什麼

Muse Spark 1.2 and Muse Code-2

這則公告張貼於Meta的AI研究部落格,日期為8月5日,同時涵蓋了兩項產品。

Muse Spark 1.2——這是 Muse Spark 系列專注於程式碼的更新版本。Meta 表示,他們擴大了編碼任務的訓練計算量,並拓寬了訓練環境的多樣性,同時保留了 1.1 版本主打的通用代理能力。公布的訓練目標為長程任務:生成整個程式庫、大型端對端專案,以及 Meta 所稱的「自動研究」,其中包含安排工作順序的規劃、在眾多步驟中保持方向的目標條件化,以及在會話拉長時維持相關狀態的上下文壓縮。

Muse Code — 一款處於測試階段的終端編碼代理,可透過 Meta 開發者網域上的一行 Shell 腳本安裝。它在 Meta 描述為「重播精確且可安全重啟」的本地事件日誌執行環境上,執行可跨工作階段存續的持久化非同步背景代理,並在隔離的工作樹中為每個任務協調多個子代理。它隨附三項內建技能:/plan 用於需經核准的規劃,/grill 用於壓力測試已完成的工作,以及 /goal 用於推動任務直至完成。

這種配對並非偶然。Meta 表示兩者是共同訓練的——模型是根據來自 harness 的拒絕採樣軌跡進行調校,並針對目標、壓縮與子代理做了配方最佳化。這正是產出 Claude Code 和 Codex 的同一套共同訓練手法,而這對任何閱讀基準測試數據的人來說都有一個影響:該模型最亮眼的編碼分數,是在它受訓時所用的 harness 內部取得的。這不是作弊,而是當今代理型評估的運作方式。但這確實意味著,透過其他 scaffold 取得的 1.2 分數是一個懸而未決的問題,而非一個可以安全採信的假設。

規格其餘部分與1.1版相同,而1.1版本身僅供參考。上下文長度維持在1,048,576個token。推理能力在五個努力等級中仍為強制——最低、低、中、高、xhigh——其中以中為預設;不存在任何配置能讓你在不為部分推理運算付費的情況下取得權重。推出之初權重採封閉式,未提供Hugging Face儲存庫,Meta自家的Model API是唯一可呼叫的第一方管道。如今這項安排預定改變:Meta於8月10日宣布將開放權重,推翻此前主導Muse Spark前三版發行的封閉權重政策。

43,然後是51,然後是54

Muse Spark 1.2 and Muse Code-3

Artificial Analysis 在 xhigh 推理設定下,將 Muse Spark 1.2 的 Intelligence Index 評為 54 分,在 185 個模型中排名第 13,而類別中位數為 32。該指數是九項評估的加權綜合指標——GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience 和 AA-LCR——平均分配在代理、程式設計、一般能力和科學推理之間。

以連續發展而非單一快照的角度來看,Meta 的軌跡才是真正的故事。最初的 Muse Spark 在四月獲得 43 分。Muse Spark 1.1 於 7 月 9 日達到 51 分,一個季度內進步了 8 分。Muse Spark 1.2 在不到一個月內再增加 3 分。Meta 在四個月內推進了 11 個指數點,如今其發布速度已讓評測生態系統追趕不及——1.2 至今沒有發布逐項基準的細目,也完全沒有 Design Arena 的紀錄,而 1.1 兩者皆有。

Meta以54分與Grok 4.5持平——Grok 4.5是SpaceXAI在Muse Spark 1.1發布前一天推出的模型——並落後於一個競爭激烈的前沿群體:Claude Opus 5以61分居首,Claude Fable 5以60分居次,GPT-5.6 Sol以59分緊隨其後。與榜首的差距是六到七分;與Meta年初的起點相比,差距則是十一分。這個差距能否縮小,取決於發布節奏能否維持,而Meta目前正處於四周一版的發布週期。

不過,綜合指數上的平手並不等於工作上的平手,而且值得說明這個54分能確定什麼、不能確定什麼。它確定了Muse Spark 1.2在整體能力上與Grok 4.5屬於同一檔次。它不會告訴你哪一個能寫出更好的修補程式,因為能回答這個問題的編碼子指數尚未針對1.2發布。

Meta 的編碼數字,請仔細閱讀

Meta 的公告在三張圖表中領先。在其自身的運行中,以五次嘗試的 pass@1 報告,每個競爭模型皆與其自身的代理產品配對:

Terminal-Bench 2.1 — Muse Spark 1.2 為 82.9%,高於 1.1 的 76.2%。Claude Opus 5 以 86.7% 領先。

DeepSWE v1.1 — 59.3%,較 53.0% 提升。

Meta 的內部程式碼基準 — 從 68.3% 上升至 70.6%。

這些差值才是可信的部分。Terminal-Bench 上提升6.7個百分點、DeepSWE上提升6.3個百分點,由同一團隊在同一測試框架下、以相同方式相隔一個月測量,這對於Meta最佳化目標而言,是1.2相對1.1進步多少的合理解讀。至於跨廠商的排名位置,則不必太當真:測試框架的搭配是一個很大的自由變數,而實驗室在自家模型旁邊調校自己的框架,並不可能同樣完善地調校其他所有人的框架。Meta在自己的簡報上排第二,至少不像廠商基準測試常見的形狀,但截至撰寫本文時,尚無任何第三方重現過其中任何結果。

第二份價目表

這個版本中最具影響力的事並不在基準測試圖表上。Muse Spark 1.2 隨附兩份價格清單。

標準層級 — 每百萬個輸入 token 收費 $1.25,快取命中時每百萬個收費 $0.15,每百萬個輸出 token 收費 $4.25。與 1.1 相比價格不變,分毫不差。速率上限約為每分鐘 3,000 個請求。網路搜尋 grounding 另外計費,每千次查詢收費 $2.50。

貢獻者等級 — 輸入 $0.10、快取輸入 $0.002、輸出 $0.20。這表示輸入便宜 12.5 倍,輸出便宜 21.25 倍。入場代價是允許 Meta 使用你的流量來訓練未來的模型,以及每分鐘 60 次請求的速率上限——僅為標準配額的 2%。

{{1}}以0.10美元和0.20美元的價格,Muse Spark 1.2幾乎會比市場上所有接近前沿的模型都更便宜,包括它在價格上原本不敵的開放權重預算級別。這是這次發布中有意思的數字,而這其實不是定價決策。{{/1}} {{2}}每分鐘六十次請求本身就排除了大多數的生產扇出模式,因此這個級別是針對實驗和小型團隊工作,而非用於實際服務。{{/2}} {{3}}而「我們可能會用你的流量來訓練」這個問題,該由組織中負責簽核資料治理的人來決定,而不是由負責挑選模型的人來決定。{{/3}} {{4}}把它視為附帶折扣的法律審查,而不是更便宜的SKU。{{/4}}

生產 54 的成本是多少

Muse Spark 1.2 and Muse Code-4

Artificial Analysis 發布其自身評估運行的成本,而那一欄正是 Muse Spark 1.2 樣貌顯現之處。跑完九項基準測試套件花費了 $637.85,並消耗了 9500 萬個輸出 token;相較之下,Muse Spark 1.1 在相同的每 token 定價下為 $548.07 和 9400 萬個。多出的 16% 純粹是深思。

延遲數據的變化方向相同。在 xhigh 下測量時,1.2 的首個 token 輸出時間為 26.12 秒,相比之下 1.1 只需 2.90 秒;輸出速度也從每秒 213.5 個 token 降至 165.0 個 token。Meta 用思考時間換取了三個指數點,而強制推理的設計意味著你無法拒絕這筆交易——只能選擇要承擔多少。

那個 26 秒的數字會被錯誤引用,所以在此預先更正:這是在模型提供的最高成本努力等級下測得的結果,而 API 預設為中等。作為來自真實流量(而非基準測試環境)的參考點,透過 OrcaRouter 提供服務的 Muse Spark 1.1——以呼叫者實際請求的任何努力等級——顯示 7 天的首個 token 延遲 p50 為 1.84 秒、p95 為 6.00 秒,每秒 519 個 token,錯誤率為零。最大努力等級下的基準延遲與預設努力等級下的生產延遲是兩種不同的量,通常相差一個數量級。請將 26.12 秒視為深度推理的上限,而非請求實際感受的延遲。

你今天可以在哪裡收工

Muse Spark 1.2 目前由 Meta 自家的 Model API 提供服務,截至撰寫本文時,沒有其他管道——目前仍沒有 Hugging Face 儲存庫,也未收錄在 OrcaRouter 目錄中。8 月 10 日的公告即將改變這點:Meta 表示權重將於「未來幾週」開放,而一旦開放,可用性的問題就會從「在哪裡提供服務?」轉變為「哪些權重、採用哪種授權、以及支援哪些執行環境」。Muse Spark 1.1 已收錄在 OrcaRouter 目錄中,價格為 1.25 美元和 4.25 美元——與 Meta 收費相同,因為 OrcaRouter 不收取任何加成,直接以供應商列表價格轉售。

這對比較的影響比對模型本身更大。如果你正在為這個版本建立成本模型,你會拿來做基準測試的模型——Claude Opus 5、Claude Fable 5、GPT-5.6 Sol、Grok 4.5、DeepSeek V4 Flash——都位於單一金鑰之後,按牌價計費,因此試算表上的數字就是發票上的數字,而供應商降價當天就會生效,而不是等到續約之後。具體就 Muse Spark 1.2 而言,目前的答案是 Meta 的端點、第二份合約,以及一張獨立的帳單——一旦權重釋出,自架安裝就會成為第三個選項。

8月10日發生了什麼變化?

發布五天後,Meta 對自家旗艦產品的態度出現了轉變。在 8 月 10 日發布的公告中,Meta 表示將「在未來幾週內」開放 Muse Spark 1.2 的權重,使其成為第一個團隊可以自行運行的 Muse Spark 版本。這項聲明是主管層面的表態,而非實際發布:目前還沒有 Hugging Face 儲存庫,具體日期、參數數量和授權條款均尚未確認。

賭注在於前沿權重的競賽。Muse Spark 1.2 在 Artificial Analysis Intelligence Index 上拿下 54 分——高於目前所有可下載的美國開放權重模型——因此,如果這些權重如期釋出,它將成為美國開放權重模型中最能與中國實驗室抗衡的對手,這也是祖克柏在 8 月 10 日一篇 6,500 字的文章中長篇論述的框架;他在文中指控美國對訓練資料的限制,等於把開放權重的領先地位拱手讓給了外國實驗室。這項轉向已經有了第一批成果:Muse Glimmer,一個 300 億參數的模型,於同一天以 Apache 2.0 授權釋出,由 Muse Spark 蒸餾而成,專為本地端代理(agentic)工作負載所打造。Meta 自家的基準測試顯示,它在代理任務上領先 Google 的 Gemma4-31B 和 Qwen3.6-27B;但這些數字是廠商自行測試的結果,至今尚未經獨立重現。

公告未回答的內容

沒有獨立的編碼分數。 Artificial Analysis 已發布了 1.2 的綜合指數,但尚未發布它為 1.1 所發布的編碼與代理性子指數(分別為 71.3 和 37.5)。由於代理性工作明顯是 1.1 最弱的維度,而代理性編碼正是 1.2 宣稱已修復的部分,因此這個數字將是決定此次發布成敗的關鍵。

尚未有人重現該測試平台的結果。 公告中的每項編程數據皆由 Meta 自行執行。目前尚無任何人以中立的測試框架發布 Muse Spark 1.2 的分數。

無多模態驗證。Muse Spark 的產品頁面宣稱支援文字、圖片、影片、音訊和 PDF 輸入。獨立評測僅涵蓋文字和圖片。Meta 的 1.2 訊息傳遞已幾乎完全轉向軟體工作,而 1.1 當初明確銷售所依據的多媒體用例,如今既沒有行銷推廣,也沒有衡量數據支撐。

尚無吞吐量歷史記錄。端點上的流量仍然過低,尚不足以產生常規的滾動延遲統計資料。

未來四週該看什麼

四個因素將決定這次發布是否如 Meta 所說。第一,1.2 的獨立代理評分——若 1.1 的 37.5 子指數出現重大變化,編碼能力的說法就是真的。第二,是否有人能在 Muse Code 以外重現 Terminal-Bench 的結果;只在自家測試環境中表現良好的模型,是產品而非能力。第三,貢獻者等級會如何發展:若 60 次請求的上限放寬,一個接近前沿的模型以 $0.10 輸入、$0.20 輸出的價格,將改寫預算等級的計算,遠非三分指數漲幅所能比擬。第四,權重承諾:Meta 稱 Muse Spark 1.2 的權重將「在未來幾週內」開放,而儲存庫是否如期上線——以何種授權,以及本地執行環境多快採用——將決定開放權重轉向是否屬實。

倘若節奏維持不變,Muse Spark 1.3 將於九月初推出。就目前跡象來看,它登場時該關注的數字並非指數分數,而是 Meta 能否在能力上加碼之餘,不讓每次請求前端再多出二十秒的思考時間。這項轉向的第一個成果已經問世:Muse Glimmer,一個 300 億參數的開放權重模型,Meta 於 8 月 10 日以 Apache 2.0 授權釋出,專為在本機端執行代理而設計——這是迄今最接近開源 Muse Spark 1.2 樣貌的預覽。

本文中的比較3

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新