繆斯代碼
Guides & Insights

Muse Code:Meta 推出了一個在自己基準測試上落敗的程式碼代理

作者

Jim Song

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

廠商通常不會公布自己排名第二的圖表。Meta 公布了其中三張。在 Muse Code 的發布簡報中——這個由 Meta Superintelligence Labs 於 2026 年 8 月 5 日發布的終端編碼代理,運行於同日推出的 Muse Spark 1.2 —— Claude Opus 5 在 Meta 選擇展示的每一張排行榜上都領先,包括 Meta 自行建構並掌控的那一張。在 Terminal-Bench 2.1 上差距為 3.8 個百分點。在 DeepSWE 1.1 上為 5.7,而 GPT-5.6 Terra 也同樣領先。在 Meta 自家的內部編碼基準測試上則為 8.8。這次發布最廣為流傳的說法——「在 DeepSWE 1.1 上獲得 59%,優於 Grok 4.5Gemini 3.6 Flash」——確實屬實,而這也是範圍最窄的真實陳述。

這讓這次發布變得更耐人尋味,而不是更無趣。Meta 發布了一份它並未勝出的基準測試簡報,但仍然照發不誤,因為分數不是它要販賣的東西。它真正賣的是能撐過 24 小時任務的運行環境,以及比整個領域低一個數量級以上的價格——前提是你願意讓 Meta 讀取你的儲存庫。以下所有基準測試數字都來自 Meta 自己的圖表,這些圖表發布時並未附上方法論;如果存在獨立的測量結果,該句會據實標明。

Meta 實際上發布了什麼

同一天發生的兩件事,刻意地聯繫在一起。

Muse Code — 一款終端編碼代理,公開測試版,一行命令即可安裝:curl -fsSL https://dev.meta.ai/install.sh | bash。僅支援 macOS 和 Linux;沒有原生 Windows 版本,沒有圖形介面,也沒有 IDE 擴充功能。Meta 將其職責描述為處理大型程式碼庫中的複雜軟體工程——規劃變更、編寫程式碼、驗證結果。

Muse Spark 1.2這是 Meta 推理模型的程式碼導向修訂版,具備 1,048,576 個 token 的上下文,可在 Muse Code 以及公開預覽的 Meta Model API 中使用。Meta 表示,他們擴大了程式碼任務的訓練算力,並拓寬了訓練環境的多樣性,目標鎖定長程工作:生成整個程式庫、重構多個檔案、進行長時間除錯。

耦合正是其主張所在。Meta 宣稱兩者經過共同訓練,因此這種配對能產生「比外部模型上的通用包裝更好的工具使用、更少的重試次數以及更高品質的輸出」。這是 Meta 的措辭,也是 Meta 的論斷;目前尚無第三方在競爭對手的框架中測試該模型,以驗證共同訓練的優勢是否屬實,抑或 Muse Spark 1.2 只是無論放在哪裡都表現得像個稱職的編碼模型。

代理程式隨附三項內建技能,它們比行銷文案更能描述預期的工作風格:/plan會在撰寫任何內容前產出需經核可的計畫,/grill對該計畫進行壓力測試,而/goal則推動朝既定目標的完成邁進。規劃、攻擊計畫、然後執行——這是經驗豐富的 Claude Code 和 Codex 使用者手動歸納出的模式,如今以頭等指令的形式隨附提供。

如實解讀基準牌組

Muse Code

Meta 發布了 Terminal-Bench 2.1、DeepSWE 1.1、其自家的 Meta Internal Coding Bench 與 GDPval 的比較結果。根據 Meta 所公布的數據:

Terminal-Bench 2.1 — Claude Opus 5 在 Claude Code 中以最大強度獲得 86.7%,Muse Spark 1.2 在 Muse Code 中獲得 82.9%,GPT-5.6 Terra 在 Codex 中獲得 81.8%,Grok 4.5 在 Grok Build 中獲得 81.6%。位居第二,而第二名至第四名之間僅差距 1.3 分。

DeepSWE 1.1 — Claude Opus 5 65.0%、GPT-5.6 Terra 64.8%、Muse Spark 1.2 59.3%。排名第三,而且是唯一一個差距具有實質性而非表面性的榜單。

Meta Internal Coding Bench — Claude Opus 5 獲得 79.4%,Muse Spark 1.2 獲得 70.6%。這是 Meta 的主場賽事,也是 Meta 輸得最慘的一次。

跨世代 — Meta 報告指出,相較於 Muse Spark 1.1,Terminal-Bench 提升 6.7 分,DeepSWE 提升 6.3 分。這些是簡報中最大的數字,也是 Muse Spark 1.1 使用者真正應該關注的數據。

有一個算術上的問題值得一提,因為這正是為何上述所有數字都只能視為參考方向。把 Meta 的 +6.7 扣除後,Muse Spark 1.1 在 Terminal-Bench 2.1 上落在 76% 左右——但公開的 tbench.ai 排行榜自 7 月底以來一直顯示 Muse Spark 1.1 為經認證的 80.0%。兩個數字都可能是誠實的,卻依然相互矛盾,因為 Terminal-Bench 的一列並不等於模型分數。它是在某個測試框架、某個模型、某個運算努力設定之下得出的分數,而 Meta 內部用於 1.1 的測試框架,並非 tbench 所執行的那個。這一個事實對跨廠商基準測試比較的殺傷力,比任何個別有爭議的數字都來得大,也直接引領我們進入下一節。

Runtime 就是產品

Muse Code

把分數拿掉之後,剩下的就是一場關於「不要死」的工程訴求。兩個機制支撐著它。

第一個是事件日誌。Muse Code 會將每一次模型呼叫、每一次工具執行、每一次核准與每一次編輯都附加到本機日誌中,Meta 將其描述為讓工作階段可精確重播且可安全重啟:終止它、讓它當機、遺失機器,代理程式都會從停止處精確恢復,而不是從頭重新推導其上下文。競爭對手擁有品質不一的當機復原能力;但沒有一家將其作為主打特色。順帶一提,它也是一份稽核工件——一份完整記錄自主流程對你的工作樹做了什麼的本機記錄,這正是資安審查所要求的文件,而大多數代理程式 CLI 都無法產生。

第二種是 Meta 所謂的非同步背景代理。它們與一般子代理的區別在於,並非每個子任務都重新生成並在結束後銷毀;而是會在整個工作階段中持續存活、自行執行後續步驟,並自行決定何時向主迴圈回報。其宣稱的優勢是更低的延遲,因為協調器不必在每次委派任務時都付出啟動成本。

Meta的支持證據是一項案例研究:Muse Code 在超過 1,000 次工具呼叫中連續運行 24 小時,在 NVIDIA Hopper 硬體上自主最佳化 GPU 核心,並達到 Meta 所稱相較於所提供基準實作的顯著改進。沒有公布加速數據,因此有趣的量不在於結果,而在於持續時間。一千次工具呼叫且無人救援,與五十次呼叫的重構,是截然不同的失效表面;在這種工作負載中,3.8 分的基準測試落差,遠不如第九小時程序是否仍在運行來得重要。

價格是武器——而其中一部分是以原始碼支付的

沒有 Muse Code 訂閱方案。計費方式是使用代幣,分為兩個等級,而兩者之間的差距是本次發布中最激進的部分:

標準版 — 每百萬個輸入 token 收費 $1.25,每百萬個快取輸入收費 $0.15,每百萬個輸出收費 $4.25。此層級的提示詞不會用於改善 Meta 的產品。

貢獻者 — 每百萬輸入 $0.10,每百萬快取輸入 $0.002,每百萬輸出 $0.20。作為交換,Meta 可能使用這些資料來改進其模型。

輸入便宜12.5倍,輸出便宜21倍,快取輸入便宜75倍。將其套用到一個實際的代理步驟——輸入60,000個tokens的儲存庫上下文,輸出3,000個tokens的規劃與修補——定價表的四個角落令人吃驚。標準層級冷提示:每一步8.8美分,每千步87.75美元。標準層級且儲存庫上下文命中快取:2.2美分,每千步21.75美元。貢獻者層級冷提示:0.66美分,每千步6.60美元。貢獻者層級熱快取:同樣的一千步只需0.72美元。

同樣的工作,成本可以是122倍,或僅為其1/122,取決於兩個選擇。Meta自家的24小時、1,000次呼叫的核心運行,在保護你資料的方案上,花費約九十美元的代幣成本,而在不保護的方案上,則不到一美元。

這正是這次發布擺在團隊面前的實際決策,而且它不是定價決策。終端編碼代理會讀取你的程式碼庫——這就是它的全部功能——因此,貢獻者方案中的提示詞包含你的原始碼、你的內部 API、你關於為何存在這個變通辦法的註解,以及你的儲存庫中碰巧含有的任何測試資源。對於業餘專案或開源程式碼樹,貢獻者方案幾乎是免費送錢。對於專有程式碼庫,或任何可觸及客戶資料的儲存庫,這是一個披著折扣外衣的授權決策,它應該放在核准資料處理的人面前,而不是放在看雲端帳單的人面前。Meta 以 12 倍的折扣為其定價,因為這些資料對 Meta 而言至少值那麼多。

無法透過API取得的內容

Muse Code

82.9% 屬於 Muse Spark 1.2,在 Muse Code 中。如果你從自己的 agent 框架呼叫這個模型,你就買了這個配對的模型那一半,而沒有 harness 那一半——沒有事件日誌,沒有持久化的背景 agent,而且如果 Meta 的共同訓練說法有任何意義,也沒有調校過的工具使用行為。所以這裡有兩個獨立的評估,把它們混為一談是本週最容易犯的錯誤:Muse Code 是否擊敗你已經在跑的 agent?Muse Spark 1.2 是否比你目前呼叫的模型更好?

第二個問題的解答成本較低,因為只需要維持你的測試框架不變,並替換底層的模型。關於可用性,值得精確說明:Muse Spark 1.2 由 Meta 直接提供,不在 OrcaRouter 目錄中。Muse Spark 1.1的價格分別是 $1.25 和 $4.25——與 Meta 的定價完全一致,因為 OrcaRouter 加成 0%,直接轉傳供應商的定價;這也說明了為什麼供應商價格變動當天就會反映在我們這邊,而不是等到合約週期結束。我們對 1.1 的七天生產環境遙測數據顯示,p50 首個 token 延遲為 1.84 秒,p95 為 6.00 秒,這比任何基準測試框架能給你的延遲預期都更有參考價值。

在像這樣的一週裡,單一閘道的實際價值在於:比較組合——Claude Opus 5、GPT-5.6 Terra、Grok 4.5、Gemini 3.6 Flash 和 Muse Spark 1.1——全部位於一把按定價計費的金鑰之後,因此進行 A/B 比較只是更換字串,而非跑採購流程。它也涵蓋了 Meta 方案中的結構性風險:Muse Spark 1.2 只有一個供應商,這使其在結構上就注定是單點故障。跨供應商的自動故障轉移,決定了 Meta 的糟糕午後是否會變成你的 agent 的糟糕午後。

這也是為什麼 1.2 版如此低調且緩慢地發布。

Muse Spark 1.2 於8月5日出現在 Meta 的 API 上,沒有任何公告,數字也沒有改變——與 Muse Spark 1.1 相同的 1M 上下文、相同的 $1.25 和 $4.25、相同的五級推理撥盤。唯一變動的是從外部測量到的結果:Artificial Analysis 測得在最大推理強度下,首次生成 token 的時間為 26.12 秒,而 1.1 為 2.90 秒,換取了 Intelligence Index 三分,從 51 分升到 54 分。若視為通用型模型的發布,這是個奇怪的交易——等待時間多出九倍,只換來三分。

作為共同訓練代理的模型半部來解讀,這是顯而易見的權衡。等待十二個檔案重構的人不會注意到二十六秒的規劃;等待聊天完成的人卻會注意到全部。Meta 並非默默推出聊天模型並希望沒人測量延遲。它是在汽車之前先推出引擎,而公告則在汽車到來時發布。Meta 的 Muse Spark 開發者頁面現在也顯示為 1.2。

其推論對任何因廣度而採用此系列的人來說是一個警訊。Muse Spark 1.1 是以多模態推理模型的形式銷售——支援文字、圖像、影片、音訊和 PDF,適合混合媒體研究。1.2 版的定位是軟體開發,其發布內容主打編碼代理。多模態介面並未被移除,但這不再是 Meta 優化或宣傳的重點,而且 Meta 以外沒有人發表過 1.2 版的影片或音訊成果。

Muse Code 仍然薄弱之處

這是測試版,並且已如此標示。Meta 以外的人尚未驗證過任何關於事件日誌保證的內容。

僅限 macOS 和 Linux。Windows 開發人員不是使用 WSL,就是完全無法開發,這對企業設備群而言是切實的限制,而非僅是不便。

僅限終端機。沒有 GUI、沒有 IDE 整合,也沒有 Codex 已提供的雲端託管平行代理。Meta 的發布資料並未提及 MCP 支援。

沒有任何已發布的方法論 是這些基準圖表背後的依據,也還沒有對 agent 或 Muse Spark 1.2 的 coding 子分數進行獨立評估。Artificial Analysis 有 1.2 的綜合指數,但沒有為 1.2 提供像 1.1 那樣的逐基準 coding 與 agentic 細項——而 1.1 的 agentic 分數是它最弱的維度,且差距懸殊,這正是能定奪本次發布的關鍵數據。

Meta 已經遲了。Claude Code 和 Codex 已有一年的使用習慣、外掛生態系統和團隊工作流程圍繞著它們建立。崩潰安全的事件日誌是嘗試新事物的好理由;但它本身並不足以成為讓團隊遷移的理由。

人們真正在問的問題

Muse Code 是免費的嗎?

不,但也沒有訂閱方案——與它所競爭的 Claude Code 和 Codex 方案不同,Muse Code 完全透過 Meta Model API 按 token 計費。因此,成本會隨著工作階段所推送的儲存庫上下文量而擴增,而非按人數計算,這對偶爾重度使用的用戶有利,卻不利於持續運作的代理。貢獻者等級的費用已接近免費,價格實際上不會構成嘗試的障礙。

貢獻者等級是否會使用我的私有程式碼進行訓練?

Meta 對該層級的條款是:資料可用於改善其模型,而編碼代理的提示詞中含有你的程式碼。Meta 表示,標準層級的提示詞不會被用於改善其產品;處理任何專有資料時都應使用該層級。請將這個選擇視為附帶折扣的資料處理決策,而非帳單偏好——並請注意,折扣是按 token 計算的,因此悄悄降級的誘因會隨著你的使用量成長而同步增加。

我可以將 Muse Spark 1.2 與 Claude Code 或我自己的代理一起使用嗎?

該模型可透過 Meta Model API 獨立於 Muse Code 使用,所以是的,任何接受自訂端點(custom endpoint)的服務都能用它。你不會得到的是 Meta 歸功於其基準測試結果的那組共同訓練配對;而且誠實的預期是,在它調校所用的測試框架之外運行的模型,分數會低於圖表上的數字。如果目標是評估模型本身而非代理(agent),請在你自己的測試框架中讓它與 Claude Opus 5 和 GPT-5.6 Terra 對比,並完全忽略那份簡報。

本週誰應該安裝它?

如果你執行長時程的自動化作業——遷移、跨 monorepo 的依賴升級,或任何目前因為代理程式會迷失方向而需要你隨時盯場的工作——Muse Code 值得你花一個下午在臨時克隆上試試。事件日誌和持久化的背景代理程式正是針對這種失敗模式所設計,而基準測試的落差在任務時長最長時最小。

如果你使用的是開源或非敏感的程式碼庫,而且成本是你的主要限制因素,那麼 contributor 等級是目前程式碼代理市場上最引人注目的數字,而每步 0.66 美分並不是打錯的。

如果你正在使用 Claude Code 或 Codex 帶領團隊處理專有儲存庫,那麼目前還沒有什麼會迫使你轉換。Muse Code 在自家供應商所選的每個排行榜上都只排第二或第三,標準層級的定價與其他產品持平而非更低,而其差異化優勢在於一項可靠度特性——這項特性除了 Meta 內部以外,尚無人測試過。值得關注的不是下一個基準測試,而是當某個不在 Meta 工作的人,透過事件日誌跑完一千次工具呼叫時,它是否還能撐住。

本文中的比較3

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

聯絡我們

加入我們的社區

DiscordEmailXGitHubYouTube