Muse Code 對比 Muse Spark 1.1:Meta 的 6.7 分升級究竟在衡量什麼
Guides & Insights

Muse Code 對比 Muse Spark 1.1:Meta 的 6.7 分升級究竟在衡量什麼

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

先做減法。Meta 為 Muse Code(其於 2026 年 8 月 5 日推出的終端編碼代理)發布的簡報顯示,它在 Terminal-Bench 2.1 上獲得 82.9%,並將此視為比Muse Spark 1.1高出 6.7 個百分點的進步——而 Muse Spark 1.1 正是大多數閱讀本文的人已經在付費使用的模型。從 82.9 減去 6.7,得到 76.2;這不是 Meta 公布的數字,但恰好就是公開的 Terminal-Bench 2.1 排行榜上 Muse Spark 1.1 在 xhigh effort 設定下的成績,該成績於七月提交,由普林斯頓大學的 mini-SWE-agent harness 執行。

這個巧合是這項比較中最有用的事實,因為 mini-SWE-agent 是刻意精簡的骨架——只有幾百行程式碼、沒有常駐子代理、沒有事件日誌、沒有規劃能力。Meta 的 82.9% 是Muse Spark 1.2運行在 Meta 與模型共同訓練的專用代理之中。如果這 6.7 分正是那兩行之間的跨度,那麼標題所稱的世代性進步就是模型升級框架升級合併成一個數字,而 Meta 沒有發表任何能將兩者分開的資料。

Meta 並未說明其 1.1 基準使用了哪種測試框架,因此這場對決僅具暗示性,而非經證實的結果。但這重新架構了目前透過 API 呼叫 Muse Spark 1.1 的所有人面前所面臨的抉擇,而這正是這場對決最誠實的版本:你並不是在兩個模型之間做選擇。你是在「你自己驅動的模型」與「替你驅動更新模型的代理」之間做選擇,而這兩者之中,只有其中一個曾由 Meta 以外的人進行過評測。

這些不是同一類別,規格表上也如此說明。

這個配對之所以讓人有半數困惑,來自於把 Muse Code 當作模型版本。它不是。它是 CLI,而 Muse Spark 1.2 才是它所稱呼的。

這是什麼—— Muse Code 是一款終端代理程式,只需一行指令即可安裝(curl -fsSL https://dev.meta.ai/install.sh | bash);Muse Spark 1.1 是一個模型端點,您可以從自己的程式碼、自己的 Agent 框架,或任何接受自訂 Base URL 的 CLI 中呼叫。

底層模型 — Muse Code 運行 Muse Spark 1.2,與代理協同訓練;Muse Spark 1.1 為 7 月世代,仍提供服務且仍列於清單中。

執行環境:Muse Code 僅支援 macOS 和 Linux,只能在終端機執行,無 GUI,無 IDE 擴充功能;Muse Spark 1.1 則可在任何支援 HTTPS 的環境中執行,包括 Windows。

輸入 — Muse Code 接收儲存庫與提示詞;Muse Spark 1.1 可在單一 1,048,576 token 的上下文中接受文字、圖片、影片、音訊與 PDF 文件,並回傳文字。

狀態 — Muse Code 是公開測試版,並已如此標示;Muse Spark 1.1 自 2026 年 7 月起正式推出,並承載真實的生產流量。

標價 — 兩者皆透過 Meta Model API 計費,標準層級每百萬輸入 token 為 $1.25,快取輸入為 $0.15,輸出為 $4.25。費率表相同。

最後一行才是讓人意外的地方,它也推翻了顯而易見的假設。採用 Muse Code 每個 token 的成本,並不會比您目前運行的方案更高。它所付出的代價是以其他貨幣衡量——平台支援、延遲、模態,以及在低價方案中,您的原始碼。這四個維度才是值得爭論的。

在接上測試治具的狀態下,讀取它們出現分歧的基準點。

Meta 發布了相對於 Muse Spark 1.1 的兩個世代差異:+6.7 分(Terminal-Bench 2.1)+6.3 分(DeepSWE 1.1)。兩者皆由供應商自行報告,皆出自以圖片形式發布、未附方法學說明的圖表,且皆未經第三方重現。若將這些數字剔除,Meta 所隱含的 1.1 基準約為 76.2% 和 53.0%。

現在,把 Meta 的 82.9% 拿來與它未引用的排行榜並列對照。在撰寫本文時,公開的 Terminal-Bench 2.1 排行榜顯示 Claude Code 搭配 Claude Fable 5 為 83.8% ± 1.2%,Codex 搭配 GPT-5.5 為 83.1% ± 1.1%,Terminus 2 搭配 Claude Fable 5 為 80.4%,Cursor CLI 搭配 Grok 4.5 為 79.3%,而 mini-SWE-agent 搭配 Muse Spark 1.1 以 76.2% 排名第八。Muse Code 自報的 82.9% 將排入第三——低於兩個在 Meta 簡報中完全沒出現的 agent-model 組合;Meta 的簡報反而是拿 Claude Opus 5 的 86.7%、GPT-5.6 Terra 的 81.8% 以及 Grok 4.5 的 81.6% 來比較(皆在最大努力的個別執行中)。

兩塊榜單、同一項基準,數字卻對不上——而如果去看Artificial Analysis,則完全是第三種尺度:其獨立的Terminal-Bench v2.1評測最高約為GPT-5.6 Sol的89.5%,而公開排行榜的天花板是83.8%。這些參與方都沒有說謊。Terminal-Bench上的一列成績,是某個評測框架、某個模型、某個effort設定、加上某個算力配額的綜合結果;只要替換其中任何一項,結果的變動就會超過Meta對其整個世代所宣稱的差距。

這就是為什麼公開排行榜上值得關注的欄位不是準確度,而是成本。Muse Spark 1.1 以 76.2% 的準確率完成運行,花費$198.05。Claude Code 搭配 Claude Fable 5 以 $552.67 獲得 83.8% 的準確率,而 Codex 搭配 GPT-5.5 則支付 $2,059.19 獲得 83.1%。這在第一種情況下是 7.6 個百分點的準確度提升,卻多花 2.8 倍的錢;第二種情況則約為 10 倍——由同一操作者、在同一任務、同一規則下衡量,這正是 Meta 的圖表無法提供的公平比較。排行榜也會對透過鑽環境漏洞解決的任務扣分;Muse Spark 1.1 的提交沒有此類扣分,而 Cursor CLI 的 Grok 4.5 運行則被扣了 9 分。

Meta 未公布其 82.9% 的成本數字。

Muse Spark 1.1 已經能做到而 Muse Code 無法做到的事

Muse Code 的賣點在於,共同訓練的代理勝過「圍繞外部模型的通用包裝」——這是 Meta 的說法、Meta 的主張,未經其他任何人驗證。這是個合理的說法。它也瞄準了 Muse Spark 1.1 特別為了填補而打造的缺口。

Muse Spark 1.1 原生支援 Model Context Protocol,無需外部框架即可自行管理 MCP 連線,內部編排主代理與子代理角色,且能零樣本泛化到新工具與自訂技能。Meta 自家發布的數據是工具使用數據:MCP Atlas 上 88.1 分,用於大規模工具使用——領先其公布的 Claude Opus 4.8 的 82.2 分與 GPT-5.5 的 75.3 分——JobBench 則為 54.7 分。這些成績均為廠商自行發布、全部來自七月、且皆未經獨立複現。但重點依然成立:1.1 不是一款事後硬掛上代理的聊天模型。把它放入 OpenCode、Cline 或任何接受自訂端點的 CLI,你今天就有一個可用的代理。

此外,還有 Muse Code 在結構上無法觸及的一切。Muse Spark 1.1 能在單一上下文視窗中對圖片、影片、音訊和 PDF 進行推理。終端編碼代理程式對這種介面毫無用武之地,也無從將其呈現。如果你的工作負載是將設計稿轉換成元件、將客服通話轉錄並分流,或是將 400 頁的規格書與實作內容交叉比對,那麼比較新的東西反而是能力較差的那個——而 Meta 對 1.2 世代的定位已從「跨混合媒體的多模態深度研究」轉向多檔案重構與整個程式碼庫的生成,而且至今沒有任何人在 1.2 上發表過影片或音訊成果。

真正的非對稱性其實是反過來的,而且它是執行期屬性,而非能力屬性。Muse Code 會將每一次模型呼叫、工具執行、核准與編輯動作附加到本機事件紀錄中,Meta 表示這讓工作階段可以完全重播且能安全重啟:就算當機,代理程式也會從中斷處繼續執行,而不是重新推導其上下文。它的背景代理程式在整個工作階段期間持續存在,而非每次子任務都重新建立再銷毀。Meta 提出的證據只有單一案例研究——在 NVIDIA Hopper 硬體上執行長達 24 小時、超過 1,000 次工具呼叫的 GPU 核心最佳化任務。他們沒有公布任何加速數據,所以執行時間本身就是其宣稱的成果。如果你曾經因為執行框架在第 300 步時忘了自己在做什麼,而失去一個九小時的遷移任務,你就會知道這是真正值得擁有的功能,而無論模型支援多少 MCP,都無法給你這項能力。

相同牌價,直到你讀到第二層級

由於標準層級在兩邊完全相同,因此在這場對比中,價格論點完全在於 Meta 隨 Muse Code 一同推出的層級。貢獻者層級的價格為每百萬輸入 token 0.10 美元、每百萬快取輸入 0.002 美元及每百萬輸出 0.20 美元——輸入便宜 12.5 倍、輸出便宜 21 倍、快取輸入便宜 75 倍——但交換條件是你明確允許 Meta 使用你的提示詞和輸出內容來訓練未來的 Meta 模型。Meta 表示,標準層級的流量不會被這樣使用。

用真實的代理程式步驟跑一遍——輸入 60,000 個 token 的儲存庫上下文,輸出 3,000 個 token 的計畫與修補——一千步的費用在標準層級冷啟動時為 $87.75,儲存庫上下文命中快取時為 $21.75,貢獻者層級冷啟動時為 $6.60,貢獻者層級搭配暖快取時為 $0.72。Meta 自己進行的 24 小時核心執行,在保護你程式碼的層級上花費接近九十美元,而在不保護的層級上則低於一美元。

這不是計費選擇。編碼代理的提示詞就是你的程式碼庫——內部 API、解釋變通方案為何存在的註解,以及你的測試夾具碰巧包含的任何內容。在開源的程式碼樹上,貢獻者等級幾乎等於免費。在專有儲存庫上,這是一個披著折扣外衣的資料授權決策,而且應該交給負責資料處理簽核的人,而不是交給盯著雲端帳單的人。Meta 將折扣設定為 12x,因為這些資料對 Meta 而言至少值那麼多。

繼續使用 Muse Spark 1.1 完全迴避了這個問題,而且值得確切知道這會付出什麼代價、代價在哪裡。Muse Spark 1.1 在 OrcaRouter 目錄中的價格是 $1.25 和 $4.25——與 Meta 的牌價分毫不差,因為我們加價 0%,直接轉傳供應商定價;這也說明了為什麼 Meta 調整價格的當天,我們這邊就會同步反映,而不是等到合約週期結束。我們對它進行的七天生產環境遙測顯示,p50 首次輸出 token 時間為 1.84 秒,p95 為 6.00 秒,這比任何基準測試工具呈現的數字都要實用得多。Muse Spark 1.2 在我們的目錄中;它由 Meta 直接提供,別無其他來源,因此這項比較中較新的這一端,目前從結構上來說就只有單一供應商,沒有故障轉移路徑。如果你正在評估它,這種單一供應商的風險,正是你評估的一部分。

發佈報導中無人提及的延遲取捨

Artificial Analysis 在每個模型的最大推理努力下獨立測量,測得 Muse Spark 1.1 的首個 token 輸出時間為2.90 秒,而 Muse Spark 1.2 的則為26.12 秒。輸出速度從每秒 213.5 個 token 降至 165 個 token。所獲得的成果是 Intelligence Index 上升了 3 分(從 51 到 54),並在 185 個模型中從第 22 名躍升至第 13 名。

若將其視為通用模型的發布,這是筆糟糕的交易——九倍的等待,只換來三分。若將其視為編碼代理的引擎,則顯然是正確選擇,因為等待十二個檔案重構的人不會注意到二十六秒的規劃時間,而等待聊天完成的人則會注意到所有延遲。這最清楚地說明了這項比較中每一方各自是為誰而設的,而且這是第三方實測的結果,而非Meta單方面的宣稱。

這也意味著,即使你只在乎程式碼,轉換也不是免費的。任何你原本指向 Muse Spark 1.1 的互動式功能——行內補全、審查機器人、文件上的聊天介面——如果費力將其遷移到 1.2 世代,都會明顯變得更糟。這次升級是有針對性的,而有針對性是有方向的。

你實際上應該執行哪一個

如果您的作業不是儲存庫,請繼續使用 Muse Spark 1.1。多模態管線、長上下文分析、混合媒體研究、任何互動式工作、任何在 Windows 上的工作、任何已透過 MCP 串接且正常運作的工作。Muse Code 的推出並未改善這些項目,而延遲量測至少會讓其中一項變得更糟。

如果你的失敗模式是執行時間過長,請試試 Muse Code。 Monorepo 遷移、相依套件升級、長達一週的重構——這些你目前必須全程盯場的工作,因為代理會失去方向。事件日誌與持續運作的背景代理正是針對這點而設計;在執行時間最長的情境中,基準測試落後幾分的影響也最小。Beta 版,請在可拋棄的克隆(scratch clone)上、選一個你丟掉也不心疼的儲存庫來試。

如果你正想決定該選哪個模型,就做這個誠實的實驗吧。 將你的評估框架(harness)保持不變,把底層的 Muse Spark 1.1 換成 Muse Spark 1.2。這樣就能隔離出 Meta 圖表混在一起的那一個變數,也是唯一能確認共同訓練溢價是否真實、或者 1.2 只是無論放在哪裡都表現稱職的程式碼模型的方法。有了單一閘道,這只是改個字串的事,而不是一場採購作業——Muse Spark 1.1、Claude Opus 5、GPT-5.6 Terra、Grok 4.5 和 Claude Fable 5 全都位於同一把 OrcaRouter 金鑰之後,按定價計費,並在供應商之間自動故障轉移,所以這組對照組合維持待命完全不花你任何成本。Muse Spark 1.2 則是例外,必須從 Meta 取得。

在安裝任何東西之前,值得先問的問題

我可以將 Muse Code 指向 Muse Spark 1.1 而不是 1.2 嗎?

Meta 的發布資料並未說明這點,而且兩者是作為共同訓練的配對一起發布的,這反而說明了它並不受支援,也並不實用。不過反向的情況則有充分記載:Muse Spark 1.1 可於任何接受自訂端點的代理程式中運作,而這正是目前大多數人將它作為代理程式執行的方式。如果你的目標是進行受控比較,請在你的測試框架中執行 1.1 和 1.2,而不是試圖遷就 Meta 的框架。

貢獻者層級是否也適用於 Muse Spark 1.1?

Meta 在推出 Muse Code 與 Muse Spark 1.2 時引入了雙層結構,其公布的價目表將貢獻者定價綁定至該版本。在 Meta 另有說明之前,請假定 12 倍折扣為 1.2 世代的方案,並將任何 1.1 工作負載定價為 1.25 美元與 4.25 美元。如果你使用的是 OrcaRouter,依定義即屬於目錄價格,因此沒有需要選擇加入或退出的資料共享層級。

那麼,6.7個百分點的說法是錯的嗎?

不——它未經審計且規格不足,這是不同的。Meta 很可能在與 Muse Code 類似的測試環境中運行其 1.1 基線,若是如此,這個增益就是乾淨的模型對模型結果。但沒有發布方法論,隱含的基線恰好落在第三方最小框架的分數上,而且同一個基準會因執行者不同而產生三種不同的量尺。請將 +6.7 視為方向性指標,並在據此規劃之前先取得你自己的數據。

「什麼能解決這件事?」

一次提交。如果 Meta 按照其他所有人提交時的相同規則——沒有修改逾時或資源、成本欄位已填寫、已套用漏洞利用扣分——將 Muse Code 放到公開的 Terminal-Bench 2.1 排行榜上,那麼 82.9% 就可以與 Muse Spark 1.1 名字旁的 76.2% 以及榜首的 83.8% 相比較,而整個爭論一個下午就能解決。在那之前,這場對決中唯一經獨立驗證的數字屬於較舊的模型,而它顯示 Muse Spark 1.1 在一個小到可以一次讀完的 scaffold 內,以不到兩百美元的成本,解決了 Terminal-Bench 2.1 的四分之三。

{{1}}第二件值得關注的事更為狹義,且來得更快:{{/1}}{{2}}亦即人工分析是否會像對 1.1 那樣,發布 1.2 世代的程式編寫與代理性子項分數。{{/2}}{{3}}代理性表現是 1.1 各項已發布指標中明顯最弱的一環。{{/3}}{{4}}這正是 Meta 聲稱已修復的數字,{{/4}}{{5}}也正是 Meta 以外尚無人測量過的數字。{{/5}}

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

聯絡我們

加入我們的社區

DiscordEmailXGitHubYouTube