Muse Spark 1.2 對比 Muse Spark 1.1-1
Guides & Insights

Muse Spark 1.2 對比 Muse Spark 1.1:你該升級嗎?

作者

Jim Song

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Meta 已將Muse Spark 1.1替換為Muse Spark 1.2於 2026 年 8 月 5 日,未更改價格、上下文視窗、模態清單、支援的參數或推理撥盤。因此,遷移看似免費——相同的模型字串家族、相同的計費方式,無需重新協商。但這並不免費。獨立測量顯示,新版本的首個 token 延遲為 26.12 秒,舊版本則為 2.90 秒;持續輸出為每秒 165 個 token,舊版本為每秒 213.5 個 token。你買到的是三點的實測智慧,卻要等上約九倍的時間,才會有任何回應。

這件事是否值得做,幾乎完全取決於你的任務執行了多久。以下才是真正不同的地方、完全相同的部分,以及目前還沒有人能告訴你的事。

四行文字中的決定

• 智能指數:51 → 54,由 Artificial Analysis 在各版本的 xhigh 設定下獨立測量。

• 首個 token 生成時間:2.90s → 26.12s,相同的來源、相同的條件。

• 運行相同基準測試套件的成本:$548.07 → $637.85,以相同的每 token 定價計算。額外的 16% 純粹是 token 消耗。

• 採購表單所詢問的一切事項:不變。

Muse Spark 1.2 vs Muse Spark 1.1-2

什麼是真正同一的

這值得列舉出來,因為這正是遷移在紙面上看似簡單的原因,也因為一個不存在的差異,是你無需測試的。

價格 — 每百萬個輸入 token 為 $1.25,每百萬個輸出 token 為 $4.25,快取命中時每百萬個 token 為 $0.15,每千次內建網路搜尋為 $2.50。以上所有數字在兩個版本中皆相同。

上下文 — 兩者均有 1,048,576 個 token,且皆無長上下文附加費用級別。

模態 — 文字、圖像、影片、音訊與 PDF 輸入;文字輸出。兩份列表都標榜相同的五種輸入類型。

推理轉盤 — 兩者皆為必備,提供五個等級(最低、低、中、高、極高),兩者預設皆為「中」。兩個版本皆無任何可關閉思考的設定。

參數 — tools, tool_choice, structured_outputs, response_format, reasoning_effort, include_reasoning, max_tokens, temperature, top_p, top_k, repetition_penalty。列表相同。

服務 — 兩者皆由單一提供者 Meta 本身提供,無第三方託管,無量化變體。

綜合價格——Artificial Analysis 以混合加權計算,將兩者定為每百萬個 token 0.78 美元,這正是相同費率表所預期的結果。

如果你原本期望這次升級能帶來更多上下文、輸出長度保證,或更便宜的快取,那麼並沒有。這是一個僅調整權重與後期訓練的版本,費率表直接從前一版複製貼上。

實際上移動了什麼

Artificial Analysis 目前是唯一評估過這兩個版本的獨立機構,而且它在兩者最高推理強度下進行評估,因此這個比較是對等(同級)的比較。

智力指數 — 從 1.1 的 51 分(185 個中排名第 22)升至 1.2 的 54 分(排名第 13)。在班級中位數為 32 的排行榜上躍升九個名次,這項進步換來的是實質排名,而非僅是小數點的變動。

首次 token 時間 — 2.90 秒至 26.12 秒。這是主要的回歸問題,且並非微不足道。

輸出速度 — 每秒 213.5 至 165.0 個 tokens。在 185 個模型中仍排名第 16,且 Artificial Analysis 仍將其描述為「明顯快速」,但比其所取代的模型慢了 23%。

冗長度 — 通過索引所需的輸出token為94M,與95M相比。實際上並無變化,兩者都比65M的中位數高出約45%。

評估總花費 — $548.07 至 $637.85。由於冗長度幾乎沒有變動,價格也完全沒有變化,這 16% 的增幅來自可見輸出以外的其他環節:更長的內部推理軌跡、更多次重試,或每個任務更多的工具呼叫回合。

這個模式是一致的。Meta 並沒有讓模型變得更便宜、更快或更大,而是讓模型在做出承諾前思考得更久。這額外的思考表現為延遲、略微變慢的串流,以及相同工作高出 16% 的帳單。而這所換來的,只是三個指數點。

延遲實際上有多糟糕

26.12秒這個數字會被斷章取義,所以要正確看待它:它是在xhigh下測得的,這是五個努力等級中最昂貴的一個,且所用的基準測試套件刻意設計得很難。API 預設為medium

若要了解預設的實際表現,OrcaRouter 上的 Muse Spark 1.1 —— 以真實呼叫者要求的任何努力程度為其提供服務 —— 顯示出首次 token 的 p50 時間為 1.84 秒,p95 為 6.00 秒(滾動一週內)。這是生產努力等級下的生產數據,且比基準數字低一個數量級以上。1.2 版尚無生產遙測資料。

Muse Spark 1.2 vs Muse Spark 1.1-3

所以,誠實的解讀不是「1.2 需要 26 秒才回應。」而是:在 1.2 獲得那額外三分的設定下,第一個 token 要花你 26 秒,而在同樣的設定下,舊模型只花你 3 秒。如果你本來就在用 xhigh 執行——而這正是智能提升所在的配置——那麼這就是你會繼承的數字。如果你在 medium 或更低執行,你會看到短得多的時間,而且也會看到較少的改進。

這種耦合才是此次升級中真正的陷阱。你無法只取其智慧而捨其深思,因為深思正是智慧的來源。

數字背後的重新定位

Meta 沒有為 1.2 發布推出公告——Muse Spark 的公告頁面仍描述著 1.1——但它重寫了產品描述,而重寫後的內容解釋了這項取捨。

Muse Spark 1.1 被定位為一款多模態推理模型,擁有異常廣泛的輸入介面,旨在「多模態代理、跨混合媒體的深度研究,以及長上下文分析」:長篇報告、媒體庫、錄音與影片,以及文字。

Muse Spark 1.2 的描述幾乎捨棄了那些內容,改以軟體工程為主軸——多檔案重構、長時間除錯工作階段、整個程式庫的生成——並加入了一個明確的多代理(multi-agent)主張:該模型可以扮演主要代理,負責收集脈絡、規劃與委派,也可以作為在其之下並行執行的子代理。它還聲稱,提示快取可將有效成本降低 60–80%,取決於呼叫之間有多少脈絡重複。最後那個數字是 Meta 的估算,而非實際量測結果,不過每次 $0.15 的快取費率在算術上確實可信。

將延遲迴歸與該重新定位相對照,它就不再像是個錯誤。沒有誰在重構十幾個檔案時會在乎26秒的規劃。Meta選擇了一個客戶,而那並非1.1所賣給的對象。

1.1 仍然有而 1.2 沒有的東西

四個星期的存在時間不足以累積實績,而且在三個具體方面,舊型號目前是文件記錄較完善的產品。

一項競技場紀錄。Muse Spark 1.1 在 Design Arena 已有相當豐富的歷史:在遊戲開發類別以 1334 Elo 名列第 5,在 UI 元件類別以 1334 名列第 7,在 ASCII 藝術類別以 1320 名列第 3,在資料視覺化類別為 1318,在一般程式碼類別為 1309;此外還有完整的 agents-arena 天梯,涵蓋網頁應用程式、HTML 投影片與 Godot 遊戲開發。Muse Spark 1.2 則完全沒有參賽記錄。而在 Meta 目前行銷最賣力的這個方面,新模型完全沒有任何與對手交鋒的數據。

子指數分數。 Artificial Analysis 針對 1.1 發布了 71.3 的編碼指數與 37.5 的智能體指數,但並未發布 1.2 的對應數據。由於智能體分數是 1.1 各維度中明顯最弱的一項,而智能體能力正是 1.2 聲稱要改進的地方,因此這個數字將是決定是否升級的關鍵——但它目前還不存在。

生產環境遙測數據。 1.1 已有一週的真實 p50 和 p95 延遲數據,以及在 OrcaRouter 上的 4.4M tokens 即時流量。1.2 兩者皆無;其端點目前因為流量太低而無法取樣,因此完全沒有回報任何延遲或吞吐量統計數據。

除了 Meta 之外,還有其他地方可以租用它。 Muse Spark 1.1 已在 OrcaRouter 目錄中,定價為 $1.25 和 $4.25——這是 Meta 的官方定價,以 0% 加成轉售。Muse Spark 1.2 尚未列入,因此目前是直接與 Meta 整合,僅有單一供應商,且沒有故障轉移路徑。

Muse Spark 1.2 vs Muse Spark 1.1-4

這一切並不代表 1.2 比較差。這代表支持 1.2 的證據僅包含來自單一評估者的一項綜合評分,而支持 1.1 的證據則是一個月的競技場數據、子指數與即時流量。這種不對稱性應影響你如何分階段進行遷移,而非是否要嘗試遷移。

一份真正簡短的遷移檢查清單

由於費率卡與參數表面完全相同,此交換僅是模型字串的變更。工作重點在於驗證實際變動的三個項目。

在你自己的努力設定下,量測你的首個 token 時間。不要接受 2.90 秒或 26.12 秒這兩個數字。以你實際傳遞的任何 reasoning_effort 執行真實提示詞,並直接進行比較。這一個數字就能徹底終止遷移。

檢查您的逾時和串流設定。在高強度下,首個 token 的延遲增加 9 倍,將突破針對 1.1 版調校的用戶端逾時設定,並使任何非串流整合看起來像是當機。

應根據實際測得的 token 數量重新計算成本,而非依據價目表。價格完全相同,因此任何成本變化皆屬行為層面所致。Artificial Analysis 發現相同工作量下支出增加了 16%;你是否會觀察到這種差異,取決於你的任務組合。

首先驗證快取鍵的穩定性。 在穩定的 60,000 個 token 前綴下,無論是哪個版本,典型代理程式步驟的費用都會從約 8.8 美分降至約 2.2 美分。這 75% 的變化幅度比版本變更的影響更大,而且完全由你掌控。

明確重新測試音訊與視訊路徑。兩份列表都宣稱具備相同的五種輸入模式,但 Artificial Analysis 針對 1.2 版本的規格卡僅將文字和圖像列為已評測項目。Meta 改寫了宣傳說法,使其偏離混合媒體工作。沒有任何獨立方驗證過這項能力是否仍然成立。

讓 1.1 保持可用,作為備援方案。 兩者共用同一把金鑰時,回滾就只是變更設定,而不是一場事故;這也讓你能在實際流量上對兩者進行 A/B 測試,而不是為了基準測試爭論不休。

現在誰行動,誰等待

現在就行動。如果你以高推理強度運行長期編碼代理——任務本身動輒耗時數分鐘,延遲懲罰已完全融入其中;智能增益由第三方評測,而非Meta自稱;三個指數點在此級別是顯著躍升,在185個模型的排行榜上躍升九位——

等等如果你提供的任何東西是互動式的。沒有任何配置能讓1.2比1.1更靈敏,而且強制推理意味著你無法透過停用思考來換回應速度。1.1版本在每個努力等級下仍然是更快的模型,且成本完全相同。

等等如果你的工作負載是多模態媒體分析——也就是長報告、影片和音訊的用例,1.1 正是為此明確打造並行銷的。Meta 已停止推廣它,而唯一對 1.2 的獨立評測涵蓋了文字和圖像。這項能力很可能仍然存在,但兩方面皆無證據,而 1.1 已有一個月的實證。

等等,如果你需要 arena 數據。一個以整個儲存庫生成為賣點、卻沒有 Design Arena 條目、也未發布代理式子指數的模型,是要你單憑 Meta 對其改動的說法就照單全收。再等三、四個星期,這種情況就不再成立——屆時,要依據證據而非單一綜合分數來做這個決定,會容易得多。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

聯絡我們

加入我們的社區

DiscordEmailXGitHubYouTube