
Muse Spark 1.2 對比 GLM 5.2:封閉的編碼者與開放的通用型
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72程式
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75程式
- obsidian新Qwen3.8 27B2026-08-1552智能68程式
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grokSpaceXAI: Grok 4.62026-08-1261智能77程式
- metaMeta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
兩個都具備 100 萬 token 上下文視窗的模型,每百萬 token 的定價相差不到十五美分,同樣鎖定以寫程式為主的代理(agent)任務——但除此之外,兩者幾乎毫無共通點。Muse Spark 1.2由 Meta 於 2026 年 8 月 5 日與共同訓練的終端代理 Muse Code 一同發表,採用封閉權重,每個 token 的價格更低,在現行 Artificial Analysis Intelligence Index 中獲得 57 分,且須先推理才能回覆。GLM 5.2是 Z.ai 六月中旬推出的旗艦開放權重模型,採用 MIT 授權、可自行部署,產生第一個 token 的速度約快五倍,而且經由我們閘道傳送的真實流量仍是前者的四倍半——過去七天共 2.13 億個 token,對照 Muse Spark 1.2 的 4,600 萬個。分數較高、每個 token 也較便宜的模型,流量反而較少;真正被人們實際路由的,是開放的那一個。
這篇文章要講的是該事實的誠實版本。評分與定價的決定性,不如模型對你的流程管線的契合度來得高;而在每個決定契合度的軸線上,這兩者的選擇恰恰相反。凡有獨立數據存在,皆出自 Artificial Analysis;凡出自 Meta 或 Z.ai 者,皆標示為廠商自報;延遲與流量數據則為 OrcaRouter 自身的七天生產環境遙測資料。
規格對比,一次一個維度
• 價格 — Muse Spark 1.2 每百萬個 token 輸入 $1.25 / 輸出 $4.25,快取命中時 $0.15;GLM 5.2 輸入 $1.40 / 輸出 $4.40,快取時 $0.26。Meta 每一列都比較便宜。
• 上下文——皆為 1,048,576 個 token。最大輸出:Meta 記載 Muse Spark 1.2 的上限為 131,072 個 token;GLM 5.2 則宣告為 128,000。
• 推理 — Muse Spark 1.2 的推理為強制功能,涵蓋五種努力等級(minimal 至 xhigh,預設為 medium);GLM 5.2 則以 high 或 max 的 reasoning_effort 執行混合推理,並預設開啟深度推理。
• 輸入 — Muse Spark 1.2 支援文字、圖片、影片、音訊及 PDF 輸入;GLM 5.2 則為文字輸入、文字輸出。
• 權重 — Muse Spark 1.2 是閉源的,沒有儲存庫,也沒有自架路徑;GLM 5.2 則以 MIT 授權釋出開放權重,這是一個 753B 參數的混合專家(Mixture-of-Experts)模型,每個 token 約有 40B 參數啟用。
• 年齡 — Muse Spark 1.2 在撰寫本文時才推出三天;GLM 5.2 自 6 月 13 日起已投入生產,累積八週的實戰經驗,並擁有圍繞其打造的完整主機與工具生態系統。
指數差距為四點。版本陷阱確實存在。
Artificial Analysis 目前的智慧指數(v4.1.1)將 Muse Spark 1.2 評為 57 分,在 185 個模型中排名第 12;GLM 5.2 則獲得 53 分——這是排行榜上開放權重模型的最高分,但仍落後四分。多數報導仍引用 Muse Spark 1.2 的 54 分,因為那是發布當日評測的數據;v4.1.1 重新評分為其增加了 2.7 分,是該次更新中所有模型裡增幅最大的。如果你在任何地方看到「54 對 51」或「54 對 53」,在把差距當真之前,請先確認每個數字各自屬於哪個指數版本。
值得說明四分的差距代表什麼、又不代表什麼。它代表在九項基準的綜合評比中,Meta 的封閉模型以相近的投入程度領先 Z.ai 的開放模型。它並不代表 Muse Spark 1.2 在所有方面都勝過 GLM 5.2,因為兩個模型是透過不同路徑取得分數的。GLM 5.2 在數學與推理方面表現異常突出——AIME 2026 達到 99.2——但眾所周知它相當冗長,弱點在於深入的儲存庫規模任務。Muse Spark 1.2 則呈現相反的樣貌:擅長終端機程式碼與多檔案任務,而且每次任務的評估成本大幅降低,因為它在思考過程中消耗的 token 少得多。

基準實際分歧之處
在 Terminal-Bench 2.1 上,兩者的差距比指數差距所顯示的更小,而且資料來源比平時更為重要。在同一個 Artificial Analysis 測試框架上,Muse Spark 1.2 得分 80.1,GLM 5.2 得分 77.9。Meta 聲稱 Muse Spark 1.2 在其自有測試框架上得分 82.9;Z.ai 報告的 GLM 5.2 最佳成績為 82.7,這使其成為該基準測試中首個得分超過 80 的開放權重模型。同一個基準測試,四個不同的數字——測試框架的搭配會讓這些分數上下移動數分,因此請將任何單一 Terminal-Bench 的宣稱視為一個區間。
值得關注的分歧在於 DeepSWE 1.1,這項基準測試考驗的是在長時間智慧體迴圈中進行深度、多檔案、儲存庫規模的推理能力。Meta 報告 Muse Spark 1.2 得分 59.3——這是廠商提供的數據,尚未有第三方複現。GLM 5.2 公布的 DeepSWE 得分為 46.2,而其前代 GLM-5.1 僅為 18.0,因此這是 Z.ai 進步最多卻仍居落後的面向。如果你的工作負載是「連貫地修改五十個檔案」,這個差距就是全部重點;如果你的工作負載是終端指令和搭建框架,那它幾乎無足輕重。
還有一項發現推翻了顯而易見的定論。獨立的 Vals AI 測試套件按領域執行代理工作負載,將 Muse Spark 1.2 的整體排名列為第五,得分 71.88%——並在 Finance Agent、TaxEval 和 Harvey's Legal Agent 基準測試中均名列第一,分別與 44、136 和 31 個模型比較——而 Terminal-Bench 2.1 只是它在五十個領域中排名第十四的領域。Meta 將這款模型定位為程式設計模型,但獨立評估者發現它在金融、稅務和法律文件代理方面最強。如果你的團隊撰寫合約或核對分類帳,那就是本文中最有用的一個數字。
「開放權重的問題才是真正的分岔點。」
以上所述皆關乎能力。而這個決定主要涉及所有權,在這一點上,兩者可說是大相逕庭。
GLM 5.2 是採用 MIT 授權的開放權重。這改變的不只是帳單,更是談判的籌碼:如果工作負載涉及敏感資料或用量龐大,你可以自行託管;因為權重屬於你,你可以在不同供應商之間轉移,無需重新整合;而任何提供路由服務的主機都必須在價格和延遲上競爭,這就是開放權重產品線會隨時間越來越便宜的原因。753B MoE 不是能在筆電上執行的模型——大多數團隊仍會選擇租用而非自行運行——但無論是選擇離開,還是以固定成本在內部運行相同權重,都為任何供應商能向你收取的價格設下了下限。
Muse Spark 1.2 選擇的是相反的配套方案。權重是封閉的,唯一的第一方途徑是 Meta 的 Model API,而我們現在也將其納入路由。作為交換,你拿到的是共同訓練的產品:Muse Code——隨模型一同推出的終端代理——以拒絕採樣產生的 harness 軌跡進行調校,並在重放精確的事件日誌執行環境中運行持久、可安全重啟的子代理,內建 /plan、/grill 和 /goal 技能。這與「你把一個好模型接進自己的 harness」是截然不同的事物——它是一個開箱即用的代理。代價是它只能以 Meta 的方式、在 Meta 的工具中、於 macOS 或 Linux 上運作,目前沒有 Windows 用戶端、沒有 MCP,也沒有 IDE 外掛程式。

每個令牌的價格,每個任務的價格
就每個 token 而言,Muse Spark 1.2 在輸入和輸出上都更便宜,而且由於它也是較不冗長的模型,因此每個任務的成本也較低。Artificial Analysis 測得 GLM 5.2 在推出時執行 Intelligence Index 就耗費了 1.41 億個輸出 token,其中 95% 是推理 token——是榜上最冗長的領先模型。Muse Spark 1.2 在同樣的測試中耗費了 9500 萬個 token,每個任務成本為 0.40 美元。更多 token 加上更高費率,代表 GLM 5.2 的每任務成本會以清單價格所隱藏的方式複合增長,而這才是比較推理模型的正確方式:為完成的任務定價,而不是為百萬 token 的費率定價。
還有第三種價格,只有這些型號中的一個有。Muse Spark 1.2 提供一個貢獻者層級,輸入 $0.10 / 輸出 $0.20 —— 比標準層級低一個數量級,也比 GLM 5.2 的牌價低類似的幅度。入場的代價是允許 Meta 使用你的流量來訓練未來的模型,加上每分鐘 60 次請求的上限,這排除了生產環境的扇出。把它視為附帶折扣的法律審查,而不是更便宜的 SKU;對於一個符合資格且在上限內運作的團隊,它讓價格比較不再接近。
延遲:這兩個模型反轉。
如果索引差距有利於 Meta,那麼在延遲表現上,GLM 5.2 在體感上獲得了決定性的勝利。在 OrcaRouter 上過去七天的真實流量中,Muse Spark 1.2 的首個 token 延遲 p50 為 8.13 秒,p95 為 10.00 秒,然後以每秒 576 個輸出 token 的速度飛馳,錯誤率為零。GLM 5.2 的 p50 為 1.55 秒——首個 token 快了五倍以上——但輸出速度僅有每秒 78.5 個 token,錯誤率為 0.16%。在實驗室以最大努力測試時,差距進一步擴大:Artificial Analysis 測得 Muse Spark 1.2 在 xhigh(其最昂貴的推理設定)下,首個 token 的延遲為 26 秒。
「所以,一種模型讓你等待之後快速回應;另一種則立即開始但慢慢來。只要是有人類在等待觀看的場景——例如一輪聊天、一個互動終端工作階段——GLM 5.2 的體驗更好,這就是為什麼它在我們閘道上的互動流量中佔主導地位。而對於長時間生成、大型修補程式或文件草稿,Muse Spark 1.2 一旦開始就會率先完成,因為它的輸出速率是 GLM 5.2 的七倍。如果你衡量了錯誤的數據,就會因為錯誤的理由選錯模型。」
無需第二份合約即可嘗試兩者
兩個型號都在 OrcaRouter 目錄中,以供應商目錄價格供應 — Muse Spark 1.2 為 $1.25 和 $4.25,GLM 5.2 為 $1.40 和 $4.40 — 因為 OrcaRouter 以 0% 加成的方式轉傳供應商價格。這使得上述定價部分是以發票為準,而非標價;也代表在兩者之間切換,只需在相同的金鑰之下變更模型字串中的一行,而不是重新進行整合。如果供應商調降價格,降幅會在當天反映在我們這邊。
路由層之所以在這裡能大顯身手,正是因為這兩個模型互為互補。Muse Spark 1.2 的弱點是首個 token 生成慢,且規模化後價格高昂;GLM 5.2 的弱點則是冗長囉嗦,以及深度儲存庫推理能力不足。一條路由規則,將規劃階段交給 Muse Spark 1.2,將並行 worker 的 fan-out 交給 GLM 5.2——或是在 Muse Code 端點變慢時自動故障轉移到 GLM 5.2——不需要額外成本,因為兩者都位於同一個端點之後。而對於一個誕生僅三天的模型,自動故障轉移正是讓你在不把生產路徑押注在它身上的前提下,試用它的方式。

該由誰來選擇哪一個
請選擇 Muse Spark 1.2,當工作單元是大型、連貫的工件,且有人可以等待幾秒鐘讓它啟動時:多檔案重構、整個儲存庫生成、長代理迴圈,以及——根據 Vals AI 的說法——金融、稅務和法律文件工作。DeepSWE 的領先地位、高輸出率和貢獻者等級都指向同一方向。您接受的是封閉權重、Meta 的工具和較慢的第一個 token,而且您應該將 Meta 的 82.9 和 59.3 視為主張,而非事實。
選擇GLM 5.2,當擁有權與操作感受比綜合分數更重要時:開放權重讓你可以自行託管或遷移、快速的首個 token 利於互動工作、已有可搭配使用的工具與生態系統,以及目前最強的開放權重通用能力。接受其冗長、46.2 DeepSWE,以及即使在計算 token 數量差異之前,每 token 定價就已更高的列表價格。
大多數團隊會發現,誠實的答案是兩者皆非。開放的那個是主力,你將大部分流量導向它;封閉的那個是專家,你用於深度任務與敏感文件。綜合指數上只差四個點,但在誰掌握權重上卻天差地遠——這才是選擇的關鍵,而且遠比分數來得清晰。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
