Muse Spark 1.2 對比 GPT-5.6 Luna-1
Guides & Insights

Muse Spark 1.2 vs GPT-5.6 Luna:以 4.6 倍的 Token 價格換取三個指標點

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Artificial Analysis 對這兩個模型跑了同一套九項基準測試,並留下了記錄。讓 Muse Spark 1.2 跑完這套測試花費了 637.85 美元。讓 GPT-5.6 Luna 跑完這套測試花費了 174.06 美元。就這 3.7 倍的花費差異而言,Meta 的模型領先了三分——在 Intelligence Index 上以 54 比 51 勝出。這是否是一筆划算的交易,正是問題的關鍵所在,而答案與其說取決於基準測試,不如說取決於幾乎沒有人會提及的兩件事:你的代理框架如何處理提示快取,以及你的工作負載是否需要聽或看任何內容。

下方的每個數據,要不是獨立的 Artificial Analysis 測量結果,就是即時 API 列表,或是 OrcaRouter 自身的生產遙測資料——其中最後一項值得一開始就標明,因為它與基準測試數字互相矛盾,而這矛盾本身就具有啟發性。這裡沒有任何東西是偽裝成結果的廠商說法;若某處只有廠商作為唯一來源,句子中也會明確說明。

記分板上的差距,比價格標籤所暗示的要更接近

Muse Spark 1.2 在其 xhigh 推理設定下,於 Artificial Analysis Intelligence Index 獲得 54 分,在 185 個模型中排名第 13,相對於類別中位數 32。GPT-5.6 Luna 在最大努力(max effort)下獲得 51 分。這是在 GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience 和 AA-LCR 的綜合指標上相差 3 分。

三分是真的,但幅度很小,而前一代既有的子分數說明了差距來自何處。Artificial Analysis 的各維度數據顯示,Muse Spark 1.1 的程式編寫指數為 71.3,代理指數為 37.5;GPT-5.6 Luna 則分別為 71.4 和 45.6。程式編寫方面兩者不分軒輊,而 Luna 在代理任務上領先八分——這正是 Meta 改寫 1.2 產品描述時所宣稱的維度。綜合指數因此向 Meta 方向移動了三分。目前尚無人公布 1.2 的分維度細項,因此代理差距是否真的縮小仍未得到證實。

Muse Spark 1.2 vs GPT-5.6 Luna-2

在混合令牌價格上,差距十分明顯。Artificial Analysis 的混合費率將 Muse Spark 1.2 定為每百萬個令牌 0.78 美元,而 GPT-5.6 Luna 則為 0.17 美元。標價:Muse Spark 1.2 輸入 1.25 美元,輸出 4.25 美元;Luna 輸入 0.20 美元,輸出 1.20 美元。

按工作量而非按 token 計價:一個單一編碼代理步驟讀取 60,000 個上下文 token、寫出 3,000 個輸出 token,在 Muse Spark 1.2 上花費約 8.8 美分,在 GPT-5.6 Luna 上則約 1.6 美分。每天一千個步驟,就是 88 美元對 16 美元——對單一代理迴圈而言,每年約相差 26,000 美元。

快取是差距縮小或加倍的關鍵所在

兩個模型都提供極具競爭力的快取輸入費率,且兩者之間的比率與其標價之間的比率並不相同。Muse Spark 1.2 讀取快取輸入的價格為每百萬次 0.15 美元,較其 1.25 美元的費率享有 88% 折扣。GPT-5.6 Luna 讀取快取輸入的價格為每百萬次 0.01 美元,較 0.20 美元享有 95% 折扣。

以熱快取執行同一個 agent 步驟,使用 60,000 個 token 的前綴:Muse Spark 1.2 從 8.8 美分降至約 2.2 美分。Luna 從 1.6 美分降至約 0.4 美分。絕對差距從每步驟 7.2 美分縮窄至 1.8 美分,但倍數大致維持不變——快取並不能挽救較昂貴的模型,只是讓兩者以相近的倍率變便宜。真正改變的是哪個成本項目佔主導:在快取下,Muse Spark 1.2 的成本有 59% 來自輸出 token,而非 85% 來自輸入 token,因此模型的冗長程度開始比其上下文大小更重要。

这在这里并非假设性问题。{{1}}Muse Spark 1.2 生成了 9500 万输出代币,{{/1}}通过了智能指数,而中位数仅为 6500 万。{{2}}Artificial Analysis 自己的摘要称其“有些啰嗦”(somewhat verbose)。{{/2}}{{3}}Luna 消耗了 1.3 亿代币,{{/3}}听上去更糟,但若按 1.20 美元而非 4.25 美元计算,情况就不同了。

Meta 的產品文案聲稱,提示快取可以將有效成本降低 60–80%,取決於上下文重複的程度。這是廠商的估計,而非實測數據,但上述計算結果落在這個範圍內。

延遲:基準測試顛覆真相的軸線

只看 Artificial Analysis 的延遲數據,你會認為 Muse Spark 1.2 才是反應快的那個。首次輸出 token 時間:Muse Spark 1.2 為 26.12 秒,GPT-5.6 Luna 為 126.99 秒。快了將近五倍。

上述兩者都是在各模型最昂貴的推理設定下測得的——Muse Spark 為 xhigh,Luna 為 max。兩者都不是你實際會看到的數值。在 OrcaRouter 上,根據一週真實流量中呼叫者實際要求的任何努力程度,GPT-5.6 Luna 的p50 首次輸出 token 時間為 1.84 秒,p95 為 9.68 秒。Muse Spark 1.1 呈現相同的 1.84 秒 p50,以及更緊湊的 6.00 秒 p95。目前還沒有 1.2 的生產環境遙測數據,因為它太新了。

Muse Spark 1.2 vs GPT-5.6 Luna-3

結構差異比這兩個數字都更有用。GPT-5.6 Luna 的推理功能是選配的——努力值刻度從 、低、中、高、極高一直到最高,而且你的確可以關閉思考功能來處理分類、路由或抽取。Muse Spark 1.2 的推理功能則是強制性的。刻度最低只能調到最小,而且沒有任何設定能讓你在不付出推理成本的情況下獲得權重。對於任何高流量且對延遲敏感的應用來說,這是設計上的限制,而不是可調參數。

持續吞吐量相近:Muse Spark 1.2 為每秒 165.0 個 token,Luna 為 177.9,兩者皆遠高於類別中位數 71。

每個人都會絆倒的定價腳註

GPT-5.6 Luna 的價格目前在不同地方標示不一,如果你正在建立成本模型,在引用數字之前應該先了解這點。Artificial Analysis 和 OrcaRouter 的目錄都顯示每百萬輸入 tokens 0.20 美元、每百萬輸出 tokens 1.20 美元——這是 GPT-5.6 七月份降價之後的費率,也是 Artificial Analysis 用來計算上方 $174.06 評估費用的費率。有些市集清單目前顯示 $0.10 和 $0.60,並有一個在超過 272,000 個提示 tokens 時啟動的較高費率層級。安全的做法是查閱你實際呼叫的端點上的價格,而不是比較文章中的價格。

無論適用哪種基礎費率,分級計價的細節都是真實存在的,而且確實鮮少被討論:一旦單一請求超過約 272,000 個提示詞 token,Luna 的價格就會調漲。輸入約增加一倍,輸出增加一半,快取讀取也隨之等比增加。如果你因 Luna 的 1.05M token 上下文視窗而考慮它,請注意你大約在四分之一處就會離開標題費率。Muse Spark 1.2 在全部 1,048,576 個 token 上採用單一費率,沒有長上下文附加費——對於真正長的單一請求,兩者之間的有效差距會大幅縮小。

Luna 無論付出任何代價都無法做到的事

模態差異是選擇其中一者而非另一者的最明確理由,而且它不會出現在任何排行榜上。

輸入— 根據 Meta 所列,Muse Spark 1.2 接受文字、圖片、影片、音訊和 PDF 文件。GPT-5.6 Luna 接受文字、圖片和檔案。不支援音訊,也不支援影片。如果您的流程涉及錄音或影片素材,Luna 根本不具備候選資格。

最大輸出——Luna 宣告 128,000 個 token 的完成上限。Muse Spark 1.2 的端點宣告沒有最大完成長度,這很不尋常,你應該測試它,而不是依此規劃。

知識截止日期 — Luna 的知識截止日期公布為 2026 年 2 月 16 日。Meta 未公布 Muse Spark 1.2 的截止日期,因此無論如何都要為檢索預留預算。

服務Luna 可透過多種途徑在全球範圍內使用。Muse Spark 1.2 僅由一個提供者提供服務:Meta。一個端點、一個區域政策、一個可能故障的環節。

審核——兩者都是受審核的端點。

一個關於多模態優勢的坦白提醒:Artificial Analysis 對 Muse Spark 1.2 的技術規格表僅列出其評測的文字與圖像輸入,並非 Meta 所宣傳的完整五模態介面。該 API 實際接受的能力,超出任何獨立測試所驗證的範圍。

Muse Spark 1.2 vs GPT-5.6 Luna-4

採用,因為它恰好是可以衡量的

基準測試告訴你模型能做些什麼;流量則告訴你人們信任它處理什麼。在 OrcaRouter 上為期一週的滾動期間,GPT-5.6 Luna 處理了46.794億個 token。Muse Spark 1.1 —— 同樣是 1M 上下文、指數得分相當、目錄上架時間早四周 —— 處理了440萬。這大約是一千倍的差距。

其中一部分是發行因素:Luna 在更多工具中屬於預設選項,而且在全球正式發布(GA)的時間更長;Muse Spark 系列則只在美國推出。但在同一台路由器上,兩者僅相隔一個型號字串,卻出現一千比一的差距,這就不純然是發行通路所能解釋的了。這正是 Luna 是更安全預設選擇的實際原因,而 Muse Spark 1.2 則是需要你刻意評估的對象。

值得注意的是,今天你能租用什麼、不能租用什麼:GPT-5.6 Luna 已收錄在 OrcaRouter 目錄中,價格為 $0.20 和 $1.20,與供應商自家價目表上的數字相同,因為我們收取 0% 加價,直接以供應商的目錄價格轉售。Muse Spark 1.1 也以相同基礎出現在目錄中,價格為 $1.25 和 $4.25。Muse Spark 1.2 尚未收錄在目錄中——它由 Meta 直接提供。因此,現階段要誠實地進行這項比較,最便宜的方式是使用同一個金鑰,讓 Luna 對上 Muse Spark 1.1,在兩次執行之間更改一個字串,然後等 1.2 推出後再對它重新測試。

選擇一個

選用 GPT-5.6 Luna——如果工作負載屬於高流量且以文字為主的形態:聊天、分類、擷取、路由、輕量級工具使用。它的綜合價格只有四分之一,能讓你完全關閉推理功能;其 1.84 秒的 p50 是實際量測的生產數據,而非基準測試的人為假象;而且它是背後承載著千倍實際流量的模型。三個指數點經不起這樣的算術。

選擇 Muse Spark 1.2,如果工作負載是長時程的代理式編碼——多檔案重構、長時間除錯、整個儲存庫的工作——或者涉及音訊或視訊輸入,而這些正是 Luna 根本無法匹敵的領域。對於真正龐大的單一請求,它也是更好的選擇,因為它的費率在整整一百萬個 token 內維持固定,而 Luna 的費率則在超過 272K 後逐步調升。

兩者都採用,如果你誠實面對代理系統實際是如何建構出來的。持續勝出的模式是:廉價模型處理多數例行呼叫,昂貴模型則保留給品質足以值回票價的步驟。兩個模型都位於同一個 OpenAI 相容端點後方,因此這個分流只是路由規則,而非第二個供應商關係;而且如果昂貴的那一端在執行途中故障,自動容錯移轉可確保你的評測不會默默用半個資料集毒化自己。

接下來一個月要觀察的重點是各維度的細項數據。Muse Spark 1.2 的整體訴求在於代理能力,而在上一代產品中,這正是 Luna 領先八個百分點的維度。除非有人為 1.2 發布代理指數,否則綜合得分增加三點是目前唯一能證明 Meta 已迎頭趕上的證據。

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube