Muse Spark 1.2 對比 Claude Fable 5
Guides & Insights

Muse Spark 1.2 對比 Claude Fable 5:六個指數點的實際成本

作者

Jim Song

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Artificial Analysis 發布了多數基準測試表遺漏的資訊:它花費了多少。運行其九項評估的 Intelligence Index,花費$637.85Muse Spark 1.2,以及$5,630.52Claude Fable 5。相同的基準測試套件、相同的測試框架,但一份帳單是另一份的 8.8 倍。Fable 5 得分 60,而 Muse Spark 1.2 得分 54。

將差異相除,就能得到這個比較真正攸關的數字:在那個工作負載上,最後六點智能的成本約為 $832每點。該不該付這筆錢,不是基準測試的問題;而是你的流量中有多少比例真正需要這些點,而對大多數團隊來說,答案是既小又可明確識別的一部分。

邊際指數點有其代價,而且代價高昂。

兩組數據皆出自同一位獨立評測方,使用同一套綜合評測組合——GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience 與 AA-LCR。兩者皆非廠商宣稱。Fable 5 在 185 個模型中排名第 3;Muse Spark 1.2 排名第 13,而同類模型中位數為 32。兩者都遠高於平均;但僅有一個位居前沿。

Muse Spark 1.2 vs Claude Fable 5

定價解釋了大部分差距,並低估了其餘部分:

輸入 — Muse Spark 1.2 每百萬 $1.25,Claude Fable 5 $10.00。八倍。

輸出 — $4.25 對比 $50.00。將近十二倍。

快取輸入—— 0.15 美元對比 1.00 美元,大約是七倍。此外,Fable 5 對寫入快取每百萬次額外收取 12.50 美元,或對一小時 TTL 收取 20.00 美元;而 Muse Spark 1.2 則完全沒有另外公布快取寫入費用。

混合費率——Artificial Analysis 將 Muse Spark 1.2 定價為每百萬個 token 0.78 美元,Fable 5 則為 7.70 美元。相差將近十倍。

Fable 5 是 Artificial Analysis 在它推出時所評測過最昂貴的模型,至今仍保持這個頭銜。我們有必要精確說明原因:該模型消耗了少於Muse Spark 1.2 通過索引時所用的輸出 token——8,700 萬對 9,500 萬——因此整體成本差異來自費率,而非冗長度。Fable 5 並不浪費。它只是被定價為前沿產品。

換算成一個代理步驟(讀取 60,000 個 token 的儲存庫上下文、撰寫 3,000 個 token 的修補程式):約8.8 美分(Muse Spark 1.2)、約 75 美分(Claude Fable 5)。一天一千個步驟,就是 88 美元對比 750 美元。一年下來,32,000 美元對比 274,000 美元。

Claude Fable 5 不可取代之處

如果這六點就是全部差異,成本案例會是單方面的。但它們並非如此,而差距擴大的地方,正是 Meta 重新定位 Muse Spark 1.2 以進行競爭之處。

Fable 5 在 Design Arena 的正面對決階梯中,於廣泛領域中穩居榜首:遊戲開發以 1399 Elo 排名第 1,ASCII 藝術以 1367 排名第 1,SVG 生成以 1353 排名第 1;此外在 agents 競技場中,Godot 遊戲開發(1344)、Android 原生(1318)、代理式遊戲開發(1300)與 HTML 簡報(1260)亦均排名第 1,並在網頁應用程式與全端開發中排名第 2。Muse Spark 1.2 擁有完全沒有任何 Design Arena 參賽記錄——其前代累積了不俗的中游成績(遊戲開發 1334、排名第 5;一般程式碼類別 1309、排名第 9),但新版本至今未曾獲得任何評級。

各維度指數的走向一致。Artificial Analysis 對 Claude Fable 5 的評分為:編碼指數 76.5,代理指數 52.8。Muse Spark 1.1 則停留在 71.3 與 37.5——編碼落後五分,代理工作落後十五分。1.2 的維度數據尚未公布,因此誠實而言,我們只知道綜合指數縮小了三分,而無從得知其中有多少落在代理軸上。

Muse Spark 1.2 vs Claude Fable 5

Fable 5自身的產品定位宣稱,其領先幅度會隨著任務長度與複雜度增加而擴大。這是廠商的說法,且所述內容未經證實,但確實與獨立數據的趨勢一致:Fable 5最大的領先優勢出現在agents(代理)領域,也就是模型必須在多輪互動中持續維繫整體規劃的情境,而非一次性生成的情境。

當 Muse Spark 1.2 正是正確答案時

有三件事使它成為正確的選擇,無論那六點為何。

音訊和視訊輸入。 Meta 的列表宣稱支援文字、圖片、視訊、音訊和 PDF 輸入。Claude Fable 5 接受文字、圖片和檔案——不支援音訊、不支援視訊。對於任何涉及錄音或影像素材的流程,這不是一個取捨,而是一個硬性過濾器。一個誠實的提醒:Artificial Analysis 的 Muse Spark 1.2 規格卡只記錄了已評估的文字和圖片,因此更廣泛的功能範圍只是廣告宣傳,而非經獨立驗證。

速度。每秒 165.0 個 token,相較於 71.7。Muse Spark 1.2 的輸出串流速度遠超過兩倍,在速度方面於 185 個項目中排名第 16,而同類中位數為 71——Fable 5 則位於中位數。

按量成本。 前一節中的所有內容。

為請求確實非常龐大的人加上第四點:兩個模型都宣稱約有一百萬個 token 的上下文——Muse Spark 1.2 為 1,048,576,Fable 5 為 1,000,000——但 Muse Spark 1.2 對所有 token 收取固定費率,而 Fable 5 的快取寫入定價則意味著,在開始為你省錢之前,維持一個大型穩定前綴需要先付出實實在在的成本。

這兩者都不是快速模型。

這是大多數直接比較評測會跳過的章節,它改變的是架構,而不是帳單。

在最高推理強度下,Artificial Analysis 測得 Muse Spark 1.2 的首個 token 延遲為 26.12 秒,Claude Fable 5 則為 141.26 秒,而 Fable 5 的端到端回應時間為 148.24 秒。在這些設定下,兩者都不適合擺在使用者面前。

實際生產數據要寬容得多,而且值得了解。在 OrcaRouter 上,Claude Fable 5 顯示出p50 首次 token 時間為 7.04 秒,p95 為 10.00 秒,在滾動的一週內——這是真實的流量,反映了呼叫者要求的任何努力程度,而非最大努力下的基準測試。作為參考,Muse Spark 1.1 的 p50 為 1.84 秒。Muse Spark 1.2 尚無生產環境遙測數據。

Muse Spark 1.2 vs Claude Fable 5

結構上的重點:兩款模型都有強制推理。Fable 5 的運算強度撥盤涵蓋低到最高,預設為高;Muse Spark 1.2 的則涵蓋極低到極高,預設為中。兩者都無法關閉思考功能。如果你需要亞秒級回應,這整個比較就擺錯了貨架——那是 Luna 或 Flash-Lite 等級模型的用途。

雙模型堆疊,已定價

把這個問題視為贏家通吃的選擇是個錯誤,因為流量並非同質。幾乎每個生產代理都有一長串例行步驟的長尾——讀取檔案、總結 diff、格式化 patch、決定下一步呼叫哪個工具——以及少數真正困難的短頭;這些困難步驟一旦答錯,就會耗費一個小時。

每天同樣執行一千次代理步驟。全部用 Claude Fable 5:約 750 美元。全部用 Muse Spark 1.2:約 88 美元。將 900 次例行任務交給便宜的模型,100 次困難的交給昂貴的模型:約 79 美元加 75 美元,也就是 每天 154 美元。這僅是全部使用 Fable 費用的五分之一,同時在真正需要前沿能力的那十分之一呼叫上維持了頂尖水準——單一代理迴圈每年就相差約 22 萬美元。

這種拆分之所以值得實際打造,而不只是描述,是因為過去它需要兩家廠商關係、兩套 SDK 和兩組憑證;現在則不需要了。Claude Fable 5 已收錄在 OrcaRouter 目錄中,價格為 $10.00 和 $50.00——廠商定價,以 0% 加成轉手——而 Muse Spark 1.1 也以 $1.25 和 $4.25 的相同條件上架,位於同一個 OpenAI 相容端點之後。路由 DSL 讓你可以把「先使用便宜模型,在信心度偏低或測試執行失敗時升級」表達為單一呼叫,而不是需要你維護的編排程式碼;模型融合則讓你可以一次將真正模糊的步驟送給一組模型並進行比較。Muse Spark 1.2 本身尚未收錄在目錄中——Meta 直接提供,而且它是唯一的供應商——因此目前你能建立的、最接近這個技術堆疊的方案,是在便宜的那一側使用 1.1。

單一供應商這項細節值得在風險評估中獨立成行。Claude Fable 5 有多條服務路由,並在彼此之間自動容錯切換。Muse Spark 1.2 只有一個端點,由 Meta 營運。如果它發生故障,就沒有任何同型號的備援模型可用。

成本模型,而非判決

這個比較的有用輸出不是「哪個模型勝出」,而是你可以為自己的工作負載計算出的一個門檻。

估計在您的調用中,有多少比例的 Muse Spark 1.2 等級答案失敗,而 Fable 5 等級答案成功。將其乘以失敗的成本——工程師分鐘、一次糟糕的合併、一個重試迴圈、一個客戶。將其與每步驟 66 美分相比較,這就是上述 60K 輸入 / 3K 輸出範例中,將單一調用從 Muse Spark 1.2 升級到 Claude Fable 5 的成本。如果錯誤答案的預期損失超過 66 美分,則將該步驟路由到 Fable 5。如果沒有,則不要。

對大多數團隊而言,這項計算將 Fable 5 用於程式碼審查、最終修補程式生成、架構規劃,以及任何觸及正式環境資料的工作;並將 Muse Spark 1.2 用於其他一切事務——檔案讀取、摘要、測試分流、工具選擇,以及代理迴圈中高流量的中段,在那裡成本是真實的,而每次呼叫的風險則微不足道。

值得持續關注的一件事:Design Arena 的天梯與 Muse Spark 1.2 的各維度指數,目前兩者都尚未出現。Fable 5 最有力的證據恰恰在於那些 Meta 新模型完全沒有記錄的正面對決競技場中。一旦那份記錄出現,這個門檻就會移動——而且可能大幅移動。

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

聯絡我們

加入我們的社區

DiscordEmailXGitHubYouTube