生成的標題卡寫著 GPT-6 Sol 對上 Muse Spark 1.2,其中一個有耳朵,搭配的數據卡寫著輸入模態:文字、圖像、檔案 對上 文字、圖像、影片、檔案、音訊,輸出價格每百萬 $10.00 對上 $4.25,以及第三方 GPQA Diamond 96.1 對上 90.4,頁腳寫著 Muse Spark 1.2 的費率依據 Meta,GPT-6 Sol 的費率依據 OpenAI 的費率表;基準測試數據依據 Artificial Analysis。
Guides & Insights

GPT-6 Sol 對上 Muse Spark 1.2:其中一個有耳朵

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

把GPT-6 Sol與Muse Spark 1.2並排放在一起,價格欄不過是有所不同,而模態欄則完全稱不上接近。Muse Spark 1.2 接受文字、圖像、影片、檔案與音訊。GPT-6 Sol 接受文字、圖像與檔案。音訊與影片正是差別所在,而這絕非無關緊要的細節:它們區隔出一個可以直接把會議錄音交給它的模型,以及一個只能接收會議逐字稿的模型。GPT-6 是該世代的中階層級,於 2026 年 8 月 22 日推出;而 Muse Spark 1.2 是 Meta 在 Muse Spark 系列中目前的檢查點,於 2026 年 8 月 5 日推出,作為 Muse Spark 1.1 可直接替換的更新,同樣屬於 Standard 層級,定價完全相同。

最後那一點關係到這頁應該怎麼解讀。Muse Spark 1.2 不是新世代,也不該被寫成新世代——Meta 自己的說法是,這是一個更新版檢查點,效能略高,並以不變的費率提供。所以,有趣的問題不是 1.2 比 1.1 多了什麼,而是 Muse Spark 系列有哪些 GPT-6 系列所沒有的東西,以及你是否需要它。

這兩份規格表,關於有差異的尺寸

• 輸入模態 — GPT-6 Sol 文字、圖像與檔案 vs Muse Spark 1.2 文字、圖像、影片、檔案與音訊

• 輸出 — 兩者僅限文字

• 輸入價格 — GPT-6 Sol 每百萬 $2.00,相較於 Muse Spark 1.2 每百萬 $1.25

• 輸出價格 — GPT-6 Sol 每百萬 $10.00,相較於 Muse Spark 1.2 每百萬 $4.25

• 快取輸入 — GPT-6 Sol 每百萬 $0.20,相較於 Muse Spark 1.2 每百萬 $0.15

• 上下文視窗 — 1,050,000 個 Token 對比 1,048,576 個 Token,實際上相同

• 長請求級距 — GPT-6 Sol 會將輸入超過 272,000 個 Token 的整筆請求重新定價為 $4.00 / $15.00,而 Muse Spark 1.2 的定價卡上則沒有此級距

• GPQA Diamond — GPT-6 Sol 96.1 對 Muse Spark 1.2 90.4

人類最後的考試 — GPT-6 Sol 47.9 對比 Muse Spark 1.2 45.5

• 長上下文召回 — GPT-6 Sol 83.7 對 Muse Spark 1.2 79.0

• tau-banking — GPT-6 Sol 未於此修訂版發布 vs Muse Spark 1.2 34.8

• 權重 — 兩者皆為閉源,僅提供 API

那份清單裡的長請求那一行正默默發揮作用。Muse Spark 1.2 在其公布的價格卡上沒有長脈絡重新計價條款,因此它的 $1.25/$4.25 在整個視窗內都維持不變。GPT-6 Sol 的標示價格則不然:輸入超過 272,000 個 token 後,整筆請求便改以 $4.00/$15.00 計價。因此在滿脈絡提示下,輸出端的比較並不是十美元對上 $4.25,而是十五美元對上 $4.25——是三倍半,而不是兩又三分之一倍。

而基準測試的差距,比價格差距所暗示的要來得小。GPQA Diamond 拿下 96.1 對 90.4,這大致上是兩種不同推理投入程度設定會造成的差距,而非能力上的差異;而在 Humanity's Last Exam 上,兩者分別是 47.9 與 45.5,換算成百分制不過是 2.4 分。Muse Spark 1.2 是較便宜的模型,也是閱讀能力更全面的那一個;GPT-6 Sol 在推理數據上領先,但領先幅度並不如價格所暗示的那麼大。兩者的強項各據一方,這正是為什麼這個選擇值得你刻意斟酌。

Generated comparison scoreboard titled GPT-6 Sol vs Muse Spark 1.2, the scoreboard, with six matched rows. GPT-6 Sol: input $2.00 per million, output $10.00 per million, modalities text image file, GPQA Diamond 96.1, long-context recall 83.7, reprices above 272K input tokens. Muse Spark 1.2: input $1.25 per million, output $4.25 per million, modalities text image video file audio, GPQA Diamond 90.4, long-context recall 79.0, no long-request step. A footer reads Muse Spark 1.2 figures per Artificial Analysis and Meta; GPT-6 Sol figures per Artificial Analysis and OpenAI.

音訊與視訊輸入實際上會改變什麼?

一個能接受音訊的模型,可以收到錄音,而不是逐字稿。這聽起來像是方便,但實際上改變了可能性的範圍:轉錄是有損的步驟,會丟棄語氣、重疊、笑聲,以及僅從文字閱讀時,疑問句與陳述句之間的差異。直接聽見檔案的模型能感知到這一切。同樣的論點也適用於影片:逐格描述會喪失時間資訊,而直接攝取影片片段的模型則不會。

GPT-6 Sol 的答案是一條管線,而不是一種模態——先轉錄或上字幕,再傳遞文字。這是完全可行的架構,而且對許多工作負載來說,它是更好的選擇,因為逐字稿可檢查、可快取,而且儲存成本低。它恰好會在音訊或動作本身就是訊號時顯得較差:客服中心品質審查、媒體記錄,以及任何說話者的遲疑本身就承載意義的情況。

Meta 對此的立場值得仔細閱讀,因為音訊標籤並非裝飾。Muse Spark 1.2 在其能力中被列出時包含音訊,與視覺、工具、JSON 和推理並列,而 Meta 已將該系列作為其多模態產品線推出,較小的 Muse Glimmer 則是從 Muse Spark 教師模型蒸餾而來。如果你是在這兩者之間就輸入介面做選擇,那麼這個選擇並不是在稍微更廣與稍微更窄的規格表之間做取捨,而是在擁有該模態,與建構一套流程來近似它之間做選擇。

兩者真正分道揚鑣之處

最清楚的分野,是代理式工具在模擬服務上的使用,而這也是數字差距大到足以據此採取行動的唯一一處。Muse Spark 1.2 在 tau-banking 上錄得 34.8,在較新的 Terminal-Bench 4.0 修訂版上卻只有 7.1——兩者皆為第三方測量,且從兩個方向描述同一個弱點。一個模型若能在會議中讀懂氛圍,卻在被要求呼叫 API 時把客戶餘額算錯,那它並非爛模型;它只是個職責界線明確的模型。

對 GPT-6 Sol 執行同樣的檢查,情況一致但更單薄。其長上下文召回率為 83.7,SciCode 為 57.6,Terminal-Bench 4.0 為 43.9,全都來自第三方。它在 v2.1 修訂版上的程式設計與終端代理數字則完全從缺,而某個數字從缺並不代表它是個低數字——任何用估計值填補那個欄位的人,都是在憑空捏造。

在數字被過度急切地相互比較之前,有一個不對稱之處值得先點明。Muse Spark 1.2 除了第三方測試集之外,還帶著一套來自 Meta 的完整廠商基準測試套件,而 Artificial Analysis 自家的發布分析在其 xhigh 推理設定下,將它置於 Intelligence Index 的 54 分,比 Muse Spark 1.1 高出三分。在我們的目錄中,GPT-6 Sol 在同一個指數上則落在 47.6。這兩個數字不能相減:它們來自不同時間所測量的不同配置,而介於兩者之間經過修訂的指數,已經不是同一件測量工具。誠實的比較性主張是上述那些單一基準測試的結果,因為在那裡兩個模型都帶有來自同一位評測者的數字。當一個模型擁有更多已公布的數字,它永遠會顯得比數字較少的模型紀錄更完整;而在這兩者之間,這種差異有很大一部分關乎是誰在報告,而不是模型本身能做什麼。

OrcaRouter model page for Muse Spark 1.2 (meta/muse-spark-1.2) by Meta, dated 2026-08-05, tagged Vision, Audio, Tools, JSON and Reasoning, showing text, image, video, file and audio input with text output, a list price of $1.25 per million input and $4.25 per million output, and page copy describing it as Meta's reasoning model for complex agentic tasks and the current checkpoint of the Muse Spark family.

服務兩個在負載下行為不同的模型

兩者都在 OrcaRouter 上,共用一組金鑰,而且這對組合是自然而然的路由分工,而非二選一。把多模態流量——錄音、短片、附有掃描附件的文件包——送往 Muse Spark 1.2,價格為 $1.25 / $4.25,且沒有長脈絡斷崖。把推理密集與代理式流量送往 GPT-6 Sol,並針對答案必須經得起檢視的請求,接受較高的費率。透過單一端點,這樣的分流只是一條路由規則,而不是兩套整合。

在服務端有一項數字與價格邏輯相牴觸。在我們為期七天的滾動視窗中,Muse Spark 1.2 測得約每秒 420 個輸出 token,而 GPT-6 Sol 約為 244——Meta 的模型在我們的路由上既更便宜也更快速。但在首個 token 的延遲上,情況正好相反:在同一視窗中,Muse Spark 1.2 的首 token 時間 p50 約為 5.2 秒,而 GPT-6 Sol 約為 6.8 秒,因此這個較便宜的模型也更快開始回應。兩者都是在共用基礎架構上進行的滾動量測,而非受控的基準測試,且兩者的數值在每次讀取之間都會變動。

在這樣的混合式流程中,自動容錯移轉確實有其存在價值。當一個請求可以經由某條路由以音訊進來、以文字出去,或經由另一條路由強制經過轉錄步驟時,你最在意的故障模式,是供應商收下了請求、卻卡在媒體上傳階段——第二條已配置的路由會把這種情況變成一次重試,而不是一個得靠人發現並重新執行的工作。我們的目錄會原封不動地傳遞供應商的表定價格,因此,如果 Meta 調整了 $4.25 這一項,或像其他供應商早已做的那樣,在 Muse Spark 的價格卡上加入長上下文條款,這項變更會在發生的當天就傳到你這裡,而不是等到某個經銷商察覺之後。

Artificial Analysis launch analysis for Muse Spark 1.2 dated August 5, 2026, titled Muse Spark 1.2: Improved Agentic Performance at Higher Cost per Task, reporting that Muse Spark 1.2 scores 54 on the Artificial Analysis Intelligence Index, up 3 points from Muse Spark 1.1 at 51 and 11 points from Muse Spark 1.0 at 43, and describing it as Meta's third release in four months, tying with SpaceXAI for third place among US labs.

直白地說,這個決定

如果你的輸入是錄音或影片片段,而且時間點或語氣是意義的一部分,請使用 Muse Spark 1.2。GPT-6 Sol 沒有任何設定能透過 API 達到那種能力,也沒有任何價格能讓替代流程變得等價。如果你的輸入是文字和圖像,而且輸出會被實際執行,GPT-6 Sol 的推理數據領先,其工具使用概況也是比較安全的選擇——Muse Spark 1.2 的 tau-banking 和 Terminal-Bench 4.0 分數是兩份表上最強烈的訊號,而它們指向不利於代理式工作的方向。

還要留意 Muse Spark 1.2 不是什麼:它不是新世代。它是 Meta 既有系列的當前檢查點,是在價格不變下對 1.1 的直接替換,這讓升級決定毫無成本,而與 GPT-6 Sol 的比較則是另一個獨立問題。另一方面,GPT-6 Sol 已被 GPT-6.1 Sol 取代,短上下文費率相同,快取輸入從 $0.20 減半至 $0.10,而 OpenAI 自家的模型頁面現在也引導讀者改看該版本。如果你權衡 Sol 而非 Muse Spark 的原因是那個已推出八天的整合,那依然成立。如果是能力,先查看後繼版本。

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新