
GPT-6 Sol 對上 Muse Spark 1.2:其中一個有耳朵
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 350 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
把GPT-6 Sol與Muse Spark 1.2並排放在一起,價格欄不過是有所不同,而模態欄則完全稱不上接近。Muse Spark 1.2 接受文字、圖像、影片、檔案與音訊。GPT-6 Sol 接受文字、圖像與檔案。音訊與影片正是差別所在,而這絕非無關緊要的細節:它們區隔出一個可以直接把會議錄音交給它的模型,以及一個只能接收會議逐字稿的模型。GPT-6 是該世代的中階層級,於 2026 年 8 月 22 日推出;而 Muse Spark 1.2 是 Meta 在 Muse Spark 系列中目前的檢查點,於 2026 年 8 月 5 日推出,作為 Muse Spark 1.1 可直接替換的更新,同樣屬於 Standard 層級,定價完全相同。
最後那一點關係到這頁應該怎麼解讀。Muse Spark 1.2 不是新世代,也不該被寫成新世代——Meta 自己的說法是,這是一個更新版檢查點,效能略高,並以不變的費率提供。所以,有趣的問題不是 1.2 比 1.1 多了什麼,而是 Muse Spark 系列有哪些 GPT-6 系列所沒有的東西,以及你是否需要它。
這兩份規格表,關於有差異的尺寸
• 輸入模態 — GPT-6 Sol 文字、圖像與檔案 vs Muse Spark 1.2 文字、圖像、影片、檔案與音訊
• 輸出 — 兩者僅限文字
• 輸入價格 — GPT-6 Sol 每百萬 $2.00,相較於 Muse Spark 1.2 每百萬 $1.25
• 輸出價格 — GPT-6 Sol 每百萬 $10.00,相較於 Muse Spark 1.2 每百萬 $4.25
• 快取輸入 — GPT-6 Sol 每百萬 $0.20,相較於 Muse Spark 1.2 每百萬 $0.15
• 上下文視窗 — 1,050,000 個 Token 對比 1,048,576 個 Token,實際上相同
• 長請求級距 — GPT-6 Sol 會將輸入超過 272,000 個 Token 的整筆請求重新定價為 $4.00 / $15.00,而 Muse Spark 1.2 的定價卡上則沒有此級距
• GPQA Diamond — GPT-6 Sol 96.1 對 Muse Spark 1.2 90.4
人類最後的考試 — GPT-6 Sol 47.9 對比 Muse Spark 1.2 45.5
• 長上下文召回 — GPT-6 Sol 83.7 對 Muse Spark 1.2 79.0
• tau-banking — GPT-6 Sol 未於此修訂版發布 vs Muse Spark 1.2 34.8
• 權重 — 兩者皆為閉源,僅提供 API
那份清單裡的長請求那一行正默默發揮作用。Muse Spark 1.2 在其公布的價格卡上沒有長脈絡重新計價條款,因此它的 $1.25/$4.25 在整個視窗內都維持不變。GPT-6 Sol 的標示價格則不然:輸入超過 272,000 個 token 後,整筆請求便改以 $4.00/$15.00 計價。因此在滿脈絡提示下,輸出端的比較並不是十美元對上 $4.25,而是十五美元對上 $4.25——是三倍半,而不是兩又三分之一倍。
而基準測試的差距,比價格差距所暗示的要來得小。GPQA Diamond 拿下 96.1 對 90.4,這大致上是兩種不同推理投入程度設定會造成的差距,而非能力上的差異;而在 Humanity's Last Exam 上,兩者分別是 47.9 與 45.5,換算成百分制不過是 2.4 分。Muse Spark 1.2 是較便宜的模型,也是閱讀能力更全面的那一個;GPT-6 Sol 在推理數據上領先,但領先幅度並不如價格所暗示的那麼大。兩者的強項各據一方,這正是為什麼這個選擇值得你刻意斟酌。

音訊與視訊輸入實際上會改變什麼?
一個能接受音訊的模型,可以收到錄音,而不是逐字稿。這聽起來像是方便,但實際上改變了可能性的範圍:轉錄是有損的步驟,會丟棄語氣、重疊、笑聲,以及僅從文字閱讀時,疑問句與陳述句之間的差異。直接聽見檔案的模型能感知到這一切。同樣的論點也適用於影片:逐格描述會喪失時間資訊,而直接攝取影片片段的模型則不會。
GPT-6 Sol 的答案是一條管線,而不是一種模態——先轉錄或上字幕,再傳遞文字。這是完全可行的架構,而且對許多工作負載來說,它是更好的選擇,因為逐字稿可檢查、可快取,而且儲存成本低。它恰好會在音訊或動作本身就是訊號時顯得較差:客服中心品質審查、媒體記錄,以及任何說話者的遲疑本身就承載意義的情況。
Meta 對此的立場值得仔細閱讀,因為音訊標籤並非裝飾。Muse Spark 1.2 在其能力中被列出時包含音訊,與視覺、工具、JSON 和推理並列,而 Meta 已將該系列作為其多模態產品線推出,較小的 Muse Glimmer 則是從 Muse Spark 教師模型蒸餾而來。如果你是在這兩者之間就輸入介面做選擇,那麼這個選擇並不是在稍微更廣與稍微更窄的規格表之間做取捨,而是在擁有該模態,與建構一套流程來近似它之間做選擇。
兩者真正分道揚鑣之處
最清楚的分野,是代理式工具在模擬服務上的使用,而這也是數字差距大到足以據此採取行動的唯一一處。Muse Spark 1.2 在 tau-banking 上錄得 34.8,在較新的 Terminal-Bench 4.0 修訂版上卻只有 7.1——兩者皆為第三方測量,且從兩個方向描述同一個弱點。一個模型若能在會議中讀懂氛圍,卻在被要求呼叫 API 時把客戶餘額算錯,那它並非爛模型;它只是個職責界線明確的模型。
對 GPT-6 Sol 執行同樣的檢查,情況一致但更單薄。其長上下文召回率為 83.7,SciCode 為 57.6,Terminal-Bench 4.0 為 43.9,全都來自第三方。它在 v2.1 修訂版上的程式設計與終端代理數字則完全從缺,而某個數字從缺並不代表它是個低數字——任何用估計值填補那個欄位的人,都是在憑空捏造。
在數字被過度急切地相互比較之前,有一個不對稱之處值得先點明。Muse Spark 1.2 除了第三方測試集之外,還帶著一套來自 Meta 的完整廠商基準測試套件,而 Artificial Analysis 自家的發布分析在其 xhigh 推理設定下,將它置於 Intelligence Index 的 54 分,比 Muse Spark 1.1 高出三分。在我們的目錄中,GPT-6 Sol 在同一個指數上則落在 47.6。這兩個數字不能相減:它們來自不同時間所測量的不同配置,而介於兩者之間經過修訂的指數,已經不是同一件測量工具。誠實的比較性主張是上述那些單一基準測試的結果,因為在那裡兩個模型都帶有來自同一位評測者的數字。當一個模型擁有更多已公布的數字,它永遠會顯得比數字較少的模型紀錄更完整;而在這兩者之間,這種差異有很大一部分關乎是誰在報告,而不是模型本身能做什麼。

服務兩個在負載下行為不同的模型
兩者都在 OrcaRouter 上,共用一組金鑰,而且這對組合是自然而然的路由分工,而非二選一。把多模態流量——錄音、短片、附有掃描附件的文件包——送往 Muse Spark 1.2,價格為 $1.25 / $4.25,且沒有長脈絡斷崖。把推理密集與代理式流量送往 GPT-6 Sol,並針對答案必須經得起檢視的請求,接受較高的費率。透過單一端點,這樣的分流只是一條路由規則,而不是兩套整合。
在服務端有一項數字與價格邏輯相牴觸。在我們為期七天的滾動視窗中,Muse Spark 1.2 測得約每秒 420 個輸出 token,而 GPT-6 Sol 約為 244——Meta 的模型在我們的路由上既更便宜也更快速。但在首個 token 的延遲上,情況正好相反:在同一視窗中,Muse Spark 1.2 的首 token 時間 p50 約為 5.2 秒,而 GPT-6 Sol 約為 6.8 秒,因此這個較便宜的模型也更快開始回應。兩者都是在共用基礎架構上進行的滾動量測,而非受控的基準測試,且兩者的數值在每次讀取之間都會變動。
在這樣的混合式流程中,自動容錯移轉確實有其存在價值。當一個請求可以經由某條路由以音訊進來、以文字出去,或經由另一條路由強制經過轉錄步驟時,你最在意的故障模式,是供應商收下了請求、卻卡在媒體上傳階段——第二條已配置的路由會把這種情況變成一次重試,而不是一個得靠人發現並重新執行的工作。我們的目錄會原封不動地傳遞供應商的表定價格,因此,如果 Meta 調整了 $4.25 這一項,或像其他供應商早已做的那樣,在 Muse Spark 的價格卡上加入長上下文條款,這項變更會在發生的當天就傳到你這裡,而不是等到某個經銷商察覺之後。

直白地說,這個決定
如果你的輸入是錄音或影片片段,而且時間點或語氣是意義的一部分,請使用 Muse Spark 1.2。GPT-6 Sol 沒有任何設定能透過 API 達到那種能力,也沒有任何價格能讓替代流程變得等價。如果你的輸入是文字和圖像,而且輸出會被實際執行,GPT-6 Sol 的推理數據領先,其工具使用概況也是比較安全的選擇——Muse Spark 1.2 的 tau-banking 和 Terminal-Bench 4.0 分數是兩份表上最強烈的訊號,而它們指向不利於代理式工作的方向。
還要留意 Muse Spark 1.2 不是什麼:它不是新世代。它是 Meta 既有系列的當前檢查點,是在價格不變下對 1.1 的直接替換,這讓升級決定毫無成本,而與 GPT-6 Sol 的比較則是另一個獨立問題。另一方面,GPT-6 Sol 已被 GPT-6.1 Sol 取代,短上下文費率相同,快取輸入從 $0.20 減半至 $0.10,而 OpenAI 自家的模型頁面現在也引導讀者改看該版本。如果你權衡 Sol 而非 Muse Spark 的原因是那個已推出八天的整合,那依然成立。如果是能力,先查看後繼版本。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
