
Muse Spark 1.3 Max 推理已正式上線:締造 Meta 最高分的幕後設定現已全面開放給所有人
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 221 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 110 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
Muse Spark 1.3 —— Meta Superintelligence Labs 於 9 月 2 日發布的前沿推理模型 —— 剛獲得了其自身排行榜所依據的模式。9 月 4 日,經過兩天的額外安全測試後,Meta 在 Meta Model API 及其終端編碼代理 Muse Code 中,向開發者開放了該模型最耗費算力的「max」推理設定。首席 AI 長 Alexandr Wang 在 X 上宣布了這項推出,公司帳號 @AIatMeta 也予以確認;這項在發布時僅限 Meta 內部及合作夥伴預覽的配置,如今已成為任何開發者皆可選擇的推理等級。
這個順序之所以重要,是因為在 Muse Spark 1.3 發布報導中占主導地位的幾個數字——DeepSWE v1.1 上的 75.4、OSWorld 2.0 上的 66.9、GDPval-AA v2 上的 1,754——都來自 max 配置;而開發者實際可以呼叫的模型,出廠時的推理努力上限則設為「xhigh」。Meta 在發布時明確表示,max 仍在進行安全測試,但這種落差使得頭條成績榜與實際可呼叫的模型,在兩天內是兩回事。週四釋出的更新消除了這個差距,而且並未調整每個 token 的價格。該清單中的基準數據是 Meta 自家提供的,尚未有獨立測試框架複現;本文中所有廠商回報的數據皆已標示為如此。
被隱瞞的是什麼——以及9月4日發生了什麼變化
自該系列的付費API上線以來,Muse Spark 1.3的推理階梯一直保持相同的形態:推理始終開啟,且Meta Model API上的模型努力參數分為minimal、low、medium、high和xhigh,隨著等級提高,模型會花費更多輸出預算在思考上。Max位於xhigh之上——更多的算力、更多的推理token,而依Meta的說法,在長程代理型工作上表現顯著更強。在9月2日的發布中,Meta將最高到xhigh的所有等級都上線了,但將max保留在公開API之外,理由是所謂的額外安全測試,僅與有限的一組合作夥伴分享——足以供獨立評測運行,卻不足以支撐生產工作負載。
9月4日,王表示測試已完成。Max現在是Muse Code中的可選設定——安裝指令碼位於dev.meta.ai/install.sh——也可透過Meta Model API在muse-spark-1.3模型ID上使用,其effort參數現在接受max。王把這兩天的時間差形容為Meta在「組態層級」把關存取的做法,並向Axios表示,Meta至今無須因安全疑慮而暫停更廣泛的工作。這個時間窗口雖短,但確實是個真正的先例:Meta如今願意在立即推出檢查點其餘內容的同時,將特定推理模式留待安全審查後再釋出。
對於透過閘道器而非 Meta 自家端點呼叫模型的任何人,有一個實際注意事項:多個第三方說明文件頁面與彙總清單是在發布當天撰寫的,至今仍只將推理強度列舉到 xhigh。最大值是 Meta 端的逐步推出,因此在假設 max 可達之前,請先確認你呼叫的路由是否已更新其參數介面——一個在 9 月 2 日驗證其可接受值的代理,可能會持續拒絕「max」,直到其維護者追上進度為止。
「Max 實際上能帶來什麼——以及它在哪些情況下幫不上忙」
Meta 週四發布的材料中,對其運行的基準測試做了明確的 max 對比 xhigh 區分,而這是該公司迄今為止針對這款模型所發布最具參考價值的資訊。所有數據皆為供應商自行回報,產出於 Meta 自家的 Muse Code 測試框架內;Meta 也表示,其與 Claude Opus 5 和 GPT-5.6 Sol 的比較,是在那些競爭對手自身的最大設定下進行的「盡力而為」測試,「可能無法反映供應商最佳化後的效能」。在上述但書之下,這種區分仍然清楚說明了方向性趨勢:
• OSWorld 2.0(電腦使用代理任務)— max 下為 66.9,xhigh 下為 57.2
• GDPval-AA v2(知識工作智能體 Elo)— max 為 1,754,xhigh 為 1,709
• JobBench(長期專業任務)— 在 max 下為 64.9,在 xhigh 下為 61.2
• DeepSearchQA — 以89.4並列
• Terminal-Bench 2.1(終端代理編碼)— xhigh 下為 89.2,max 下為 88.8;這是唯一一個 9月2日發布的配置勝出的測試套件。

這個模式值得仔細解讀。Max 在任務屬於長時間的代理循環時最有幫助——操作電腦、處理知識工作簡報、像 JobBench 那樣維持子任務的排程。在單回合的終端基準測試上,它沒有任何增益,反而花費了一點成本:Terminal-Bench 提醒我們,「更多推理」並非單調遞增的升級,也因此應該在自己的工作負載上將 max 與 xhigh 進行 A/B 測試,而不是假設較高的設定在所有地方都更好。Meta 也指出,DeepSWE v1.1 的 75.4 成績——發布首日的頭條數字,高於 Meta 六週前為 Muse Spark 1.2 所報告的 59.3——是 max 配置下的數值。這是獨立評估者會最先重新驗證的數字。
獨立閱讀開始趕上進度了
發佈時所欠缺的正是獨立評測,而這個缺口正以一個恰好與 max 推出時程吻合的節奏在縮小。Artificial Analysis 的 Coding Agent Index——它在每個模型原生的 coding-agent 測試框架中進行評分,並混合 DeepSWE、Terminal-Bench 與 SWE-Atlas 任務——本週將 Muse Code 測試框架中的 Muse Spark 1.3 (max) 評為 68 分,在排行榜上位居第二,僅次於 Claude Code 中的 Claude Opus 5 (xhigh),並領先 67 分的 Claude Fable 5 (max) 與 65 分的 GPT-5.6 Sol (max)。同一排行榜也在同一個 Muse Code 測試框架中,將已出貨的 xhigh 配置評為 64 分;這是在獨立任務集上迄今最乾淨的對等比較,顯示 max 所增加的約四個指數點。該榜單資料發布時,max 仍處於合作夥伴預覽階段;它所描述的配置,正是於 9 月 4 日正式全面推出的那個配置。
Artificial Analysis 自推出以來也已更新了其針對 max 配置的模型卡。在預覽期間,該卡片未列出提供者與價格;現行卡片則列出 Meta,標準價格為每百萬輸入代幣 $1.25、每百萬輸出代幣 $4.25,與 Muse Spark 1.2 的定價相同,並增加了一個冗長度注意事項:AA 的評估運行消耗了約 1.3 億個代幣,而中位數為 7,900 萬,總成本約 $1,335,根據 AA 的每任務估算,每個任務約 $0.95,輸出速度約為每秒 190 個代幣。
早前報道中的一個數字值得做版本核查。Artificial Analysis 本週將其 Intelligence Index 更新至 v4.2——正是 max 出貨的那一週——重新為各方評分,並調整了中位數。在目前的分數表上,max 配置顯示為 53,而同類模型的中位數為 29;發佈週報道中流傳的 62 是按舊版指數測量的,兩者不可比較。Meta 自己上述的 xhigh 對比 max 的分流與 AA 的指數無關,亦不受這次更新影響。

max 的費用是多少——帳單是算在代幣上的,不是算在價目表上的
Meta 未針對最高配置單獨定價,也未提供專屬的延遲分析。每個 token 的價格與 Muse Spark 1.2 相同,也與 Muse Spark 1.3 上所有其他努力等級相同:標準層級每百萬輸入 token 收費 1.25 美元、每百萬輸出 token 收費 4.25 美元,而快取輸入每百萬收費 0.15 美元。推理 token 以輸出 token 計費,並計入輸出預算,因此選擇最高配置並非明細上的漲價,而是承諾在回答前動用更多這份預算來思考。
這使得真正的成本問題在於 token 用量,而早期數據顯示,xhigh 表現精簡的地方,恰好正是 max 花費高昂之處。AA 的儀表化執行在一次配置評估中就耗用了約 1.3 億個 token。對於已在 xhigh 上執行長時間 agentic 迴圈的開發者而言,真正要緊的 A/B 測試不是「max 是否通過更多任務」,而是「max 是否通過足夠多的額外任務,讓同一工作負載上顯著提高的 token 帳單物有所值。」
Meta 的貢獻者方案(Contributor tier)——每百萬個 token 輸入 $0.10、輸出 $0.20,條件是讓 Meta 使用你的提示詞與完成內容進行訓練——適用於同一個檢查點,而 Meta 表示有意義的雙位數百分比開發者選擇此方案。貢獻者的條款使每一筆提交都成為訓練資料,且速率限制相當嚴格,因此作為生產環境扇出的預設選項並不理想;但若資料交換對你而言可以接受,這是在低成本下運行昂貴 max 實驗的合法途徑。
這一切的定價基準很容易查證,不必只聽 Meta 一面之詞,因為 Muse Spark 1.3 檢查點的定價,與 OrcaRouter 上已列出的 Meta 自己的官方定價相同:Muse Spark 1.2 在 OrcaRouter 上的價格為每百萬 tokens 輸入 $1.25、輸出 $4.25,且完全不加價,因此「價格不變」的說法,可以用一個實際列出這些數字的即時頁面來驗證。Muse Spark 1.3 本身尚未上架 OrcaRouter。當我們所引進的供應商開始以 max 來提供此模型時,Meta 官方定價會直接穿透至我們這端顯示的價格——我們不會對供應商價格加價——而 Meta 身為供應商若有任何降價,也會在發布當天生效。以這次發布來說,值得關注的經濟效益在於 token 用量,而非表面的標價;正是這種穿透機制,讓您實際被收取的金額,與 Meta 公布的數字保持一致。

誰應該切換到 max?
這個決定乾淨俐落地一分為二:
• 針對長時程代理型工作負載進行切換——電腦使用、知識工作簡報、Muse Code 中的多步驟工具迴圈——Meta 自己的分割與 AA 的編碼代理排行榜都顯示最大的增益。先在真實任務樣本上與 xhigh 進行 A/B 測試,因為冗長問題確實存在。
• 對於高流量、延遲敏感或短暫的單回合呼叫,請維持使用 xhigh,因為在這些情況下,max 主要只是增加 token。Terminal-Bench 證明了它並不總是能提升能力。
• 從這裡觀察三件事:祖克柏承諾但尚未訂定日期的開放權重(open-weights)發布;未來幾週內 Muse Spark 1.3 向 Instagram、Facebook 與 Meta AI 的消費者端推出;以及 Artificial Analysis 的編寫代理(coding-agent)排行榜是否會在該配置正式全面開放後,開始為「max」那一行定價。
為期兩天的門禁時間證明很短暫,但它點出了一個比這次推出本身更長久的重點:Meta 最強的 Muse Spark 1.3 數字從來不是海市蜃樓——它們只是在等待安全審查。截至 9 月 4 日,開發者可以呼叫的模型與排行榜上的模型終於是同一款模型。無論「max」是否值得它消耗的 token,如今都是一個任何開發者都能實證回答的問題——無論是透過 Meta 的 API,還是透過他們原本就用來連上 Muse Spark 系列的任何途徑。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
