
Muse Spark 1.3 Max Reasoning är live: Inställningen bakom Metas toppresultat släpps nu för alla
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 221 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 110 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Muse Spark 1.3 — den banbrytande resonemangsmodell som Meta Superintelligence Labs släppte den 2 september — har precis fått det läge som dess egen resultattavla baserades på. Den 4 september, efter ytterligare två dagars säkerhetstestning, öppnade Meta modellens mest beräkningsintensiva "max"-resonemangsläge för utvecklare på Meta Model API och i Muse Code, dess terminalbaserade kodningsagent. AI-chefen Alexandr Wang tillkännagav utrullningen på X och företagets @AIatMeta-konto bekräftade det; det som vid lanseringen var en konfiguration begränsad till Meta och till en förhandsversion för partners är nu en resonemangsnivå som vilken utvecklare som helst kan välja.
Den sekvensen spelar roll eftersom flera av siffrorna som dominerade lanseringsbevakningen av Muse Spark 1.3 — 75,4 på DeepSWE v1.1, 66,9 på OSWorld 2.0, 1 754 på GDPval-AA v2 — kom från maxkonfigurationen, medan den modell som utvecklare faktiskt kunde anropa levererades med resoneringsinsatsen begränsad till ”xhigh”. Meta var vid lanseringen tydliga med att max fortfarande genomgick säkerhetstester, men uppdelningen innebar att topplistan och den anropbara modellen var två olika saker i två dagar. Torsdagens släpp sluter det gapet, och det gör det utan att röra priset per token. Benchmarksiffrorna i den listan är Metas egna och har ännu inte reproducerats av ett oberoende testramverk; allt som rapporterats av leverantören i den här texten är märkt som sådant.
Vad som hölls tillbaka — och vad som ändrades den 4 september
Muse Spark 1.3:s resonemangsstege har haft samma form sedan modellfamiljens betalda API öppnades: resonemang är alltid på, och modellens effort-parameter på Meta Model API antar värdena minimal, low, medium, high och xhigh, där modellen spenderar mer av sin outputbudget på tänkande när nivån stiger. Max ligger över xhigh – mer beräkningskraft, fler resonemangstokens och, enligt Meta, betydligt starkare på långsiktigt agentiskt arbete. Vid lanseringen den 2 september släppte Meta alla nivåer upp till xhigh men höll max utanför det publika API:t i väntan på det som man kallade ytterligare säkerhetstestning, och delade det bara med en begränsad uppsättning partners – tillräckligt för att en oberoende utvärdering skulle kunna köras, men inte tillräckligt för en produktionsbelastning.
Den 4 september sa Wang att testningen var klar. Max är nu en valbar inställning i Muse Code – installationsskriptet finns på dev.meta.ai/install.sh – och på modell-ID:t muse-spark-1.3 via Meta Model API, där effort-parametern nu accepterar max. Wang beskrev den två dagar långa fördröjningen som Metas sätt att styra åtkomsten "på konfigurationsnivå" och sade till Axios att Meta inte har behövt pausa sitt bredare arbete på grund av säkerhetsproblem. Fönstret var kort, men det är ett verkligt prejudikat: Meta är nu berett att hålla ett specifikt resonemangsläge bakom en säkerhetsgranskning samtidigt som resten av en checkpoint släpps omedelbart.
En praktisk varning för alla som anropar modellen via en gateway snarare än Metas egen endpoint: flera tredjepartsdokumentationssidor och aggregatorlistor skrevs vid lanseringen och listar fortfarande reasoning effort endast upp till xhigh. Maxvärdet är en utrullning från Metas sida, så kontrollera att den route du anropar via har uppdaterat sin parameteryta innan du antar att max är nåbart — en proxy som validerade sina accepterade värden den 2 september kan avvisa "max" tills dess underhållare hinner ikapp.
Vad max faktiskt köper — och där det inte hjälper
Metas material från torsdagen innehåller en explicit uppdelning av max kontra xhigh på de riktmärken som företaget kör, och detta är det mest användbara som det hittills publicerat om modellen. Allt är leverantörsrapporterat, producerat i Metas egen Muse Code-miljö, och Meta säger att dess jämförelser mot Claude Opus 5 och GPT-5.6 Sol var ”best-effort”-körningar på dessa konkurrenters egna maximala inställningar som ”kanske inte återspeglar leverantörsoptimerad prestanda.” Med den reservationen berättar uppdelningen en tydlig riktningsmässig historia:
• OSWorld 2.0 (uppgifter för datoranvändande agenter) — 66.9 vid max vs 57.2 vid xhigh
• GDPval-AA v2 (agent-Elo för kunskapsarbete) — 1 754 vid max mot 1 709 vid xhigh
• JobBench (långsiktiga professionella uppgifter) — 64,9 vid max jämfört med 61,2 vid xhigh
• DeepSearchQA — oavgjort på 89,4
Terminal-Bench 2.1 (terminalagentkodning) — 89,2 vid xhigh mot 88,8 vid max, den enda sviten där konfigurationen som levererades den 2 september vinner.

Mönstret är värt att läsa noggrant. Max hjälper mest där uppgiften är en lång agentisk loop – att använda en dator, arbeta med ett kunskapsarbetsuppdrag, hålla ett schema av deluppgifter som JobBench gör. På ett enstegs-terminalriktmärke tillförde den ingenting och kostade lite: Terminal-Bench är påminnelsen om att ”mer resonerande” inte är en monoton uppgradering, och det är anledningen till att A/B-testa max mot xhigh på din egen arbetsbelastning snarare än att anta att den högre inställningen är bättre överallt. Meta flaggar också DeepSWE v1.1-resultatet på 75,4 – rubriken på dag ett, upp från 59,3 som Meta rapporterade för Muse Spark 1.2 sex veckor tidigare – som ett max-konfigurationsnummer. Det är den siffra som oberoende utvärderare kommer att köra om först.
Den oberoende avläsningen börjar komma ikapp.
Vad som saknades vid lanseringen var någon oberoende mätning, och det gapet håller på att slutas i en takt som råkar matcha max-utrullningen. Artificial Analysis' Coding Agent Index – som poängsätter varje modell i dess inbyggda coding-agent-miljö och blandar DeepSWE-, Terminal-Bench- och SWE-Atlas-uppgifter – placerade Muse Spark 1.3 (max) i Muse Code-miljön på 68 denna vecka, tvåa på listan bakom Claude Opus 5 (xhigh) i Claude Code och före Claude Fable 5 (max) på 67 och GPT-5.6 Sol (max) på 65. Samma lista poängsätter den levererade xhigh-konfigurationen på 64 i samma Muse Code-miljö, vilket är den hittills renaste like-for-like-avläsningen av vad max tillför – ungefär fyra indexpunkter – på en oberoende uppgiftsuppsättning. Den raden publicerades medan max fortfarande var i partnerförhandsversion; konfigurationen den beskriver är den som blev allmänt tillgänglig den 4 september.
Artificial Analysis har också uppdaterat sitt eget modellkort för maxkonfigurationen sedan lanseringen. Under förhandsvisningsperioden listade kortet varken leverantör eller pris; det nuvarande live-kortet listar nu Meta till standardpriset $1,25 per miljon inmatningstokens och $4,25 per miljon utdatatokens — samma listpris som Muse Spark 1.2 — samtidigt som det läggs till en brasklapp om utförlighet: AA:s utvärderingskörning förbrukade ungefär 130 miljoner tokens mot en median på 79 miljoner, kostade totalt cirka $1 335 och hamnar på nära $0,95 per uppgift enligt AA:s uppskattning per uppgift, vid cirka 190 utdatatokens per sekund.
En siffra från tidigare bevakning förtjänar en versionskontroll. Den här veckan uppdaterade Artificial Analysis sitt Intelligence Index till v4.2 – samma vecka som max släpptes – och omvärderade fältet och försköt medianerna. På det aktuella kortet får max-konfigurationen 53 mot en median på 29 för jämförbara modeller; 62:an som cirkulerade i lanseringsveckans bevakning uppmättes på den tidigare versionen av indexet, och dessa två värden är inte jämförbara. Metas egen uppdelning mellan xhigh och max ovan är oberoende av AA:s index och påverkas inte av uppdateringen.

Vad max kostar — räkningen är i token, inte i prislistan
Meta publicerar inget separat pris för max-konfigurationen, och ingen dedikerad latensanalys heller. Priset per token är identiskt med Muse Spark 1.2 och med alla andra ansträngningsnivåer på Muse Spark 1.3: 1,25 USD per miljon input-tokens, 4,25 USD per miljon output-tokens och 0,15 USD för cachad input på standardnivån. Resonemangstokens faktureras som output-tokens och räknas mot output-budgeten, så att välja max är inte en prishöjning på radnivå – det är ett löfte om att spendera mer av den budgeten på att tänka innan man svarar.
Det gör att den verkliga kostnadsfrågan handlar om tokenvolym, och de tidiga uppgifterna säger att max är kostsam precis där xhigh är sparsam. AA:s instrumenterade körning förbrukade cirka 130 miljoner token vid en enda utvärdering av konfigurationen. För en utvecklare som redan kör långa agentiska loopar med xhigh är det A/B-test som spelar roll inte ”klarar max fler uppgifter” utan ”klarar max tillräckligt många ytterligare uppgifter för att betala för en väsentligt större tokenräkning på samma arbetsbelastning.”
Metas Contributor-nivå — 0,10 USD in och 0,20 USD ut per miljon tokens i utbyte mot att Meta får träna på dina prompts och svar — gäller för samma kontrollpunkt, och Meta uppger att en betydande tvåsiffrig andel av utvecklarna väljer den. Contributors villkor gör varje inskickning till träningsdata och dess hastighetsbegränsningar är snäva, så det är ett dåligt standardval för fan-out i produktion men ett legitimt sätt att köra dyra maxexperiment billigt om datautbytet är acceptabelt för dig.
Prisankaret för allt detta är lätt att kontrollera utan att ta Meta på orden, eftersom checkpointen Muse Spark 1.3 är prissatt identiskt med den som redan är listad på OrcaRouter till Metas eget listpris:Muse Spark 1.2 finns på OrcaRouter för $1.25 in och $4.25 ut per miljon tokens med noll påslag, så kan påståendet om ”oförändrat pris” kontrolleras mot en live-sida som visar exakt de siffrorna. Själva Muse Spark 1.3 finns ännu inte på OrcaRouter. När en leverantör vi har i sortimentet börjar leverera den med max, kommer priset som visas hos oss att vara Metas listpris som förs vidare rakt igenom — vi gör inga påslag på leverantörspriser — och en eventuell prissänkning från Meta går live samma dag som Meta genomför den. För en lansering som denna, där det ekonomiskt intressanta ligger i tokenvolym snarare än i det annonserade priset, är det just att priset förs vidare rakt igenom som gör att det belopp som du faktiskt debiteras är lika med det belopp som Meta publicerar.

Vem bör byta till max
Beslutet delar sig rent:
• Använd för långsiktiga agentiska arbetsbelastningar — datoranvändning, kunskapsarbetsuppdrag, flerstegsverktygsslingor i Muse Code — där både Metas egen split och AAs coding-agent board visar de största maxvinsterna. A/B-testa det mot xhigh på ett urval av dina verkliga uppgifter först, eftersom mångordigheten är verklig.
• Stanna kvar på xhigh för högvolym, latenskänsliga eller korta anrop med en enda tur, där max främst bara lägger till tokens. Terminal-Bench är beviset på att det inte alltid tillför kapacitet.
• Håll koll på tre saker framöver: open-weights-utgåvan som Zuckerberg har lovat utan datum, konsumentutrullningen av Muse Spark 1.3 till Instagram, Facebook och Meta AI under de kommande veckorna, samt huruvida Artificial Analysis topplista för kodagenter börjar prissätta maxraden nu när konfigurationen är allmänt tillgänglig.
Tvådagarsgrinden visade sig vara kort, men den gjorde en poäng som överlever själva utrullningen: Metas starkaste Muse Spark 1.3-siffror var aldrig en hägring — de väntade bara på en säkerhetsgranskning. Från och med den 4 september är modellen en utvecklare kan anropa och modellen på resultattavlan äntligen samma modell. Huruvida max förtjänar sina tokens är nu en empirisk fråga som vilken utvecklare som helst kan besvara, på Metas API eller via vilken väg de än redan använder för att nå Muse Spark-familjen.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
