Nyhetsrubrik för lanseringen av Muse Spark 1.3 med max resonemang. Ovanrubrik 'Meta Superintelligence Labs — 4 sept 2026', rubrik 'Muse Spark 1.3 med max resonemang är nu live', underrubrik som noterar att Meta klarade säkerhetstesterna två dagar efter lanseringen och öppnade resonemangsläget bakom sina toppresultat i Muse Code och Meta Model API till samma pris, märken 'resonemangsinsats: max', 'samma listpris på 1,25 / 4,25 USD' och 'konfigurationen bakom DeepSWE 75.4', sidfot 'Nu valbart på muse-spark-1.3 — resonemangstokens debiteras som utdata', OrcaRouter-logotyp sammansatt i nedre högra hörnet.
Guides & Insights

Muse Spark 1.3 Max Reasoning är live: Inställningen bakom Metas toppresultat släpps nu för alla

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Muse Spark 1.3 — den banbrytande resonemangsmodell som Meta Superintelligence Labs släppte den 2 september — har precis fått det läge som dess egen resultattavla baserades på. Den 4 september, efter ytterligare två dagars säkerhetstestning, öppnade Meta modellens mest beräkningsintensiva "max"-resonemangsläge för utvecklare på Meta Model API och i Muse Code, dess terminalbaserade kodningsagent. AI-chefen Alexandr Wang tillkännagav utrullningen på X och företagets @AIatMeta-konto bekräftade det; det som vid lanseringen var en konfiguration begränsad till Meta och till en förhandsversion för partners är nu en resonemangsnivå som vilken utvecklare som helst kan välja.

Den sekvensen spelar roll eftersom flera av siffrorna som dominerade lanseringsbevakningen av Muse Spark 1.3 — 75,4 på DeepSWE v1.1, 66,9 på OSWorld 2.0, 1 754 på GDPval-AA v2 — kom från maxkonfigurationen, medan den modell som utvecklare faktiskt kunde anropa levererades med resoneringsinsatsen begränsad till ”xhigh”. Meta var vid lanseringen tydliga med att max fortfarande genomgick säkerhetstester, men uppdelningen innebar att topplistan och den anropbara modellen var två olika saker i två dagar. Torsdagens släpp sluter det gapet, och det gör det utan att röra priset per token. Benchmarksiffrorna i den listan är Metas egna och har ännu inte reproducerats av ett oberoende testramverk; allt som rapporterats av leverantören i den här texten är märkt som sådant.

Vad som hölls tillbaka — och vad som ändrades den 4 september

Muse Spark 1.3:s resonemangsstege har haft samma form sedan modellfamiljens betalda API öppnades: resonemang är alltid på, och modellens effort-parameter på Meta Model API antar värdena minimal, low, medium, high och xhigh, där modellen spenderar mer av sin outputbudget på tänkande när nivån stiger. Max ligger över xhigh – mer beräkningskraft, fler resonemangstokens och, enligt Meta, betydligt starkare på långsiktigt agentiskt arbete. Vid lanseringen den 2 september släppte Meta alla nivåer upp till xhigh men höll max utanför det publika API:t i väntan på det som man kallade ytterligare säkerhetstestning, och delade det bara med en begränsad uppsättning partners – tillräckligt för att en oberoende utvärdering skulle kunna köras, men inte tillräckligt för en produktionsbelastning.

Den 4 september sa Wang att testningen var klar. Max är nu en valbar inställning i Muse Code – installationsskriptet finns på dev.meta.ai/install.sh – och på modell-ID:t muse-spark-1.3 via Meta Model API, där effort-parametern nu accepterar max. Wang beskrev den två dagar långa fördröjningen som Metas sätt att styra åtkomsten "på konfigurationsnivå" och sade till Axios att Meta inte har behövt pausa sitt bredare arbete på grund av säkerhetsproblem. Fönstret var kort, men det är ett verkligt prejudikat: Meta är nu berett att hålla ett specifikt resonemangsläge bakom en säkerhetsgranskning samtidigt som resten av en checkpoint släpps omedelbart.

En praktisk varning för alla som anropar modellen via en gateway snarare än Metas egen endpoint: flera tredjepartsdokumentationssidor och aggregatorlistor skrevs vid lanseringen och listar fortfarande reasoning effort endast upp till xhigh. Maxvärdet är en utrullning från Metas sida, så kontrollera att den route du anropar via har uppdaterat sin parameteryta innan du antar att max är nåbart — en proxy som validerade sina accepterade värden den 2 september kan avvisa "max" tills dess underhållare hinner ikapp.

Vad max faktiskt köper — och där det inte hjälper

Metas material från torsdagen innehåller en explicit uppdelning av max kontra xhigh på de riktmärken som företaget kör, och detta är det mest användbara som det hittills publicerat om modellen. Allt är leverantörsrapporterat, producerat i Metas egen Muse Code-miljö, och Meta säger att dess jämförelser mot Claude Opus 5 och GPT-5.6 Sol var ”best-effort”-körningar på dessa konkurrenters egna maximala inställningar som ”kanske inte återspeglar leverantörsoptimerad prestanda.” Med den reservationen berättar uppdelningen en tydlig riktningsmässig historia:

• OSWorld 2.0 (uppgifter för datoranvändande agenter) — 66.9 vid max vs 57.2 vid xhigh

• GDPval-AA v2 (agent-Elo för kunskapsarbete) — 1 754 vid max mot 1 709 vid xhigh

• JobBench (långsiktiga professionella uppgifter) — 64,9 vid max jämfört med 61,2 vid xhigh

• DeepSearchQA — oavgjort på 89,4

Terminal-Bench 2.1 (terminalagentkodning) — 89,2 vid xhigh mot 88,8 vid max, den enda sviten där konfigurationen som levererades den 2 september vinner.

A comparison scoreboard titled 'Muse Spark 1.3 — max vs xhigh, the split'. Left column Max (released Sept 4, 2026): OSWorld 2.0 66.9, Terminal-Bench 2.1 88.8, GDPval-AA v2 (Elo) 1,754, JobBench 64.9, DeepSearchQA 89.4, Available to all developers. Right column Xhigh (released Sept 2, 2026): OSWorld 2.0 57.2, Terminal-Bench 2.1 89.2, GDPval-AA v2 (Elo) 1,709, JobBench 61.2, DeepSearchQA 89.4, Available to all developers. Footer: 'Benchmark splits per Meta's Sept 4 release materials — vendor-reported, not independently reproduced. Xhigh wins Terminal-Bench 2.1.' OrcaRouter logo bottom-right.

Mönstret är värt att läsa noggrant. Max hjälper mest där uppgiften är en lång agentisk loop – att använda en dator, arbeta med ett kunskapsarbetsuppdrag, hålla ett schema av deluppgifter som JobBench gör. På ett enstegs-terminalriktmärke tillförde den ingenting och kostade lite: Terminal-Bench är påminnelsen om att ”mer resonerande” inte är en monoton uppgradering, och det är anledningen till att A/B-testa max mot xhigh på din egen arbetsbelastning snarare än att anta att den högre inställningen är bättre överallt. Meta flaggar också DeepSWE v1.1-resultatet på 75,4 – rubriken på dag ett, upp från 59,3 som Meta rapporterade för Muse Spark 1.2 sex veckor tidigare – som ett max-konfigurationsnummer. Det är den siffra som oberoende utvärderare kommer att köra om först.

Den oberoende avläsningen börjar komma ikapp.

Vad som saknades vid lanseringen var någon oberoende mätning, och det gapet håller på att slutas i en takt som råkar matcha max-utrullningen. Artificial Analysis' Coding Agent Index – som poängsätter varje modell i dess inbyggda coding-agent-miljö och blandar DeepSWE-, Terminal-Bench- och SWE-Atlas-uppgifter – placerade Muse Spark 1.3 (max) i Muse Code-miljön på 68 denna vecka, tvåa på listan bakom Claude Opus 5 (xhigh) i Claude Code och före Claude Fable 5 (max) på 67 och GPT-5.6 Sol (max) på 65. Samma lista poängsätter den levererade xhigh-konfigurationen på 64 i samma Muse Code-miljö, vilket är den hittills renaste like-for-like-avläsningen av vad max tillför – ungefär fyra indexpunkter – på en oberoende uppgiftsuppsättning. Den raden publicerades medan max fortfarande var i partnerförhandsversion; konfigurationen den beskriver är den som blev allmänt tillgänglig den 4 september.

Artificial Analysis har också uppdaterat sitt eget modellkort för maxkonfigurationen sedan lanseringen. Under förhandsvisningsperioden listade kortet varken leverantör eller pris; det nuvarande live-kortet listar nu Meta till standardpriset $1,25 per miljon inmatningstokens och $4,25 per miljon utdatatokens — samma listpris som Muse Spark 1.2 — samtidigt som det läggs till en brasklapp om utförlighet: AA:s utvärderingskörning förbrukade ungefär 130 miljoner tokens mot en median på 79 miljoner, kostade totalt cirka $1 335 och hamnar på nära $0,95 per uppgift enligt AA:s uppskattning per uppgift, vid cirka 190 utdatatokens per sekund.

En siffra från tidigare bevakning förtjänar en versionskontroll. Den här veckan uppdaterade Artificial Analysis sitt Intelligence Index till v4.2 – samma vecka som max släpptes – och omvärderade fältet och försköt medianerna. På det aktuella kortet får max-konfigurationen 53 mot en median på 29 för jämförbara modeller; 62:an som cirkulerade i lanseringsveckans bevakning uppmättes på den tidigare versionen av indexet, och dessa två värden är inte jämförbara. Metas egen uppdelning mellan xhigh och max ovan är oberoende av AA:s index och påverkas inte av uppdateringen.

A screenshot of the Artificial Analysis model page for Muse Spark 1.3 (max), showing a score of 53 on the Artificial Analysis Intelligence Index against a comparable-model median of 29, input pricing of $1.25 and output pricing of $4.25 per 1M tokens with an 88% cache discount, a per-task cost estimate near $0.95, about 190 output tokens per second, a 1M-token context window, and a note that the configuration is 'somewhat verbose' after generating roughly 130M tokens against a 79M median.

Vad max kostar — räkningen är i token, inte i prislistan

Meta publicerar inget separat pris för max-konfigurationen, och ingen dedikerad latensanalys heller. Priset per token är identiskt med Muse Spark 1.2 och med alla andra ansträngningsnivåer på Muse Spark 1.3: 1,25 USD per miljon input-tokens, 4,25 USD per miljon output-tokens och 0,15 USD för cachad input på standardnivån. Resonemangstokens faktureras som output-tokens och räknas mot output-budgeten, så att välja max är inte en prishöjning på radnivå – det är ett löfte om att spendera mer av den budgeten på att tänka innan man svarar.

Det gör att den verkliga kostnadsfrågan handlar om tokenvolym, och de tidiga uppgifterna säger att max är kostsam precis där xhigh är sparsam. AA:s instrumenterade körning förbrukade cirka 130 miljoner token vid en enda utvärdering av konfigurationen. För en utvecklare som redan kör långa agentiska loopar med xhigh är det A/B-test som spelar roll inte ”klarar max fler uppgifter” utan ”klarar max tillräckligt många ytterligare uppgifter för att betala för en väsentligt större tokenräkning på samma arbetsbelastning.”

Metas Contributor-nivå — 0,10 USD in och 0,20 USD ut per miljon tokens i utbyte mot att Meta får träna på dina prompts och svar — gäller för samma kontrollpunkt, och Meta uppger att en betydande tvåsiffrig andel av utvecklarna väljer den. Contributors villkor gör varje inskickning till träningsdata och dess hastighetsbegränsningar är snäva, så det är ett dåligt standardval för fan-out i produktion men ett legitimt sätt att köra dyra maxexperiment billigt om datautbytet är acceptabelt för dig.

Prisankaret för allt detta är lätt att kontrollera utan att ta Meta på orden, eftersom checkpointen Muse Spark 1.3 är prissatt identiskt med den som redan är listad på OrcaRouter till Metas eget listpris:Muse Spark 1.2 finns på OrcaRouter för $1.25 in och $4.25 ut per miljon tokens med noll påslag, så kan påståendet om ”oförändrat pris” kontrolleras mot en live-sida som visar exakt de siffrorna. Själva Muse Spark 1.3 finns ännu inte på OrcaRouter. När en leverantör vi har i sortimentet börjar leverera den med max, kommer priset som visas hos oss att vara Metas listpris som förs vidare rakt igenom — vi gör inga påslag på leverantörspriser — och en eventuell prissänkning från Meta går live samma dag som Meta genomför den. För en lansering som denna, där det ekonomiskt intressanta ligger i tokenvolym snarare än i det annonserade priset, är det just att priset förs vidare rakt igenom som gör att det belopp som du faktiskt debiteras är lika med det belopp som Meta publicerar.

A screenshot of the OrcaRouter model page for Muse Spark 1.2, the checkpoint Muse Spark 1.3 is priced identically to, showing header stats $1.25 input and $4.25 output per million tokens, p50 time-to-first-token 7.84 s, p50 total 10.00 s and 48.9M, the description 'Muse Spark 1.2 is Meta's reasoning model for complex agentic tasks... a drop-in upgrade rather than a new tier', and the 'Get the Muse Spark 1.2 API' and 'Try in playground' buttons.

Vem bör byta till max

Beslutet delar sig rent:

• Använd för långsiktiga agentiska arbetsbelastningar — datoranvändning, kunskapsarbetsuppdrag, flerstegsverktygsslingor i Muse Code — där både Metas egen split och AAs coding-agent board visar de största maxvinsterna. A/B-testa det mot xhigh på ett urval av dina verkliga uppgifter först, eftersom mångordigheten är verklig.

• Stanna kvar på xhigh för högvolym, latenskänsliga eller korta anrop med en enda tur, där max främst bara lägger till tokens. Terminal-Bench är beviset på att det inte alltid tillför kapacitet.

• Håll koll på tre saker framöver: open-weights-utgåvan som Zuckerberg har lovat utan datum, konsumentutrullningen av Muse Spark 1.3 till Instagram, Facebook och Meta AI under de kommande veckorna, samt huruvida Artificial Analysis topplista för kodagenter börjar prissätta maxraden nu när konfigurationen är allmänt tillgänglig.

Tvådagarsgrinden visade sig vara kort, men den gjorde en poäng som överlever själva utrullningen: Metas starkaste Muse Spark 1.3-siffror var aldrig en hägring — de väntade bara på en säkerhetsgranskning. Från och med den 4 september är modellen en utvecklare kan anropa och modellen på resultattavlan äntligen samma modell. Huruvida max förtjänar sina tokens är nu en empirisk fråga som vilken utvecklare som helst kan besvara, på Metas API eller via vilken väg de än redan använder för att nå Muse Spark-familjen.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen