
Muse Spark 1.3 Max Reasoning is live: de instelling achter Meta's topscores wordt nu voor iedereen uitgerold.
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 221 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAINIEUWGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 110 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Muse Spark 1.3 — het grensverleggende redeneringsmodel dat Meta Superintelligence Labs op 2 september uitbracht — heeft zojuist de modus gekregen waarop zijn eigen scorebord was gebouwd. Op 4 september, na twee dagen extra veiligheidstests, heeft Meta de meest rekenintensieve 'max'-redeneringsinstelling van het model opengesteld voor ontwikkelaars via de Meta Model API en in Muse Code, zijn terminalcoderingsagent. Chief AI Officer Alexandr Wang kondigde de uitrol aan op X en het @AIatMeta-account van het bedrijf bevestigde het; wat bij de lancering een configuratie was die beperkt was tot Meta en een partnerpreview, is nu een redeneringsniveau dat elke ontwikkelaar kan selecteren.
That sequence matters because several of the numbers that dominated Muse Spark 1.3's launch coverage — 75.4 on DeepSWE v1.1, 66.9 on OSWorld 2.0, 1,754 on GDPval-AA v2 — came from the max configuration, while the model developers could actually call shipped with reasoning effort capped at "xhigh." Meta was explicit at launch that max was still in safety testing, but the split meant the headline scoreboard and the callable model were two different things for two days. Thursday's release collapses that gap, and it does so without touching the per-token price. The benchmark figures in that list are Meta's own and remain unreproduced by an independent harness; everything vendor-reported in this piece is labeled as such.Die volgorde is belangrijk omdat verschillende getallen die de lancering van Muse Spark 1.3 domineerden — 75,4 op DeepSWE v1.1, 66,9 op OSWorld 2.0, 1.754 op GDPval-AA v2 — afkomstig waren van de max-configuratie, terwijl het model dat ontwikkelaars daadwerkelijk konden aanroepen werd geleverd met de redeneerinspanning begrensd op "xhigh". Meta was bij de lancering expliciet dat max nog in veiligheidstests zat, maar de splitsing betekende dat de hoofdscorelijst en het aanroepbare model twee dagen lang twee verschillende dingen waren. De release van donderdag overbrugt die kloof, en dat gebeurt zonder de prijs per token aan te raken. De benchmarkcijfers in die lijst zijn Meta's eigen en blijven door een onafhankelijk testraamwerk niet gereproduceerd; alles wat in dit stuk door de leverancier is gerapporteerd, is als zodanig gelabeld.
Wat werd achtergehouden — en wat er op 4 september veranderde
Muse Spark 1.3's reasoning ladder heeft dezelfde vorm gehad sinds de betaalde API van de familie openging: reasoning is altijd aan, en de effort-parameter van het model op de Meta Model API neemt minimal, low, medium, high en xhigh aan, waarbij het model meer van zijn outputbudget aan denken besteedt naarmate het niveau stijgt. Max staat boven xhigh — meer compute, meer reasoning-tokens, en volgens Meta betekenisvol sterker bij agentisch werk over lange horizonten. Bij de lancering op 2 september leverde Meta elk niveau tot en met xhigh, maar hield max buiten de publieke API in afwachting van wat het aanvullende veiligheidstests noemde, en deelde het alleen met een beperkte set partners — genoeg voor een onafhankelijke evaluatie om te draaien, niet genoeg voor een productiewerklast.
Op 4 september zei Wang dat de tests waren afgerond. Max is nu een selecteerbare instelling in Muse Code — het installatiescript staat op dev.meta.ai/install.sh — en op het model-id muse-spark-1.3 via de Meta Model API, waar de effort-parameter nu max accepteert. Wang beschreef de gefaseerde uitrol over twee dagen als Meta's manier om toegang te reguleren "op configuratieniveau", en vertelde aan Axios dat Meta zijn bredere werk niet heeft hoeven pauzeren vanwege veiligheidszorgen. Het tijdsvenster was kort, maar het is een echt precedent: Meta is nu bereid om een specifieke redeneermodus achter een veiligheidsbeoordeling te houden terwijl de rest van een checkpoint onmiddellijk wordt uitgerold.
Een praktische kanttekening voor iedereen die het model via een gateway aanroept in plaats van via Meta's eigen endpoint: verschillende documentatiepagina's van derden en aggregatorlijsten zijn op de lanceringsdag geschreven en vermelden de reasoning effort nog steeds alleen tot en met xhigh. De maximale waarde wordt door Meta uitgerold, dus controleer of de route waarlangs je aanroept zijn geaccepteerde parameters heeft bijgewerkt voordat je ervan uitgaat dat max bereikbaar is — een proxy die op 2 september zijn geldige waarden heeft gevalideerd, kan 'max' afwijzen totdat de beheerders de achterstand hebben ingehaald.
Wat max daadwerkelijk oplevert — en waar het niet helpt
De materialen van Meta van donderdag bevatten een expliciete max-versus-xhigh-uitsplitsing op de benchmarks die het draait, en dit is het nuttigste wat het tot nu toe over het model heeft gepubliceerd. Dit alles is door de leverancier gerapporteerd, geproduceerd binnen Meta's eigen Muse Code-harness, en Meta zegt dat de vergelijkingen met Claude Opus 5 en GPT-5.6 Sol 'best-effort'-runs waren op de eigen maximale instellingen van die concurrenten, die 'mogelijk niet de door de provider geoptimaliseerde prestaties weerspiegelen'. Met die kanttekening vertelt de uitsplitsing een duidelijk richtinggevend verhaal:
• OSWorld 2.0 (computer-use agenttaken) — 66.9 bij max vs 57.2 bij xhigh
• GDPval-AA v2 (knowledge-work-agent Elo) — 1.754 bij max vs. 1.709 bij xhigh
• JobBench (professionele taken met lange horizon) — 64,9 bij max tegenover 61,2 bij xhigh
• DeepSearchQA — een gelijkspel op 89.4
• Terminal-Bench 2.1 (terminal-agent-codering) — 89,2 bij xhigh vs 88,8 bij max, de enige suite waarin de configuratie die op 2 september is uitgebracht wint.

Het patroon is de moeite waard om zorgvuldig te lezen. Max helpt het meest waar de taak een lange agentische lus is — het bedienen van een computer, het werken aan een kenniswerkopdracht, het aanhouden van een schema van deeltaken zoals JobBench dat doet. Op een single-turn-terminalbenchmark voegde het niets toe en kostte het een klein beetje: Terminal-Bench is de herinnering dat "meer redeneren" geen monotone upgrade is, en het is de reden om op je eigen workload A/B max tegen xhigh te testen in plaats van aan te nemen dat de hogere instelling overal beter is. Meta bestempelt ook het DeepSWE v1.1-resultaat van 75.4 — de kop van dag één, gestegen van de 59.3 die Meta zes weken eerder voor Muse Spark 1.2 rapporteerde — als een max-configuratiegetal. Dat is het cijfer dat onafhankelijke evaluatoren als eerste opnieuw zullen draaien.
De onafhankelijke lezing begint in te halen.
Er was bij de lancering geen enkele onafhankelijke meting, en dat hiaat wordt nu opgevuld volgens een schema dat toevallig samenvalt met de max-uitrol. De Coding Agent Index van Artificial Analysis — die elk model in zijn eigen native coding-agent-harness beoordeelt en taken uit DeepSWE, Terminal-Bench en SWE-Atlas combineert — plaatste Muse Spark 1.3 (max) deze week in de Muse Code-harness op 68, tweede op de ranglijst achter Claude Opus 5 (xhigh) in Claude Code en vóór Claude Fable 5 (max) op 67 en GPT-5.6 Sol (max) op 65. Dezelfde ranglijst geeft de uitgebrachte xhigh-configuratie een score van 64 in dezelfde Muse Code-harness, wat de zuiverste like-for-like-meting tot nu toe is van wat max toevoegt — ruwweg vier indexpunten — op een onafhankelijke taakset. Die ranglijstregel werd gepubliceerd terwijl max nog in partnerpreview was; de configuratie die erin wordt beschreven, is degene die op 4 september algemeen beschikbaar werd.
Artificial Analysis heeft na de uitrol ook zijn eigen modelkaart voor de max-configuratie bijgewerkt. In de previewperiode vermeldde de kaart geen provider en geen prijs; nu de kaart live is, vermeldt deze Meta tegen de standaardprijs van $1,25 per miljoen inputtokens en $4,25 per miljoen outputtokens — dezelfde catalogusprijs als Muse Spark 1.2 — met daarbij een kanttekening over de uitvoerigheid: de evaluatierun van AA verbruikte ruwweg 130 miljoen tokens tegen een mediaan van 79 miljoen, kostte in totaal ongeveer $1.335, en komt volgens de per-taakschatting van AA uit op bijna $0,95 per taak, bij ongeveer 190 outputtokens per seconde.
Eén getal uit eerdere berichtgeving verdient een versiecheck. Artificial Analysis heeft zijn Intelligence Index deze week ververst naar v4.2 — dezelfde week dat max werd uitgebracht — waarbij het veld opnieuw is gescoord en de medianen zijn verschoven. Op de huidige kaart komt de max-configuratie uit op 53 tegen een mediaan van 29 voor vergelijkbare modellen; de 62 die circuleerde in de berichtgeving rond de lancering werd gemeten op de vorige versie van de index, en de twee zijn niet vergelijkbaar. Meta's eigen xhigh-versus-max-opsplitsing hierboven is onafhankelijk van AA's index en wordt niet beïnvloed door de verversing.

Wat de max kost — de rekening zit in de tokens, niet in de prijslijst
Meta publiceert geen aparte prijs voor de max-configuratie en ook geen specifieke latentieanalyse. De prijs per token is identiek aan Muse Spark 1.2 en aan elk ander inspanningsniveau op Muse Spark 1.3: $1,25 per miljoen invoertokens, $4,25 per miljoen uitvoertokens en $0,15 voor gecachte invoer op de standaardlaag. Redeneringstokens worden gefactureerd als uitvoertokens en worden in mindering gebracht op het uitvoerbudget. Kiezen voor max is dus geen prijsverhoging die als aparte regel op de factuur staat — het is een belofte om meer van dat budget te besteden aan nadenken voordat er een antwoord wordt gegeven.
Daarmee draait de echte kostenkwestie om tokenvolume, en de vroege data wijzen uit dat max prijzig is, precies waar xhigh zuinig is. De geïnstrumenteerde run van AA verbruikte zo'n 130 miljoen tokens bij één evaluatie van de configuratie. Voor een ontwikkelaar die al lange agentic loops op xhigh draait, is de A/B-test die ertoe doet niet of max meer taken haalt, maar of max genoeg extra taken haalt om een substantieel grotere tokenrekening voor dezelfde workload te rechtvaardigen.
De Contributor-tier van Meta — $0,10 in en $0,20 uit per miljoen tokens in ruil voor toestemming aan Meta om op jouw prompts en completions te trainen — geldt voor hetzelfde checkpoint, en Meta zegt dat een substantieel tweecijferig percentage van de ontwikkelaars hiervoor kiest. De voorwaarden van Contributor maken elke inzending tot trainingsdata en de rate limits liggen laag, waardoor het een slechte standaardoptie is voor fan-out in productie, maar wel een legitieme manier om dure max-experimenten goedkoop te draaien als je de dataruil acceptabel vindt.
Het prijsanker voor dit alles is eenvoudig te controleren zonder Meta op zijn woord te hoeven geloven, want de checkpoint Muse Spark 1.3 is even duur als wat er al op OrcaRouter staat tegen Meta’s eigen lijstprijs: Muse Spark 1.2 staat op OrcaRouter voor $1,25 input en $4,25 output per miljoen tokens, zonder opslag, dus de bewering over een “ongewijzigde prijs” is te controleren via een livepagina die precies die cijfers toont. Muse Spark 1.3 zelf staat nog niet op OrcaRouter. Zodra een provider die wij voeren het model met max gaat aanbieden, is de prijs die aan onze kant wordt getoond de lijstprijs van Meta, rechtstreeks doorberekend — wij rekenen geen opslag op providerprijzen — en een eventuele verlaging door de leverancier gaat live op dezelfde dag dat Meta die doorvoert. Bij een release als deze, waar de interessante economie in het tokenvolume zit in plaats van in de prijs die vooropstaat, zorgt die doorberekening ervoor dat het bedrag waarvoor je daadwerkelijk wordt gefactureerd gelijk is aan het bedrag dat Meta publiceert.

Wie zou er naar max moeten overstappen?
De beslissing valt duidelijk uiteen:
• Switch voor langetermijn-agentische workloads — computergebruik, kenniswerkbriefs, meerstaps-tool-lussen in Muse Code — waar zowel Meta’s eigen split als AA’s coding-agent-board de grootste maximale winsten tonen. A/B-test het eerst tegen xhigh op een steekproef van je echte taken, want de uitvoerigheid is reëel.
• Blijf xhigh gebruiken voor high-volume, latentiegevoelige of korte single-turn-aanroepen, waarbij max vooral tokens toevoegt. Terminal-Bench is het bewijs dat het niet altijd extra mogelijkheden toevoegt.
Houd vanaf nu drie dingen in de gaten: de open-weights-release die Zuckerberg zonder datum heeft beloofd, de consumentenuitrol van Muse Spark 1.3 op Instagram, Facebook en Meta AI in de komende weken, en of het coding-agent-board van Artificial Analysis de max-rij begint te prijzen nu de configuratie algemeen beschikbaar is.
De twee dagen durende pauze bleek kort, maar bewees een punt dat de uitrol zelf overleeft: Meta's sterkste Muse Spark 1.3-cijfers waren nooit een luchtspiegeling — ze wachtten alleen op een veiligheidsbeoordeling. Vanaf 4 september zijn het model dat een ontwikkelaar kan aanroepen en het model op het scorebord eindelijk hetzelfde model. Of max zijn tokens verdient, is nu een empirische vraag die elke ontwikkelaar kan beantwoorden, via Meta's API of via welke route ze ook al gebruiken om de Muse Spark-familie te bereiken.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
