Een hero-titelkaart voor het nieuws dat Muse Spark 1.3 met maximale redenering nu live is. Overline 'Meta Superintelligence Labs — 4 september 2026', kop 'Muse Spark 1.3 met maximale redenering is nu live', ondertitel die vermeldt dat Meta twee dagen na de lancering de veiligheidstesten heeft doorstaan en de redeneermodus achter de topresultaten in Muse Code en de Meta Model API tegen dezelfde prijs heeft geopend, badges 'reasoning effort: max', 'zelfde catalogusprijs van $1,25 / $4,25' en 'de configuratie achter DeepSWE 75.4', footer 'Nu selecteerbaar op muse-spark-1.3 — redeneringstokens worden als output gefactureerd', OrcaRouter-logo rechtsonder samengesteld.
Guides & Insights

Muse Spark 1.3 Max Reasoning is live: de instelling achter Meta's topscores wordt nu voor iedereen uitgerold.

Auteur

Elias Hawthorne

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Muse Spark 1.3 — het grensverleggende redeneringsmodel dat Meta Superintelligence Labs op 2 september uitbracht — heeft zojuist de modus gekregen waarop zijn eigen scorebord was gebouwd. Op 4 september, na twee dagen extra veiligheidstests, heeft Meta de meest rekenintensieve 'max'-redeneringsinstelling van het model opengesteld voor ontwikkelaars via de Meta Model API en in Muse Code, zijn terminalcoderingsagent. Chief AI Officer Alexandr Wang kondigde de uitrol aan op X en het @AIatMeta-account van het bedrijf bevestigde het; wat bij de lancering een configuratie was die beperkt was tot Meta en een partnerpreview, is nu een redeneringsniveau dat elke ontwikkelaar kan selecteren.

That sequence matters because several of the numbers that dominated Muse Spark 1.3's launch coverage — 75.4 on DeepSWE v1.1, 66.9 on OSWorld 2.0, 1,754 on GDPval-AA v2 — came from the max configuration, while the model developers could actually call shipped with reasoning effort capped at "xhigh." Meta was explicit at launch that max was still in safety testing, but the split meant the headline scoreboard and the callable model were two different things for two days. Thursday's release collapses that gap, and it does so without touching the per-token price. The benchmark figures in that list are Meta's own and remain unreproduced by an independent harness; everything vendor-reported in this piece is labeled as such.Die volgorde is belangrijk omdat verschillende getallen die de lancering van Muse Spark 1.3 domineerden — 75,4 op DeepSWE v1.1, 66,9 op OSWorld 2.0, 1.754 op GDPval-AA v2 — afkomstig waren van de max-configuratie, terwijl het model dat ontwikkelaars daadwerkelijk konden aanroepen werd geleverd met de redeneerinspanning begrensd op "xhigh". Meta was bij de lancering expliciet dat max nog in veiligheidstests zat, maar de splitsing betekende dat de hoofdscorelijst en het aanroepbare model twee dagen lang twee verschillende dingen waren. De release van donderdag overbrugt die kloof, en dat gebeurt zonder de prijs per token aan te raken. De benchmarkcijfers in die lijst zijn Meta's eigen en blijven door een onafhankelijk testraamwerk niet gereproduceerd; alles wat in dit stuk door de leverancier is gerapporteerd, is als zodanig gelabeld.

Wat werd achtergehouden — en wat er op 4 september veranderde

Muse Spark 1.3's reasoning ladder heeft dezelfde vorm gehad sinds de betaalde API van de familie openging: reasoning is altijd aan, en de effort-parameter van het model op de Meta Model API neemt minimal, low, medium, high en xhigh aan, waarbij het model meer van zijn outputbudget aan denken besteedt naarmate het niveau stijgt. Max staat boven xhigh — meer compute, meer reasoning-tokens, en volgens Meta betekenisvol sterker bij agentisch werk over lange horizonten. Bij de lancering op 2 september leverde Meta elk niveau tot en met xhigh, maar hield max buiten de publieke API in afwachting van wat het aanvullende veiligheidstests noemde, en deelde het alleen met een beperkte set partners — genoeg voor een onafhankelijke evaluatie om te draaien, niet genoeg voor een productiewerklast.

Op 4 september zei Wang dat de tests waren afgerond. Max is nu een selecteerbare instelling in Muse Code — het installatiescript staat op dev.meta.ai/install.sh — en op het model-id muse-spark-1.3 via de Meta Model API, waar de effort-parameter nu max accepteert. Wang beschreef de gefaseerde uitrol over twee dagen als Meta's manier om toegang te reguleren "op configuratieniveau", en vertelde aan Axios dat Meta zijn bredere werk niet heeft hoeven pauzeren vanwege veiligheidszorgen. Het tijdsvenster was kort, maar het is een echt precedent: Meta is nu bereid om een specifieke redeneermodus achter een veiligheidsbeoordeling te houden terwijl de rest van een checkpoint onmiddellijk wordt uitgerold.

Een praktische kanttekening voor iedereen die het model via een gateway aanroept in plaats van via Meta's eigen endpoint: verschillende documentatiepagina's van derden en aggregatorlijsten zijn op de lanceringsdag geschreven en vermelden de reasoning effort nog steeds alleen tot en met xhigh. De maximale waarde wordt door Meta uitgerold, dus controleer of de route waarlangs je aanroept zijn geaccepteerde parameters heeft bijgewerkt voordat je ervan uitgaat dat max bereikbaar is — een proxy die op 2 september zijn geldige waarden heeft gevalideerd, kan 'max' afwijzen totdat de beheerders de achterstand hebben ingehaald.

Wat max daadwerkelijk oplevert — en waar het niet helpt

De materialen van Meta van donderdag bevatten een expliciete max-versus-xhigh-uitsplitsing op de benchmarks die het draait, en dit is het nuttigste wat het tot nu toe over het model heeft gepubliceerd. Dit alles is door de leverancier gerapporteerd, geproduceerd binnen Meta's eigen Muse Code-harness, en Meta zegt dat de vergelijkingen met Claude Opus 5 en GPT-5.6 Sol 'best-effort'-runs waren op de eigen maximale instellingen van die concurrenten, die 'mogelijk niet de door de provider geoptimaliseerde prestaties weerspiegelen'. Met die kanttekening vertelt de uitsplitsing een duidelijk richtinggevend verhaal:

• OSWorld 2.0 (computer-use agenttaken) — 66.9 bij max vs 57.2 bij xhigh

• GDPval-AA v2 (knowledge-work-agent Elo) — 1.754 bij max vs. 1.709 bij xhigh

• JobBench (professionele taken met lange horizon) — 64,9 bij max tegenover 61,2 bij xhigh

• DeepSearchQA — een gelijkspel op 89.4

• Terminal-Bench 2.1 (terminal-agent-codering) — 89,2 bij xhigh vs 88,8 bij max, de enige suite waarin de configuratie die op 2 september is uitgebracht wint.

A comparison scoreboard titled 'Muse Spark 1.3 — max vs xhigh, the split'. Left column Max (released Sept 4, 2026): OSWorld 2.0 66.9, Terminal-Bench 2.1 88.8, GDPval-AA v2 (Elo) 1,754, JobBench 64.9, DeepSearchQA 89.4, Available to all developers. Right column Xhigh (released Sept 2, 2026): OSWorld 2.0 57.2, Terminal-Bench 2.1 89.2, GDPval-AA v2 (Elo) 1,709, JobBench 61.2, DeepSearchQA 89.4, Available to all developers. Footer: 'Benchmark splits per Meta's Sept 4 release materials — vendor-reported, not independently reproduced. Xhigh wins Terminal-Bench 2.1.' OrcaRouter logo bottom-right.

Het patroon is de moeite waard om zorgvuldig te lezen. Max helpt het meest waar de taak een lange agentische lus is — het bedienen van een computer, het werken aan een kenniswerkopdracht, het aanhouden van een schema van deeltaken zoals JobBench dat doet. Op een single-turn-terminalbenchmark voegde het niets toe en kostte het een klein beetje: Terminal-Bench is de herinnering dat "meer redeneren" geen monotone upgrade is, en het is de reden om op je eigen workload A/B max tegen xhigh te testen in plaats van aan te nemen dat de hogere instelling overal beter is. Meta bestempelt ook het DeepSWE v1.1-resultaat van 75.4 — de kop van dag één, gestegen van de 59.3 die Meta zes weken eerder voor Muse Spark 1.2 rapporteerde — als een max-configuratiegetal. Dat is het cijfer dat onafhankelijke evaluatoren als eerste opnieuw zullen draaien.

De onafhankelijke lezing begint in te halen.

Er was bij de lancering geen enkele onafhankelijke meting, en dat hiaat wordt nu opgevuld volgens een schema dat toevallig samenvalt met de max-uitrol. De Coding Agent Index van Artificial Analysis — die elk model in zijn eigen native coding-agent-harness beoordeelt en taken uit DeepSWE, Terminal-Bench en SWE-Atlas combineert — plaatste Muse Spark 1.3 (max) deze week in de Muse Code-harness op 68, tweede op de ranglijst achter Claude Opus 5 (xhigh) in Claude Code en vóór Claude Fable 5 (max) op 67 en GPT-5.6 Sol (max) op 65. Dezelfde ranglijst geeft de uitgebrachte xhigh-configuratie een score van 64 in dezelfde Muse Code-harness, wat de zuiverste like-for-like-meting tot nu toe is van wat max toevoegt — ruwweg vier indexpunten — op een onafhankelijke taakset. Die ranglijstregel werd gepubliceerd terwijl max nog in partnerpreview was; de configuratie die erin wordt beschreven, is degene die op 4 september algemeen beschikbaar werd.

Artificial Analysis heeft na de uitrol ook zijn eigen modelkaart voor de max-configuratie bijgewerkt. In de previewperiode vermeldde de kaart geen provider en geen prijs; nu de kaart live is, vermeldt deze Meta tegen de standaardprijs van $1,25 per miljoen inputtokens en $4,25 per miljoen outputtokens — dezelfde catalogusprijs als Muse Spark 1.2 — met daarbij een kanttekening over de uitvoerigheid: de evaluatierun van AA verbruikte ruwweg 130 miljoen tokens tegen een mediaan van 79 miljoen, kostte in totaal ongeveer $1.335, en komt volgens de per-taakschatting van AA uit op bijna $0,95 per taak, bij ongeveer 190 outputtokens per seconde.

Eén getal uit eerdere berichtgeving verdient een versiecheck. Artificial Analysis heeft zijn Intelligence Index deze week ververst naar v4.2 — dezelfde week dat max werd uitgebracht — waarbij het veld opnieuw is gescoord en de medianen zijn verschoven. Op de huidige kaart komt de max-configuratie uit op 53 tegen een mediaan van 29 voor vergelijkbare modellen; de 62 die circuleerde in de berichtgeving rond de lancering werd gemeten op de vorige versie van de index, en de twee zijn niet vergelijkbaar. Meta's eigen xhigh-versus-max-opsplitsing hierboven is onafhankelijk van AA's index en wordt niet beïnvloed door de verversing.

A screenshot of the Artificial Analysis model page for Muse Spark 1.3 (max), showing a score of 53 on the Artificial Analysis Intelligence Index against a comparable-model median of 29, input pricing of $1.25 and output pricing of $4.25 per 1M tokens with an 88% cache discount, a per-task cost estimate near $0.95, about 190 output tokens per second, a 1M-token context window, and a note that the configuration is 'somewhat verbose' after generating roughly 130M tokens against a 79M median.

Wat de max kost — de rekening zit in de tokens, niet in de prijslijst

Meta publiceert geen aparte prijs voor de max-configuratie en ook geen specifieke latentieanalyse. De prijs per token is identiek aan Muse Spark 1.2 en aan elk ander inspanningsniveau op Muse Spark 1.3: $1,25 per miljoen invoertokens, $4,25 per miljoen uitvoertokens en $0,15 voor gecachte invoer op de standaardlaag. Redeneringstokens worden gefactureerd als uitvoertokens en worden in mindering gebracht op het uitvoerbudget. Kiezen voor max is dus geen prijsverhoging die als aparte regel op de factuur staat — het is een belofte om meer van dat budget te besteden aan nadenken voordat er een antwoord wordt gegeven.

Daarmee draait de echte kostenkwestie om tokenvolume, en de vroege data wijzen uit dat max prijzig is, precies waar xhigh zuinig is. De geïnstrumenteerde run van AA verbruikte zo'n 130 miljoen tokens bij één evaluatie van de configuratie. Voor een ontwikkelaar die al lange agentic loops op xhigh draait, is de A/B-test die ertoe doet niet of max meer taken haalt, maar of max genoeg extra taken haalt om een substantieel grotere tokenrekening voor dezelfde workload te rechtvaardigen.

De Contributor-tier van Meta — $0,10 in en $0,20 uit per miljoen tokens in ruil voor toestemming aan Meta om op jouw prompts en completions te trainen — geldt voor hetzelfde checkpoint, en Meta zegt dat een substantieel tweecijferig percentage van de ontwikkelaars hiervoor kiest. De voorwaarden van Contributor maken elke inzending tot trainingsdata en de rate limits liggen laag, waardoor het een slechte standaardoptie is voor fan-out in productie, maar wel een legitieme manier om dure max-experimenten goedkoop te draaien als je de dataruil acceptabel vindt.

Het prijsanker voor dit alles is eenvoudig te controleren zonder Meta op zijn woord te hoeven geloven, want de checkpoint Muse Spark 1.3 is even duur als wat er al op OrcaRouter staat tegen Meta’s eigen lijstprijs: Muse Spark 1.2 staat op OrcaRouter voor $1,25 input en $4,25 output per miljoen tokens, zonder opslag, dus de bewering over een “ongewijzigde prijs” is te controleren via een livepagina die precies die cijfers toont. Muse Spark 1.3 zelf staat nog niet op OrcaRouter. Zodra een provider die wij voeren het model met max gaat aanbieden, is de prijs die aan onze kant wordt getoond de lijstprijs van Meta, rechtstreeks doorberekend — wij rekenen geen opslag op providerprijzen — en een eventuele verlaging door de leverancier gaat live op dezelfde dag dat Meta die doorvoert. Bij een release als deze, waar de interessante economie in het tokenvolume zit in plaats van in de prijs die vooropstaat, zorgt die doorberekening ervoor dat het bedrag waarvoor je daadwerkelijk wordt gefactureerd gelijk is aan het bedrag dat Meta publiceert.

A screenshot of the OrcaRouter model page for Muse Spark 1.2, the checkpoint Muse Spark 1.3 is priced identically to, showing header stats $1.25 input and $4.25 output per million tokens, p50 time-to-first-token 7.84 s, p50 total 10.00 s and 48.9M, the description 'Muse Spark 1.2 is Meta's reasoning model for complex agentic tasks... a drop-in upgrade rather than a new tier', and the 'Get the Muse Spark 1.2 API' and 'Try in playground' buttons.

Wie zou er naar max moeten overstappen?

De beslissing valt duidelijk uiteen:

• Switch voor langetermijn-agentische workloads — computergebruik, kenniswerkbriefs, meerstaps-tool-lussen in Muse Code — waar zowel Meta’s eigen split als AA’s coding-agent-board de grootste maximale winsten tonen. A/B-test het eerst tegen xhigh op een steekproef van je echte taken, want de uitvoerigheid is reëel.

• Blijf xhigh gebruiken voor high-volume, latentiegevoelige of korte single-turn-aanroepen, waarbij max vooral tokens toevoegt. Terminal-Bench is het bewijs dat het niet altijd extra mogelijkheden toevoegt.

Houd vanaf nu drie dingen in de gaten: de open-weights-release die Zuckerberg zonder datum heeft beloofd, de consumentenuitrol van Muse Spark 1.3 op Instagram, Facebook en Meta AI in de komende weken, en of het coding-agent-board van Artificial Analysis de max-rij begint te prijzen nu de configuratie algemeen beschikbaar is.

De twee dagen durende pauze bleek kort, maar bewees een punt dat de uitrol zelf overleeft: Meta's sterkste Muse Spark 1.3-cijfers waren nooit een luchtspiegeling — ze wachtten alleen op een veiligheidsbeoordeling. Vanaf 4 september zijn het model dat een ontwikkelaar kan aanroepen en het model op het scorebord eindelijk hetzelfde model. Of max zijn tokens verdient, is nu een empirische vraag die elke ontwikkelaar kan beantwoorden, via Meta's API of via welke route ze ook al gebruiken om de Muse Spark-familie te bereiken.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt