
Muse Spark 1.2 en Muse Code: Meta's derde model in vier maanden evenaart Grok 4.5
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Meta bracht Muse Spark 1.2 uit op 5 augustus 2026, vier weken na Muse Spark 1.1 en ruwweg vier maanden na de eerste Muse Spark. Deze kwam met iets wat de vorige twee niet hadden: een code-agent van Meta zelf, Muse Code, uitgebracht in bèta en meegetraind met het model waarop het draait. En op het enige scorebord waar noch Meta noch zijn rivalen controle over hebben, brengt de release Meta in een gelijkspel met SpaceXAI — Muse Spark 1.2 en Grok 4.5 scoren nu beide 54 op de Artificial Analysis Intelligence Index. Vijf dagen later kwam de grotere ontwikkeling: op 10 augustus zei Meta dat het de gewichten van Muse Spark 1.2 zal openstellen — een aankondiging die, als ze doorgaat, het model de sterkste huidige Amerikaanse open-weight rivaal van Chinese modellen zou maken.
Twee dingen moeten we uit elkaar houden voordat de onderstaande cijfers iets betekenen. De Intelligence Index-score, de latentiecijfers en de tokentellingen zijn afkomstig van Artificial Analysis, dat zijn eigen evaluaties uitvoert en de bevindingen publiceert; die zijn onafhankelijk. De coderingsresultaten waarmee Meta zijn aankondiging opende — Terminal-Bench 2.1, DeepSWE v1.1 en een interne benchmark — zijn uitgevoerd door Meta, op Meta's eigen testopstelling, waarbij elk concurrerend model was gekoppeld aan zijn eigen agentproduct. Beide soorten cijfers zijn nuttig. Het is niet hetzelfde soort bewijs, en dit artikel houdt ze gescheiden.
Wat Meta daadwerkelijk heeft uitgebracht

De aankondiging, geplaatst op Meta's AI-onderzoeksblog en gedateerd 5 augustus, betreft twee producten tegelijk.
• Muse Spark 1.2 — een codegerichte update van de Muse Spark-familie. Meta zegt dat het de trainingsrekenkracht voor codeertaken heeft opgeschaald en de diversiteit van trainingsomgevingen heeft verbreed, terwijl het de algemene-agentmogelijkheid behield waarmee de 1.1-release werd gepromoot. De vermelde trainingsdoelen hebben een lange horizon: generatie van volledige repositories, grote end-to-endprojecten en wat Meta 'auto-research' noemt, met planning voor het ordenen van werk, doelconditionering om koers te houden over vele stappen heen, en contextcompressie om de relevante toestand levend te houden naarmate een sessie langer duurt.
• Muse Code — een terminalgebaseerde codeeragent in bèta, geïnstalleerd met een eenregelig shellscript van Meta's ontwikkelaarsdomein. Het draait persistente asynchrone achtergrondagenten die een sessie overleven, op een lokale event-logruntime die Meta omschrijft als replay-exact en herstartveilig, en het coördineert meerdere subagenten per taak in geïsoleerde worktrees. Het wordt geleverd met drie gebundelde skills: /plan voor planning met een goedkeuringsstap, /grill voor het stresstesten van reeds voltooid werk, en /goal om een taak tot voltooiing te brengen.
De koppeling is niet toevallig. Meta zegt dat de twee gezamenlijk zijn getraind — het model werd afgestemd op via rejection-sampling verkregen trajecten uit de harness, met receptoptimalisaties voor doelen, compactie en subagenten. Dat is dezelfde co-trainingstrategie die Claude Code en Codex heeft voortgebracht, en het heeft een consequentie voor iedereen die benchmarkcijfers leest: de belangrijkste codeerscores van het model werden behaald binnen de harness waartegen het was getraind. Dat is geen bedrog, zo werkt agentische evaluatie tegenwoordig. Het betekent wel dat een score van 1,2 die via een ander scaffold is verkregen, een open vraag is in plaats van een veilige aanname.
De rest van de specificatie is ongewijzigd ten opzichte van 1.1, die zelf informatief is. De context blijft op 1.048.576 tokens. Reasoning blijft op vijf inspanningsniveaus verplicht — minimal, low, medium, high, xhigh — met medium als standaard; er is geen configuratie waarin je de gewichten krijgt zonder te betalen voor enig denkwerk. Bij de lancering waren de gewichten gesloten: er was geen Hugging Face-repository en Meta's eigen Model API was de enige first-party plek om het model aan te roepen. Die situatie gaat nu veranderen: op 10 augustus kondigde Meta aan dat het de gewichten zal openen, waarmee het beleid van gesloten gewichten dat voor de eerste drie Muse Spark-releases gold, wordt teruggedraaid.
43, dan 51, dan 54

{{1}}Artificial Analysis scoort Muse Spark 1.2 op 54 op zijn Intelligentie-Index{{/1}} {{2}}op de xhigh-redeneringsinstelling{{/2}}, {{3}}waarmee het #13 van 185 modellen staat{{/3}} {{4}}tegen een klassemediaan van 32{{/4}}. {{5}}De index is een gewogen samenstelling van negen evaluaties{{/5}} — {{6}}GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience en AA-LCR{{/6}} — {{7}}gelijk verdeeld over agents, codering, algemene capaciteit en wetenschappelijk redeneren{{/7}}.
Lees het als een reeks in plaats van een momentopname: het traject van Meta is het eigenlijke verhaal. De oorspronkelijke Muse Spark scoorde 43 in april. Muse Spark 1.1 bereikte 51 op 9 juli, een winst van acht punten in een kwartaal. Muse Spark 1.2 voegt in minder dan een maand drie punten toe. Meta is in vier maanden 11 indexpunten opgeschoven en levert nu sneller dan het evaluatie-ecosysteem kan bijbenen — er is nog steeds geen gepubliceerde uitsplitsing per benchmark voor 1.2, en helemaal geen Design Arena-record, terwijl 1.1 beide heeft.
Vierenvijftig plaatst Meta op gelijk niveau met Grok 4.5, het model dat SpaceXAI een dag vóór Muse Spark 1.1 uitbracht, en achter een hechte frontiergroep: Claude Opus 5 op 61, Claude Fable 5 op 60, GPT-5.6 Sol op 59. Het gat naar de top is zes of zeven punten. Het gat ten opzichte van waar Meta het jaar begon is elf. Of dat gat kleiner wordt, hangt af van of de cadans wordt volgehouden, en Meta zit momenteel op een releasecyclus van vier weken.
Een gelijkspel op een samengestelde index is echter geen gelijkspel op een taak, en het is de moeite waard om te zeggen wat de 54 wel en niet beslecht. Het stelt vast dat Muse Spark 1.2 wat betreft geaggregeerde capaciteit in dezelfde categorie valt als Grok 4.5. Het vertelt je niet welke van de twee betere patches schrijft, omdat de coderingssubindex die dat zou beantwoorden voor 1.2 nog niet is gepubliceerd.
Meta's codenummers, lees aandachtig
De aankondiging van Meta staat op drie grafieken bovenaan. Bij de eigen runs, gerapporteerd als pass@1 over vijf pogingen, waarbij elk concurrerend model is gekoppeld aan zijn eigen agentproduct:
• Terminal-Bench 2.1 — 82.9% voor Muse Spark 1.2, gestegen van 76.2% voor 1.1. Claude Opus 5 staat voorop met 86.7%.
• DeepSWE v1.1 — 59,3%, tegenover 53,0%.
• Meta's interne codeerbenchmark — 70,6%, gestegen van 68,3%.
De delta's zijn het geloofwaardige deel. Een winst van 6,7 punten op Terminal-Bench en 6,3 op DeepSWE, op dezelfde manier gemeten op dezelfde harness door hetzelfde team met een maand ertussen, is een redelijke indicatie van hoeveel 1.2 is verbeterd ten opzichte van 1.1 op het vlak waarop Meta optimaliseerde. De positie ten opzichte van andere leveranciers is het onderdeel dat je niet te serieus moet nemen: de koppeling van de harness is een grote vrije variabele, en een lab dat zijn eigen harness samen met zijn eigen model afstemt, is niet in staat om die van anderen net zo goed af te stemmen. Meta stond tweede op zijn eigen slide, wat op zijn minst niet de gebruikelijke vorm van een leveranciersbenchmark is, maar geen enkele derde partij heeft tot op heden iets ervan gereproduceerd.
De tweede prijslijst
Het belangrijkste in deze release is niet te vinden in de benchmarkgrafieken. Muse Spark 1.2 wordt geleverd met twee prijslijsten.
• Standaardlaag — $1,25 per miljoen invoertokens, $0,15 per miljoen bij een cachehit, $4,25 per miljoen uitvoertokens. Ongewijzigd ten opzichte van 1.1, tot op de cent. Snelheidslimiet van ongeveer 3.000 verzoeken per minuut. Websearch-grounding wordt apart gefactureerd tegen $2,50 per duizend zoekopdrachten.
• Bijdragersniveau — $0,10 invoer, $0,002 gecachte invoer, $0,20 uitvoer. Dat is 12,5× goedkoper op invoer en 21,25× goedkoper op uitvoer. De toegangsprijs is toestemming voor Meta om toekomstige modellen te trainen op jouw verkeer, en een snelheidslimiet van 60 verzoeken per minuut — 2% van het standaardbudget.
Bij $0,10 en $0,20 zou Muse Spark 1.2 vrijwel elk frontier-adjacent model op de markt onderbieden, inclusief de open-weights-budgetlaag waar het op prijs anders voor onderdoet. Dat is het interessante getal bij deze lancering, en het is niet echt een prijsbeslissing. Zestig verzoeken per minuut sluit de meeste productie-fan-out-patronen op zichzelf al uit, dus de laag is bedoeld voor experimenten en werk in kleine teams, niet voor serving. En "we kunnen op jouw dataverkeer trainen" is een vraag voor degene die datagovernance in jouw organisatie goedkeurt, niet voor degene die modellen kiest. Zie het als een juridische beoordeling met een korting eraan verbonden, niet als een goedkopere SKU.
Wat de 54 kost om te produceren

Artificial Analysis publiceert wat zijn eigen evaluatieruns kosten, en in die kolom komt de vorm van Muse Spark 1.2 naar voren. Het doorlopen van de negen-benchmarkssuite kostte $637,85 en verbruikte 95 miljoen output-tokens, tegenover $548,07 en 94 miljoen voor Muse Spark 1.1 — bij identieke prijzen per token. De extra 16% is puur denkwerk.
De latentiecijfers bewegen dezelfde kant op. Gemeten op xhigh is de tijd tot het eerste token 26.12 seconden voor 1.2 tegenover 2.90 seconden voor 1.1, en de outputsnelheid daalt van 213.5 naar 165.0 tokens per seconde. Meta kocht drie indexpunten met denktijd, en het ontwerp met verplicht redeneren betekent dat je de aankoop niet kunt weigeren — alleen kiezen hoeveel je ervan maakt.
{{1}}Dat cijfer van 26 seconden zal verkeerd worden geciteerd, dus hier is de correctie bij voorbaat: het is een meting op het duurste inspanningsniveau dat het model beschikbaar stelt, en de API gebruikt standaard medium.{{/1}} {{2}}Als referentiepunt uit echt verkeer in plaats van een benchmarkomgeving, toont Muse Spark 1.1 via OrcaRouter — bij welke inspanning de aanvragers ook daadwerkelijk opvragen — een 7-daagse p50-tijd tot eerste token van 1.84 seconden en een p95 van 6.00 seconden, bij 519 tokens per seconde en een foutpercentage van nul.{{/2}} {{3}}Benchmarklatentie bij maximale inspanning en productielatentie bij standaard inspanning zijn verschillende grootheden, en ze verschillen meestal een orde van grootte.{{/3}} {{4}}Lees 26.12s als het plafond voor diep redeneren, niet als hoe een verzoek zal aanvoelen.{{/4}}
Waar u vandaag kunt bellen.
Muse Spark 1.2 wordt aangeboden via Meta's eigen Model API en, op dit moment, nergens anders — er is nog geen Hugging Face-repository en het staat niet in de OrcaRouter-catalogus. Dat is wat de aankondiging van 10 augustus gaat veranderen: Meta zegt dat de gewichten 'in de komende weken' openbaar worden, en zodra dat gebeurt verschuift de beschikbaarheidsvraag van 'waar wordt het aangeboden?' naar 'welke gewichten, onder welke licentie en in welke runtimes'. Muse Spark 1.1 staat in de OrcaRouter-catalogus, tegen $1,25 en $4,25 — dezelfde bedragen die Meta rekent, want OrcaRouter rekent 0% opslag en geeft de lijstprijs van de provider direct door.
Dat is belangrijker voor de vergelijking dan voor het model zelf. Als je voor deze release een kostenmodel opstelt, zitten de modellen waartegen je het zou benchmarken — Claude Opus 5, Claude Fable 5, GPT-5.6 Sol, Grok 4.5, DeepSeek V4 Flash — achter één enkele sleutel tegen de catalogusprijs, dus het cijfer in je spreadsheet is het cijfer op de factuur, en een prijsverlaging van de provider gaat dezelfde dag in in plaats van na een contractverlenging. Specifiek voor Muse Spark 1.2 is het antwoord vandaag Meta's endpoint, een tweede contract en een aparte factuur — en zodra de gewichten beschikbaar zijn, wordt een self-hosted installatie een derde optie.
Wat is er veranderd op 10 augustus
Vijf dagen na de release sloeg de houding van Meta ten opzichte van zijn eigen vlaggenschip om. In een aankondiging van 10 augustus zei Meta dat het de gewichten van Muse Spark 1.2 'in de komende weken' zal openen, waarmee dit de eerste Muse Spark-release wordt die een team zelf kan draaien. De verklaring is een uitspraak van het bestuur, geen uitgebrachte software: er is nog geen Hugging Face-repository en de exacte datum, het aantal parameters en de licentie zijn allemaal onbevestigd.
De inzet is de race om frontier-gewichten. Muse Spark 1.2 scoort 54 op de Artificial Analysis Intelligence Index — boven elk Amerikaans open-weight model dat momenteel downloadbaar is — dus als de gewichten komen zoals beloofd, zou het de sterkste Amerikaanse open-weight rivaal van de Chinese labs zijn, de framing die Zuckerberg op 10 augustus uitvoerig bepleitte in een essay van 6.500 woorden waarin hij Amerikaanse beperkingen op trainingsdata ervan beschuldigt de leiding op het gebied van open-gewichten aan buitenlandse labs te geven. De koerswijziging heeft al een eerste levering: Muse Glimmer, een model met 30 miljard parameters dat dezelfde dag werd uitgebracht onder een Apache 2.0-licentie, gedestilleerd uit Muse Spark en gebouwd voor lokale agentische workloads. Meta's eigen benchmarks plaatsen het boven Google's Gemma4-31B en Qwen3.6-27B bij agent-taken; die cijfers zijn door de leverancier uitgevoerd en tot nu toe niet gereproduceerd.
Waar de aankondiging geen antwoord op gaf
• Geen onafhankelijk coderingsgetal. Artificial Analysis publiceert een samengestelde score voor 1.2, maar nog niet de coderings- en agentische subindices die het voor 1.1 publiceerde (respectievelijk 71.3 en 37.5). Aangezien agentisch werk met grote afstand de zwakste dimensie van 1.1 was, en agentisch coderen precies is wat 1.2 beweert te hebben opgelost, is dit het getal dat de release zou bepalen.
• De harness-resultaten zijn niet gereproduceerd. Elke codeerscore in de aankondiging is door Meta uitgevoerd. Niemand heeft nog Muse Spark 1.2-scores gepubliceerd vanuit een neutraal raamwerk.
• Geen multimodale verificatie. De Muse Spark-vermelding adverteert tekst-, beeld-, video-, audio- en PDF-invoer. De onafhankelijke evaluatie omvat tekst en beeld. Meta's communicatie over 1.2 is bijna volledig overgegaan naar softwarewerk, en de mixed-media-use case 1.1, die expliciet werd verkocht, heeft voorlopig noch marketing noch meting achter zich.
• Geen doorvoergeschiedenis. Het volume op het endpoint is nog te laag om de gebruikelijke voortschrijdende latentiestatistieken te genereren.
Wat kun je de komende vier weken bekijken
Vier dingen bepalen of deze release is wat Meta ervan zegt. De eerste is een onafhankelijke agentic-score voor 1.2 — als de subindex die op 1.1 op 37,5 stond substantieel is bewogen, is de codeerclaim reëel. De tweede is of iemand het Terminal-Bench-resultaat buiten Muse Code reproduceert; een model dat alleen presteert binnen zijn eigen testopstelling is een product, geen capaciteit. De derde is wat er met de contributortier gebeurt: als de limiet van 60 aanvragen versoepelt, verandert een frontier-adjacent model met $0,10 input en $0,20 output de rekenkunde van de budgettier op een manier die een indexwinst van drie punten nooit zou doen. De vierde is de weights-belofte: Meta zegt dat de weights van Muse Spark 1.2 'in de komende weken' open gaan, en of de repository binnen die termijn verschijnt — onder welke licentie en hoe snel lokale runtimes het oppakken — zal bepalen of de open-weights-omslag echt is.
En als het ritme standhoudt, staat Muse Spark 1.3 gepland voor begin september. Op basis hiervan is het getal om in de gaten te houden wanneer hij uitkomt niet de indexscore. Het is de vraag of Meta mogelijkheden kan toevoegen zonder nog eens twintig seconden denktijd aan het begin van elk verzoek toe te voegen. De eerste vrucht van die koerswijziging is al uit: Muse Glimmer, een open-weight model met 30 miljard parameters dat Meta op 10 augustus onder een Apache 2.0-licentie heeft uitgebracht, gebouwd om agents lokaal te draaien — de meest nabije preview tot nu toe van hoe een open Muse Spark 1.2 eruitziet.
Vergeleken in dit artikel3
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
