
Muse Spark 1.2 en Muse Code: Meta's derde model in vier maanden evenaart Grok 4.5
- metaNIEUWMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenNIEUWQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekNIEUWDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- qwenNIEUWQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens · 188 tok/s
- orcaNIEUWOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNIEUWAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1653Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1560Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligentie71Coderen
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligentie77Coderen
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligentie77Coderen
- grokxAI: Grok 4.52026-07-0856Intelligentie72Coderen
- tencentTencent: Hy32026-07-0642Intelligentie59Coderen
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligentie42Coderen
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligentie39Coderen
- anthropicAnthropic: Claude Sonnet 52026-06-3055Intelligentie72Coderen
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligentie52Coderen57Wiskunde
- z-aiZ.ai: GLM 5.22026-06-1653Intelligentie69Coderen60Wiskunde
Meta lanceerde Muse Spark 1.2 op 5 augustus 2026, vier weken na Muse Spark 1.1 en ruwweg vier maanden na de eerste Muse Spark. Deze versie kwam met iets dat de vorige twee niet hadden: een codeeragent van Meta zelf, Muse Code, uitgebracht in bèta en medegetraind met het model waarop het draait. En op de enige ranglijst waar noch Meta noch zijn rivalen controle over hebben, brengt de release Meta op gelijke hoogte met SpaceXAI — Muse Spark 1.2 en Grok 4.5 scoren nu allebei 54 op de Artificial Analysis Intelligence Index.
Twee dingen moeten we uit elkaar houden voordat de onderstaande cijfers iets betekenen. De Intelligence Index-score, de latentiecijfers en de tokentellingen zijn afkomstig van Artificial Analysis, dat zijn eigen evaluaties uitvoert en de bevindingen publiceert; die zijn onafhankelijk. De coderingsresultaten waarmee Meta zijn aankondiging opende — Terminal-Bench 2.1, DeepSWE v1.1 en een interne benchmark — zijn uitgevoerd door Meta, op Meta's eigen testopstelling, waarbij elk concurrerend model was gekoppeld aan zijn eigen agentproduct. Beide soorten cijfers zijn nuttig. Het is niet hetzelfde soort bewijs, en dit artikel houdt ze gescheiden.
Wat Meta daadwerkelijk heeft uitgebracht

De aankondiging, geplaatst op Meta's AI-onderzoeksblog en gedateerd 5 augustus, betreft twee producten tegelijk.
• Muse Spark 1.2 — een codegerichte update van de Muse Spark-familie. Meta zegt dat het de trainingsrekenkracht voor codeertaken heeft opgeschaald en de diversiteit van trainingsomgevingen heeft verbreed, terwijl het de algemene-agentmogelijkheid behield waarmee de 1.1-release werd gepromoot. De vermelde trainingsdoelen hebben een lange horizon: generatie van volledige repositories, grote end-to-endprojecten en wat Meta 'auto-research' noemt, met planning voor het ordenen van werk, doelconditionering om koers te houden over vele stappen heen, en contextcompressie om de relevante toestand levend te houden naarmate een sessie langer duurt.
• Muse Code — een terminalgebaseerde codeeragent in bèta, geïnstalleerd met een eenregelig shellscript van Meta's ontwikkelaarsdomein. Het draait persistente asynchrone achtergrondagenten die een sessie overleven, op een lokale event-logruntime die Meta omschrijft als replay-exact en herstartveilig, en het coördineert meerdere subagenten per taak in geïsoleerde worktrees. Het wordt geleverd met drie gebundelde skills: /plan voor planning met een goedkeuringsstap, /grill voor het stresstesten van reeds voltooid werk, en /goal om een taak tot voltooiing te brengen.
De koppeling is niet toevallig. Meta zegt dat de twee gezamenlijk zijn getraind — het model werd afgestemd op via rejection-sampling verkregen trajecten uit de harness, met receptoptimalisaties voor doelen, compactie en subagenten. Dat is dezelfde co-trainingstrategie die Claude Code en Codex heeft voortgebracht, en het heeft een consequentie voor iedereen die benchmarkcijfers leest: de belangrijkste codeerscores van het model werden behaald binnen de harness waartegen het was getraind. Dat is geen bedrog, zo werkt agentische evaluatie tegenwoordig. Het betekent wel dat een score van 1,2 die via een ander scaffold is verkregen, een open vraag is in plaats van een veilige aanname.
De rest van de specificatie is ongewijzigd ten opzichte van 1.1, die zelf informatief is. De context blijft op 1.048.576 tokens. Redeneren blijft verplicht op vijf inspanningsniveaus — minimaal, laag, medium, hoog, xhoog — met medium als standaard; er is geen configuratie waarbij je de gewichten krijgt zonder te betalen voor enige beredenering. De gewichten zijn gesloten, zonder Hugging Face-repository, en Meta's eigen Model-API blijft de enige first-party plek om het aan te roepen.
43, dan 51, dan 54

{{1}}Artificial Analysis scoort Muse Spark 1.2 op 54 op zijn Intelligentie-Index{{/1}} {{2}}op de xhigh-redeneringsinstelling{{/2}}, {{3}}waarmee het #13 van 185 modellen staat{{/3}} {{4}}tegen een klassemediaan van 32{{/4}}. {{5}}De index is een gewogen samenstelling van negen evaluaties{{/5}} — {{6}}GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience en AA-LCR{{/6}} — {{7}}gelijk verdeeld over agents, codering, algemene capaciteit en wetenschappelijk redeneren{{/7}}.
Lees het als een reeks in plaats van een momentopname: het traject van Meta is het eigenlijke verhaal. De oorspronkelijke Muse Spark scoorde 43 in april. Muse Spark 1.1 bereikte 51 op 9 juli, een winst van acht punten in een kwartaal. Muse Spark 1.2 voegt in minder dan een maand drie punten toe. Meta is in vier maanden 11 indexpunten opgeschoven en levert nu sneller dan het evaluatie-ecosysteem kan bijbenen — er is nog steeds geen gepubliceerde uitsplitsing per benchmark voor 1.2, en helemaal geen Design Arena-record, terwijl 1.1 beide heeft.
Vierenvijftig plaatst Meta op gelijk niveau met Grok 4.5, het model dat SpaceXAI een dag vóór Muse Spark 1.1 uitbracht, en achter een hechte frontiergroep: Claude Opus 5 op 61, Claude Fable 5 op 60, GPT-5.6 Sol op 59. Het gat naar de top is zes of zeven punten. Het gat ten opzichte van waar Meta het jaar begon is elf. Of dat gat kleiner wordt, hangt af van of de cadans wordt volgehouden, en Meta zit momenteel op een releasecyclus van vier weken.
Een gelijkspel op een samengestelde index is echter geen gelijkspel op een taak, en het is de moeite waard om te zeggen wat de 54 wel en niet beslecht. Het stelt vast dat Muse Spark 1.2 wat betreft geaggregeerde capaciteit in dezelfde categorie valt als Grok 4.5. Het vertelt je niet welke van de twee betere patches schrijft, omdat de coderingssubindex die dat zou beantwoorden voor 1.2 nog niet is gepubliceerd.
Meta's codenummers, lees aandachtig
De aankondiging van Meta staat op drie grafieken bovenaan. Bij de eigen runs, gerapporteerd als pass@1 over vijf pogingen, waarbij elk concurrerend model is gekoppeld aan zijn eigen agentproduct:
• Terminal-Bench 2.1 — 82.9% voor Muse Spark 1.2, gestegen van 76.2% voor 1.1. Claude Opus 5 staat voorop met 86.7%.
• DeepSWE v1.1 — 59,3%, tegenover 53,0%.
• Meta's interne codeerbenchmark — 70,6%, gestegen van 68,3%.
De delta's zijn het geloofwaardige deel. Een winst van 6,7 punten op Terminal-Bench en 6,3 op DeepSWE, op dezelfde manier gemeten op dezelfde harness door hetzelfde team met een maand ertussen, is een redelijke indicatie van hoeveel 1.2 is verbeterd ten opzichte van 1.1 op het vlak waarop Meta optimaliseerde. De positie ten opzichte van andere leveranciers is het onderdeel dat je niet te serieus moet nemen: de koppeling van de harness is een grote vrije variabele, en een lab dat zijn eigen harness samen met zijn eigen model afstemt, is niet in staat om die van anderen net zo goed af te stemmen. Meta stond tweede op zijn eigen slide, wat op zijn minst niet de gebruikelijke vorm van een leveranciersbenchmark is, maar geen enkele derde partij heeft tot op heden iets ervan gereproduceerd.
De tweede prijslijst
Het belangrijkste in deze release is niet te vinden in de benchmarkgrafieken. Muse Spark 1.2 wordt geleverd met twee prijslijsten.
• Standaardlaag — $1,25 per miljoen invoertokens, $0,15 per miljoen bij een cachehit, $4,25 per miljoen uitvoertokens. Ongewijzigd ten opzichte van 1.1, tot op de cent. Snelheidslimiet van ongeveer 3.000 verzoeken per minuut. Websearch-grounding wordt apart gefactureerd tegen $2,50 per duizend zoekopdrachten.
• Contributor tier — $0.10 input, $0.002 cached input, $0.20 output. That is 12.5× cheaper on input and 21.25× cheaper on output. The price of admission is permission for Meta to train future models on your traffic, and a rate cap of 60 requests per minute — 2% of the standard budget.
Bij $0,10 en $0,20 zou Muse Spark 1.2 vrijwel elk frontier-adjacent model op de markt onderbieden, inclusief de open-weights-budgetlaag waar het op prijs anders voor onderdoet. Dat is het interessante getal bij deze lancering, en het is niet echt een prijsbeslissing. Zestig verzoeken per minuut sluit de meeste productie-fan-out-patronen op zichzelf al uit, dus de laag is bedoeld voor experimenten en werk in kleine teams, niet voor serving. En "we kunnen op jouw dataverkeer trainen" is een vraag voor degene die datagovernance in jouw organisatie goedkeurt, niet voor degene die modellen kiest. Zie het als een juridische beoordeling met een korting eraan verbonden, niet als een goedkopere SKU.
Wat de 54 kost om te produceren

Artificial Analysis publiceert wat zijn eigen evaluatieruns kosten, en in die kolom komt de vorm van Muse Spark 1.2 naar voren. Het doorlopen van de negen-benchmarkssuite kostte $637,85 en verbruikte 95 miljoen output-tokens, tegenover $548,07 en 94 miljoen voor Muse Spark 1.1 — bij identieke prijzen per token. De extra 16% is puur denkwerk.
De latentiecijfers bewegen dezelfde kant op. Gemeten op xhigh is de tijd tot het eerste token 26.12 seconden voor 1.2 tegenover 2.90 seconden voor 1.1, en de outputsnelheid daalt van 213.5 naar 165.0 tokens per seconde. Meta kocht drie indexpunten met denktijd, en het ontwerp met verplicht redeneren betekent dat je de aankoop niet kunt weigeren — alleen kiezen hoeveel je ervan maakt.
{{1}}Dat cijfer van 26 seconden zal verkeerd worden geciteerd, dus hier is de correctie bij voorbaat: het is een meting op het duurste inspanningsniveau dat het model beschikbaar stelt, en de API gebruikt standaard medium.{{/1}} {{2}}Als referentiepunt uit echt verkeer in plaats van een benchmarkomgeving, toont Muse Spark 1.1 via OrcaRouter — bij welke inspanning de aanvragers ook daadwerkelijk opvragen — een 7-daagse p50-tijd tot eerste token van 1.84 seconden en een p95 van 6.00 seconden, bij 519 tokens per seconde en een foutpercentage van nul.{{/2}} {{3}}Benchmarklatentie bij maximale inspanning en productielatentie bij standaard inspanning zijn verschillende grootheden, en ze verschillen meestal een orde van grootte.{{/3}} {{4}}Lees 26.12s als het plafond voor diep redeneren, niet als hoe een verzoek zal aanvoelen.{{/4}}
Waar u vandaag kunt bellen.
Muse Spark 1.2 wordt aangeboden via Meta's eigen Model API en, op het moment van schrijven, nergens anders — het was bij de lancering niet beschikbaar op OpenRouter, er is geen Hugging Face-repository en het staat niet in de OrcaRouter-catalogus. Muse Spark 1.1 is beschikbaar voor $1,25 en $4,25 — dezelfde bedragen die Meta rekent, omdat OrcaRouter 0% opslag hanteert en de lijstprijs van de provider rechtstreeks doorberekent.
Dat is belangrijker voor de vergelijking dan voor het model zelf. Als je voor deze release een kostenmodel opstelt, dan zitten de modellen waarmee je het zou benchmarken — Claude Opus 5, Claude Fable 5, GPT-5.6 Sol, Grok 4.5, DeepSeek V4 Flash — achter één enkele key tegen de lijstprijs, dus het getal in je spreadsheet is het getal op de factuur, en een prijsverlaging van de provider gaat dezelfde dag in in plaats van pas na een verlenging. Voor Muse Spark 1.2 specifiek is het antwoord vandaag Meta's endpoint, een tweede contract en een aparte factuur.
Waar de aankondiging geen antwoord op gaf
• Geen onafhankelijk coderingsgetal. Artificial Analysis publiceert een samengestelde score voor 1.2, maar nog niet de coderings- en agentische subindices die het voor 1.1 publiceerde (respectievelijk 71.3 en 37.5). Aangezien agentisch werk met grote afstand de zwakste dimensie van 1.1 was, en agentisch coderen precies is wat 1.2 beweert te hebben opgelost, is dit het getal dat de release zou bepalen.
• De harness-resultaten zijn niet gereproduceerd. Elke codeerscore in de aankondiging is door Meta uitgevoerd. Niemand heeft nog Muse Spark 1.2-scores gepubliceerd vanuit een neutraal raamwerk.
• Geen multimodale verificatie. De Muse Spark-vermelding adverteert tekst-, beeld-, video-, audio- en PDF-invoer. De onafhankelijke evaluatie omvat tekst en beeld. Meta's communicatie over 1.2 is bijna volledig overgegaan naar softwarewerk, en de mixed-media-use case 1.1, die expliciet werd verkocht, heeft voorlopig noch marketing noch meting achter zich.
• Geen doorvoergeschiedenis. Het volume op het endpoint is nog te laag om de gebruikelijke voortschrijdende latentiestatistieken te genereren.
Wat kun je de komende vier weken bekijken
Drie dingen bepalen of deze release is wat Meta zegt dat het is. De eerste is een onafhankelijke agentische score voor 1.2 — als de sub-index die op 1.1 37,5 was aanzienlijk is veranderd, is de codeer-pitch echt. De tweede is of iemand het Terminal-Bench-resultaat buiten Muse Code reproduceert; een model dat alleen presteert binnen zijn eigen testomgeving is een product, geen capaciteit. De derde is wat er met de contributor-tier gebeurt: als de limiet van 60 aanvragen wordt versoepeld, verandert een model dat grenst aan de frontier tegen $0,10 input en $0,20 output de rekenkunde van de budget-tier op een manier die een indexwinst van drie punten nooit zou doen.
En als het tempo standhoudt, verschijnt Muse Spark 1.3 begin september. Afgaande hierop is het getal om in de gaten te houden bij de lancering niet de indexscore. Het is de vraag of Meta functionaliteit kan toevoegen zonder nog eens twintig seconden denktijd aan het begin van elke aanvraag toe te voegen.
Vergeleken in dit artikel3
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
