
Muse Spark 1.2 vs Muse Spark 1.1: Moet u upgraden?
- metaNIEUWMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenNIEUWQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekNIEUWDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- qwenNIEUWQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens · 2038 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1653Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1560Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligentie71Coderen
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligentie77Coderen
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligentie77Coderen
- grokxAI: Grok 4.52026-07-0856Intelligentie72Coderen
- tencentTencent: Hy32026-07-0642Intelligentie59Coderen
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligentie42Coderen
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligentie39Coderen
- anthropicAnthropic: Claude Sonnet 52026-06-3055Intelligentie72Coderen
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligentie52Coderen57Wiskunde
- z-aiZ.ai: GLM 5.22026-06-1653Intelligentie69Coderen60Wiskunde
Meta verving Muse Spark 1.1 door Muse Spark 1.2 op 5 augustus 2026 zonder de prijs, het contextvenster, de modaliteitenlijst, de ondersteunde parameters of de reasoning-knop te wijzigen. De migratie lijkt daarom gratis — dezelfde modelstringfamilie, dezelfde facturatie, niets te heronderhandelen. Het is niet gratis. Onafhankelijke meting stelt de tijd tot het eerste token van de nieuwe versie op 26,12 seconden, tegenover 2,90 voor de oude versie, en de aanhoudende output op 165 tokens per seconde, tegenover 213,5. Je koopt drie punten gemeten intelligentie met ongeveer negen keer zo lang wachten voordat er iets terugkomt.
Of dat de moeite waard is, hangt vrijwel volledig af van hoe lang je taken draaien. Hier is wat daadwerkelijk verschilt, wat identiek bleef, en wat niemand je nog kan vertellen.
De beslissing in vier regels
• Intelligentie-index: 51 → 54, onafhankelijk gemeten door Artificial Analysis op de xhigh-instelling van elke versie.
• Tijd tot eerste token: 2.90s → 26.12s, dezelfde bron, dezelfde omstandigheden.
• Kosten om de identieke benchmarksuite uit te voeren: $548,07 → $637,85, tegen identieke prijzen per token. De extra 16% is puur tokenverbranding.
• Alles waar een inkoopformulier om vraagt: ongewijzigd.

Wat is werkelijk identiek
Dit is de moeite waard om op te sommen, omdat dit de reden is waarom een migratie op papier triviaal lijkt, en omdat een verschil dat niet bestaat er een is waarvoor je niet hoeft te testen.
• Prijs — $1,25 per miljoen invoertokens, $4,25 per miljoen uitvoer, $0,15 per miljoen bij een cache-hit, $2,50 per duizend ingebouwde webzoekopdrachten. Elk van die cijfers is op beide versies hetzelfde.
• Context — 1,048,576 tokens op beide, en geen van beide heeft een lange-context-toeslagcategorie.
• Modaliteiten — tekst, afbeeldingen, video, audio en PDF in; tekst uit. Beide vermeldingen tonen dezelfde vijf invoertypen.
• Redeneringsknop — verplicht op beide, vijf niveaus (minimaal, laag, medium, hoog, xhoog), standaard medium op beide. Er is op geen van beide versies een instelling die het denken uitschakelt.
• Parameters — tools, tool_choice, structured_outputs, response_format, reasoning_effort, include_reasoning, max_tokens, temperature, top_p, top_k, repetition_penalty. Identieke lijsten.
• Serveren — één provider, Meta zelf, op beide. Geen hosts van derden, geen kwantiseringsvarianten.
• Gewogen prijs — Artificial Analysis komt voor beide uit op $0,78 per miljoen tokens volgens zijn samengestelde weging, wat je zou verwachten bij identieke tariefkaarten.
Als je hoopte dat de upgrade meer context, een garantie op de lengte van de voltooiing, of een goedkopere cache zou bieden, dan was dat niet het geval. Dit is een release met gewichten en post-training, met een tariefkaart die van de vorige is gekopieerd en geplakt.
Wat er daadwerkelijk bewoog.
Artificial Analysis is momenteel de enige onafhankelijke partij die beide versies heeft geëvalueerd, en het heeft beide geëvalueerd op hun hoogste redeneerinspanning, dus de vergelijking is appels-met-appels.
• Intelligence Index — 51 voor 1.1 (rang #22 van de 185) tot 54 voor 1.2 (rang #13). Negen plaatsen op een ranglijst waar de mediaan van de klasse 32 is, dus de winst levert echte positie op, niet alleen een decimaal.
• Tijd tot eerste token — 2.90s tot 26.12s. Dit is de belangrijkste regressie en die is niet marginaal.
• Uitvoersnelheid — 213,5 tot 165,0 tokens per seconde. Nog steeds gerangschikt op #16 van de 185 en nog steeds door Artificial Analysis omschreven als "opmerkelijk snel", maar 23% langzamer dan het model dat het vervangt.
• Verbositeit — 94M outputtokens om door de index te komen, tegenover 95M. Effectief ongewijzigd, en beide ongeveer 45% boven de 65M-mediaan.
• Totale eval-uitgaven — $548,07 tot $637,85. Aangezien de uitvoerigheid nauwelijks veranderde en de prijzen helemaal niet, komt die stijging van 16% ergens anders vandaan dan uit de zichtbare uitvoer: langere interne redeneertrajecten, meer herpogingen, of meer toolstappen per taak.
Het patroon is coherent. Meta heeft het model niet goedkoper, sneller of groter gemaakt. Het liet het model langer nadenken voordat het zich vastlegt, en dat extra nadenken uit zich in latentie, als iets langzamere streaming, en als een rekening die 16% hoger is voor identiek werk. Drie indexpunten is wat dat opleverde.
Hoe erg de latentie echt is
Het cijfer van 26,12 seconden zal uit de context worden geciteerd, dus behandel het correct: het wordt gemeten op xhigh, het duurste van de vijf inspanningsniveaus, op een benchmarksuite die ontworpen is om moeilijk te zijn. De API gebruikt standaard medium.
Om een idee te krijgen van hoe de standaard daadwerkelijk aanvoelt, toont Muse Spark 1.1 op OrcaRouter — die echte bellers bedient op welk inspanningsniveau ze ook aanvragen — een p50-tijd tot eerste token van 1,84 seconden en een p95 van 6,00 seconden over een voortschrijdende week. Dat zijn productiegegevens op productie-inspanningsniveaus, en het ligt meer dan een orde van grootte onder het benchmarkcijfer. Versie 1.2 heeft nog geen productietelemetrie.

Dus de eerlijke lezing is niet "1.2 reageert in 26 seconden." Het is: bij de instelling waar 1.2 zijn drie extra punten verdient, kost het eerste token je 26 seconden, en bij dezelfde instelling kostte het oude model je drie. Als je al op xhigh draaide — wat precies de configuratie is waar de intelligentiewinst bestaat — is dat het getal dat je erft. Als je op medium of lager draait, zul je een veel kortere tijd zien, en zul je ook minder van de verbetering zien.
Die koppeling is de echte valstrik in deze upgrade. Je kunt de intelligentie niet zonder de beraadslaging krijgen, want de beraadslaging is waar de intelligentie vandaan komt.
De herpositionering achter de cijfers
Meta heeft geen lanceringbericht voor 1.2 gepubliceerd — de aankondigingspagina van Muse Spark beschrijft nog steeds 1.1 — maar het herschreef de productbeschrijving, en de herschrijving legt de afweging uit.
Muse Spark 1.1 werd verkocht als een multimodaal redeneermodel met een ongewoon breed invoerbereik, gericht op 'multimodale agents, diepgaand onderzoek over gemengde media en langetermijncontextanalyse': lange rapporten, mediabibliotheken, opnamen en video naast tekst.
De beschrijving van Muse Spark 1.2 laat bijna alles daarvan vallen en noemt in plaats daarvan software engineering — refactoring van meerdere bestanden, langdurige debugsessies, het genereren van een volledige repository — en voegt daar een expliciete multi-agent claim aan toe: het model kan fungeren als de primaire agent die context verzamelt, plant en delegeert, of als een subagent die parallel onder zo'n primaire agent uitvoert. Het beweert ook dat prompt caching de effectieve kosten met 60–80% kan verlagen, afhankelijk van hoeveel context tussen aanroepen wordt herhaald. Dat laatste cijfer is een schatting van Meta in plaats van een gemeten resultaat, al maakt het cache-tarief van $0,15 het rekenkundig geloofwaardig.
Lees de latentie-regressie in het licht van die herpositionering en het lijkt geen vergissing meer. Niemand die een tiental bestanden refactort, geeft om 26 seconden planning. Meta koos een klant, en het is niet degene aan wie 1.1 werd verkocht.
Wat 1.1 nog heeft dat 1.2 niet heeft
Vier weken bestaan is niet genoeg om een staat van dienst op te bouwen, en op drie concrete manieren is het oudere model momenteel het beter gedocumenteerde product.
• Een arena-record. Muse Spark 1.1 heeft een aanzienlijke geschiedenis in de Design Arena: 1334 Elo op rang 5 in game-ontwikkeling, 1334 op rang 7 in UI-componenten, 1320 op rang 3 in ASCII-kunst, 1318 in datavisualisatie, 1309 in algemene codecategorieën, plus een volledige agents-arena-ladder die webapps, HTML-slides en Godot-game-ontwikkeling omvat. Muse Spark 1.2 heeft helemaal geen vermeldingen. Op de as die Meta nu het hardst vermarkt, zijn er nul head-to-head-data voor het nieuwe model.
• Sub-indexscores. Artificial Analysis publiceert voor 1.1 een coderingsindex van 71,3 en een agentische index van 37,5. Er is geen gepubliceerd equivalent voor 1.2. Aangezien de agentische score de zwakste dimensie van 1.1 was met ruime marge, en agentische capaciteit precies is wat 1.2 beweert te verbeteren, is dit het getal dat de upgrade-vraag zou beslechten — en het bestaat nog niet.
• Productietelemetrie. 1.1 heeft een week aan echte p50- en p95-latentie achter zich en 4,4M tokens aan live verkeer op OrcaRouter. 1.2 heeft geen van beide; het endpoint rapporteert momenteel helemaal geen latentie- of doorvoerstatistieken, omdat het volume te laag is om te samplen.
• Ergens om het te huren naast Meta.Muse Spark 1.1 staat in de OrcaRouter-catalogus voor $1.25 en $4.25 — Meta's eigen catalogusprijs, doorberekend met 0% opslag. Muse Spark 1.2 is er nog niet, dus vandaag is het een directe Meta-integratie met één provider en geen failoverpad.

Niets van dit alles betekent dat 1.2 slechter is. Het betekent dat het bewijs voor 1.2 bestaat uit één samengestelde score van één beoordelaar, terwijl het bewijs voor 1.1 een maand aan arena's, subindices en live verkeer is. Die asymmetrie zou van invloed moeten zijn op hoe je de migratie faseert, niet op of je hem probeert.
Een migratiechecklist die daadwerkelijk kort is
Omdat de tariefkaart en het parameteroppervlak identiek zijn, is de omwisseling een wijziging van de model-string. Het werk zit in het verifiëren van de drie dingen die wél zijn veranderd.
• Meet je eigen tijd tot het eerste token met je eigen effort-instelling. Accepteer de 2,90s of de 26,12s niet. Voer je echte prompts uit met wat je ook als reasoning_effort daadwerkelijk meegeeft en vergelijk direct. Dit is het enige getal dat de migratie volledig kan doen mislukken.
• Controleer je timeout- en streamingconfiguratie. Een 9x toename in first-token-latentie bij hoge inspanning zal client-time-outs overschrijden die op 1.1 waren afgestemd, en zal elke niet-streamingintegratie op een hang laten lijken.
• Herbereken de kosten op basis van gemeten token-aantallen, niet op basis van de tarievenkaart. De prijzen zijn identiek, dus elke kostenverandering is gedragsmatig. Artificial Analysis zag 16% meer uitgaven voor hetzelfde werk; of je dat ziet, hangt af van je taakmix.
• Controleer eerst de stabiliteit van de cache-sleutel. Met een stabiel prefix van 60.000 tokens daalt een typische agentstap van ongeveer 8,8 cent naar ongeveer 2,2 cent op beide versies. Die schommeling van 75% is groter dan enig effect van de versiewijziging, en u heeft het volledig onder controle.
• Test audio- en videopaden expliciet opnieuw.Beide vermeldingen adverteren dezelfde vijf invoermodaliteiten, maar de specificatiekaart van Artificial Analysis voor 1.2 vermeldt alleen tekst en beeld als geëvalueerd. Meta herschreef de pitch weg van mixed-media werk. Niemand heeft onafhankelijk gecontroleerd of die mogelijkheid standhield.
• Houd 1.1 bereikbaar als fallback. Beide achter één key draaien betekent dat de rollback een configuratiewijziging is in plaats van een incident, en je kunt de twee A/B-testen op live verkeer in plaats van te discussiëren over een benchmark.
Wie beweegt nu, wie wacht
Stap nu over als je langetermijn-codeeragents draait met hoge redeneerinspanning. De taken duren al minuten, de latentieboete gaat daarin op, de intelligentiewinst wordt door een derde partij gemeten in plaats van door Meta geclaimd, en drie indexpunten is een betekenisvolle sprong op dit niveau — negen plaatsen op een ranglijst met 185 modellen.
Wacht als iets dat je serveert interactief is. Er is geen configuratie waarin 1.2 responsiever is dan 1.1, en verplichte redenering betekent dat je responsiviteit niet kunt terugkopen door denken uit te schakelen. Versie 1.1 blijft het snellere model op elk inspanningsniveau en kost exact hetzelfde.
Wacht als je workload mixed-media-analyse is — het gebruiksscenario voor lange rapporten, video en audio waarvoor 1.1 expliciet is gebouwd en op de markt is gebracht. Meta adverteert er niet meer voor en de enige onafhankelijke evaluatie van 1.2 betreft tekst en afbeeldingen. De functionaliteit is mogelijk nog intact; er is simpelweg geen bewijs voor of tegen, en 1.1 heeft er een maand van.
Wacht als je de arena-data nodig hebt. Een model dat wordt verkocht op basis van volledige repository-generatie, zonder Design Arena-inzendingen en zonder gepubliceerde agentische subindex, vraagt je om Meta's woord te geloven over wat het heeft veranderd. Geef het drie of vier weken en dat zal niet langer waar zijn — op dat moment wordt deze beslissing veel gemakkelijker te nemen op basis van bewijs in plaats van op een enkel samengesteld getal.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
