Muse Spark 1.2 vs Claude Haiku 4.5: Zelfde gecombineerde prijs, tegenovergestelde ideeën over denken
Guides & Insights

Muse Spark 1.2 vs Claude Haiku 4.5: Zelfde gecombineerde prijs, tegenovergestelde ideeën over denken

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Artificial Analysis prijst Muse Spark 1.2 op een gewogen gemiddelde prijs van $0,78 per miljoen tokens en Claude Haiku 4.5 op $0,77. Een cent verschil, van twee labs die het over niets anders eens waren. Meta's model kan niet stoppen met redeneren; Claude Haiku 4.5 redeneert alleen als je erom vraagt. Meta geeft je 1.048.576 tokens aan context; Claude Haiku 4.5 geeft je 200.000. Meta bracht dit model op 5 augustus 2026 uit als codemodel met een terminalagent; Claude Haiku 4.5 verscheen in oktober 2025 als de snelle, goedkope werker die moet doen wat een groter model zegt. Zelfde prijs per token, totaal verschillende machines.

Dat toeval is de nuttige plek om een vergelijking te beginnen, omdat het de variabele wegneemt waar mensen gewoonlijk op beslissen en de vraag in plaats daarvan over vorm laat gaan. Wat volgt gebruikt onafhankelijke cijfers waar die bestaan — Artificial Analysis voor indexscores en lab-latentie, OrcaRouter's eigen zeven dagen durende productietelemetrie voor real-verkeerslatentie — en bestempelt door de leverancier gerapporteerde cijfers als zodanig, waaronder een benchmarkkop van de leverancier die geen tegenhanger van derden heeft.

Het spec-contrast, één dimensie tegelijk

• Prijs — Muse Spark 1.2 voor $1,25 in / $4,25 uit per miljoen; Claude Haiku 4.5 voor $1,00 in / $5,00 uit. Meta is goedkoper op invoer, Claude Haiku 4.5 op uitvoer.

• Cache — $0,15 per miljoen voor een Muse Spark 1.2 cache-hit, een korting van 88%; $0,10 per miljoen voor een Claude Haiku 4.5 cache-read, een korting van 90%, en cache-writes worden gefactureerd tegen $1,25.

• Context — 1.048.576 tokens tegenover 200.000. Een 5,2× verschil, en verreweg de grootste kloof tussen beide.

• Maximale output — Claude Haiku 4.5 vermeldt een plafond van 64.000 tokens; het Muse Spark 1.2-eindpunt vermeldt helemaal geen maximale completielengte, wat ongebruikelijk genoeg is om te testen in plaats van aan te nemen.

• Redeneren — verplicht op Muse Spark 1.2, met vijf inspanningsniveaus van minimaal tot xhigh en een standaard van medium; optioneel op Claude Haiku 4.5, dat een niet-redenerend model is totdat je uitgebreid denken inschakelt en er een denkbudget aan toewijst.

• Invoer — Meta ondersteunt tekst, afbeeldingen, video, audio en PDF; Claude Haiku 4.5 accepteert tekst en afbeeldingen. Beide retourneren tekst.

• Gewichten en providers — beide gesloten. Muse Spark 1.2 wordt alleen aangeboden via Meta's eigen Model API; Claude Haiku 4.5 is verkrijgbaar bij de leverancier en via de gebruikelijke cloud-resellers en aggregators.

• Leeftijd — Muse Spark 1.2 is nog maar een paar dagen oud. Claude Haiku 4.5 is sinds 15 oktober 2025 in productie, met een kennisafsluitdatum van juli 2025 en negen maanden aan opgebouwde praktijkervaring achter de rug.

De indexkloof is reëel. Het getal dat iedereen zal citeren is dat niet.

Artificial Analysis geeft Muse Spark 1.2 een score van 54 op zijn Intelligence Index, rang #13 van de 185. De huidige notering voor Claude Haiku 4.5 is 24. Zet die naast elkaar en je hebt een kop; kijk naar wat de noteringen daadwerkelijk inhouden en de kop valt uiteen.

De 54 is Muse Spark 1.2 geëvalueerd op xhigh, zijn duurste redeneerinstelling. De 24 is Claude Haiku 4.5 geëvalueerd als een niet-redenerend model — denken uit — en Artificial Analysis markeert het als een schatting in plaats van een voltooide run. Op een eerdere versie van dezelfde index, vóór de v4.1-herweging, gaf Artificial Analysis Claude Haiku 4.5 een score van 55 met redeneren ingeschakeld en 42 zonder. Die oudere cijfers kunnen ook niet met 54 worden vergeleken, omdat indexversies herschalen en een score uit het v3-tijdperk geen v4.1-score is.

De eerlijke uitspraak is dus beperkter dan het leaderboard doet vermoeden: Muse Spark 1.2 scoort bij maximale inspanning 54 op de huidige index; er is geen gepubliceerde v4.1-score voor Claude Haiku 4.5 met uitgebreid denken ingeschakeld, dus er bestaat nog geen directe vergelijking van deze twee op volle inspanning.Iedereen die je 54 versus 24 laat zien, vergelijkt een model dat volledig doordenkt met een model dat de opdracht heeft gekregen om niet na te denken.

Waar de leverancier een getal heeft gepubliceerd, is het een specifiek getal: Claude Haiku 4.5 scoort 73,3% op SWE-bench Verified, gemiddeld over 50 pogingen met een denkbudget van 128K. Dat is een cijfer van de leverancier, en het denkbudget daarin is enorm voor een model dat op snelheid wordt vermarkt — maar het is dezelfde evaluatie die de industrie voor toonaangevende modellen aanhaalt, en het plaatst Haiku in een categorie die de prijs niet doet vermoeden. De claims van Meta's tegenhanger voor Muse Spark 1.2 zijn Terminal-Bench 2.1 op 82,9% en DeepSWE v1.1 op 59,3%, eveneens door de leverancier uitgevoerd, op Meta's eigen testopstelling, waarbij elke concurrent gekoppeld is aan zijn eigen agentproduct. Twee leveranciers, twee benchmarks, geen overlap. Er is momenteel geen enkele evaluatie waarop beide modellen een gepubliceerde score van dezelfde evaluator hebben.

Vier latentiecijfers, twee verschillende verhalen

Latency is waar de 'zelfde prijs'-framing ophoudt een curiositeit te zijn en een beslissing wordt, en het is ook waar de meetbron het meest telt.

In de benchmarkomgeving registreert Artificial Analysis een tijd tot eerste token van 26,12 seconden voor Muse Spark 1.2 op xhigh, en 1,00 seconde voor Claude Haiku 4.5. Een gat van 26×, en als dat het hele plaatje was, zou de vergelijking voorbij zijn.

In productie is het omgekeerd. Over zeven dagen van echt verkeer op OrcaRouter — bellers die zoveel moeite doen als ze daadwerkelijk willen — toont Claude Haiku 4.5 een p50-tijd tot eerste token van 3,84 seconden en een p95 van 10,00 seconden, bij 214 tokens per seconde en een foutpercentage van 1,0%. Muse Spark 1.1, de versie van Meta's model die in de catalogus staat, toont een p50 van 1,84 seconden en een p95 van 6,00 seconden, bij 519 tokens per seconde en zonder geregistreerde fouten. Bij live verkeer is het Meta-model de snellere.

Beide getallenreeksen zijn waar en ze meten verschillende dingen. Het labcijfer is elk model bij maximale bedenktijd met een koude cache, wat een eerlijke test is van het plafond en een slechte test van een chatbox. Het productiecijfer omvat cache-hits, korte prompts, lage inspanningsniveaus en al het andere dat echte toepassingen doen — een eerlijke test van de mediaan en helemaal geen test van het slechtste geval. De valkuil is de ene citeren en over de andere redeneren. Als je een gebruikersgerichte time-out aan het bepalen bent, is de p95 jouw getal. Als je je afvraagt wat een diepe agentische stap in verstreken tijd kost, ligt het benchmarkcijfer dichter bij de waarheid — en het eerlijke voorbehoud is dat er voor Muse Spark 1.2 zelf nog geen dergelijk productiecijfer bestaat, omdat het te nieuw is en niet breed wordt gerouteerd.

Beide labs verkochten je een subagent. Ze bedoelden verschillende dingen.

De pitch van de leverancier voor Claude Haiku 4.5 was expliciet over de hiërarchie: Sonnet-klasse modellen plannen en orkestreren, Haiku-instanties draaien daaronder parallel. Goedkoop, snel, wegwerpbaar, veel tegelijk. Het productontwerp volgt daaruit — een 200K-venster is ruim voldoende voor een afgebakende subtaak en bewust niet genoeg voor een hele repository, denken staat standaard uit omdat een werker die nadenkt een werker is die de orkestreerder geld kost, en de eigen marketing van de leverancier noemt realtime chat, klantenservice en pair programming als doelwit.

Meta's pitch voor Muse Spark 1.2 claimt beide uiteinden van dezelfde hiërarchie. Meta's tekst zegt dat het model de primaire agent kan zijn die context verzamelt, plant en delegeert, of een subagent die parallel onder één ervan draait. Muse Code, de terminal-agent die er samen mee werd uitgebracht, coördineert meerdere persistente subagents per taak in geïsoleerde worktrees, op een replay-exacte event-log-runtime. Het tokenvenster van een miljoen en het continu actieve redeneervermogen zijn wat een planner nodig heeft; ze zijn precies wat je niet zou kiezen voor een fan-out-worker, omdat elke parallelle instantie betaalt voor redeneerwerk waar je niet om vroeg.

Lees het als architectuur in plaats van marketing, dat is het echte verschil: de leverancier bouwde een worker en verwacht dat je een orchestrator meebrengt; Meta bouwde een orchestrator en beweert dat het ook kan werken. Als je al een hiërarchie draait, is het interessante experiment niet om tussen hen te kiezen — het is Muse Spark 1.2 dat plant en Claude Haiku 4.5 dat uitvoert, een vorm die geen enkele leverancier je als pakket zal verkopen.

Wat één echte stap op elk kost

Prijzen per miljoen tokens bepalen niets bij redeneringsmodellen, omdat het model kiest hoeveel tokens het uitgeeft. Prijs in plaats daarvan de stap.

Neem een afgebakende codetaak: 60.000 tokens aan repository-context erin, 3.000 tokens aan patch eruit. Koud, Claude Haiku 4.5 kost $0,060 voor invoer plus $0,015 voor uitvoer — 7,5 cent. Muse Spark 1.2 kost $0,075 plus $0,013 — 8,8 cent. Dicht genoeg om ruis te zijn, precies zoals de gemengde prijs beloofde.

Voeg nu toe wat het gemengde tarief verbergt. Muse Spark 1.2 kan redeneren niet uitschakelen, en bij de standaard gemiddelde instelling produceert een stap als deze waarschijnlijk een paar duizend redeneertokens vóór de patch — die worden als output gefactureerd. Tel er 3.000 bij op en dezelfde stap is $0,075 + $0,026 = 10,1 cent, ongeveer 35% boven Haiku bij identieke invoer. Claude Haiku 4.5 met denken uit betaalt niets voor het denkwerk en blijft op 7,5 cent; met een groot denkbudget zal het Muse Spark 1.2 overtreffen, omdat Claude Haiku 4.5 $5,00 per miljoen output rekent tegenover Meta's $4,25.

Caching verlegt de nadruk opnieuw. Houd de repository-context stabiel zodat het de cache raakt en Haiku's invoer daalt naar $0,006 en die van Muse Spark 1.2 naar $0,009 — de invoerkant doet er helemaal niet meer toe en de hele vergelijking wordt een gevecht over output-tokens, wat een gevecht is over hoeveel elk model denkt. Bij een workload die context herhaalt, is cache-key-stabiliteit meer waard dan de modelkeuze, en dat geldt voor beide modellen.

Het 1M-venster is de enige plek waar de rekensom niet klopt. Alles wat echt meer dan 200.000 tokens nodig heeft in één enkele aanroep, kan tegen geen enkele prijs op Claude Haiku 4.5 draaien. Je chunkt en orkestreert — dat is wat de leverancier bedoelt — of je gebruikt een model met de ruimte.

Beide proberen zonder een tweede contract

Claude Haiku 4.5 staat in de OrcaRouter-catalogus voor $1,00 en $5,00 — de adviesprijs van de leverancier, omdat OrcaRouter 0% opslag rekent en de prijzen van providers ongewijzigd doorgeeft, wat ook betekent dat een prijswijziging van de leverancier dezelfde dag bij ons live is in plaats van bij de volgende contractcyclus. De bovenstaande productielatentiecijfers komen uit dezelfde routeringslaag.

Muse Spark 1.2 staat niet in de catalogus. Meta's Model API is momenteel de enige plek om het aan te roepen, dus een echte head-to-head vandaag betekent één integratie via ons en één direct met Meta. Muse Spark 1.1 wordt gehost, tegen dezelfde $1,25 en $4,25 die Meta voor 1.2 rekent, wat het een redelijke vervanger maakt voor de kosten- en latentievorm van de familie, maar niet voor de codeerwinsten waar 1.2 op wordt verkocht. Wanneer 1.2 routeerbaar wordt, wordt de vergelijking een eenregelige modelstringwijziging met dezelfde key — en voor het hierboven beschreven orchestrator-plus-worker-experiment is de routing-DSL de manier om een planner en een fan-out-worker in één enkele aanroep samen te voegen, in plaats van de overdracht zelf te bouwen.

Kies op basis van de vorm van het werk, niet de score

Kies Claude Haiku 4.5 wanneer het werk begrensd is en de gebruiker wacht. Supportagenten, classificatie, extractie, chat, aanvullingen voor pair-programming, en de parallel-worker-laag van een agenthiërarchie. Het is een bewezen geheel met negen maanden praktijkervaring, denken is optioneel, dus je betaalt alleen voor denkwerk wanneer je het wilt, en 200K is genoeg voor bijna elke afgebakende deeltaak. Het gepubliceerde SWE-bench Verified-resultaat zegt dat het veel capabeler is dan de prijs doet vermoeden, op voorwaarde dat je bereid bent het denkbudget te besteden dat voor dat resultaat is gebruikt.

Kies Muse Spark 1.2 wanneer de werkeenheid een repository is in plaats van een verzoek. Refactoring van meerdere bestanden, uitgebreid debuggen, generatie van het hele project, agent-lussen met een lange horizon waarbij niemand naar een spinner kijkt. Het venster van een miljoen tokens elimineert een chunking-probleem dat Haiku tegen geen enkele prijs kan oplossen, en de verplichte redenering die het voor chat verpest, is de juiste standaard wanneer een verkeerd plan meer kost dan een langzaam plan.

Het is niet het indexnummer dat de doorslag zou moeten geven. Stel in plaats daarvan twee vragen: moet één enkele aanroep ooit meer dan 200.000 tokens verwerken, en staat er een mens te wachten op het eerste token? Ja op de eerste wijst naar Meta. Ja op de tweede wijst naar de leverancier. Ja op beide betekent dat je twee modellen wilt, en dat is vaker het eerlijke antwoord dan de marketing van beide leveranciers toegeeft.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt