Muse Spark 1.2 versus Claude Fable 5
Guides & Insights

Muse Spark 1.2 vs Claude Fable 5: Wat zes indexpunten werkelijk kosten

Auteur

Jim Song

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Artificial Analysis publiceert iets dat de meeste benchmarktabellen weglaten: wat het heeft uitgegeven. Het draaien van zijn Intelligence Index met negen evaluaties kostte $637.85 op Muse Spark 1.2 en $5,630.52 op Claude Fable 5. Identieke benchmarksuite, identieke harness, de ene rekening 8,8 keer de andere. Fable 5 scoorde 60 tegen de 54 van Muse Spark 1.2.

Deel het verschil en je krijgt het getal waar deze vergelijking eigenlijk over gaat: bij die werklast kosten de laatste zes intelligentiepunten ongeveer $832 per punt. Of je dat moet betalen is geen benchmarkvraag. Het is een vraag over hoeveel van je verkeer die punten daadwerkelijk nodig heeft, en voor de meeste teams is het antwoord een klein en identificeerbaar deel.

Het marginale indexpunt heeft een prijs, en die is hoog.

Beide cijfers komen van dezelfde onafhankelijke evaluator die dezelfde samengestelde benchmark draait — GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience en AA-LCR. Geen van beide is een leveranciersclaim. Fable 5 staat op rang #3 van 185 modellen; Muse Spark 1.2 op #13, tegen een klassenmediaan van 32. Beide liggen ruim boven het gemiddelde; slechts één bevindt zich aan de voorhoede.

Muse Spark 1.2 vs Claude Fable 5

De adviesprijzen verklaren het grootste deel van het verschil en onderschatten de rest:

Input — Muse Spark 1.2 $1.25 per miljoen, Claude Fable 5 $10.00. Acht keer.

Output — $4,25 tegenover $50,00. Bijna twaalf keer.

Gecachte invoer — $0,15 tegen $1,00. Ongeveer zeven keer, en Fable 5 rekent daarnaast $12,50 per miljoen om de cache te schrijven, of $20,00 voor een TTL van één uur, terwijl Muse Spark 1.2 geen afzonderlijke vergoeding voor het cache-schrijven publiceert.

Gecombineerd tarief — Artificial Analysis plaatst Muse Spark 1.2 op $0,78 per miljoen tokens en Fable 5 op $7,70. Net geen tien keer zoveel.

Fable 5 was het duurste model dat Artificial Analysis ooit had gebenchmarkt toen het werd gelanceerd, en het heeft die titel behouden. Het is de moeite waard om precies te zijn over waarom: het model verbruikte minder output-tokens dan Muse Spark 1.2 bij het doorlopen van de index — 87M tegen 95M — dus het hele kostenverschil is tarief, niet uitvoerigheid. Fable 5 is niet verkwistend. Het is simpelweg geprijsd als een baanbrekend product.

Omgerekend naar een agentstap die 60.000 tokens aan repository-context leest en 3.000 tokens aan patch schrijft: ongeveer 8,8 cent op Muse Spark 1.2, ongeveer 75 cent op Claude Fable 5. Duizend stappen per dag kost $88 tegenover $750. Over een jaar, $32.000 tegenover $274.000.

Waar Claude Fable 5 niet vervangbaar is

Het kostenargument zou eenzijdig zijn als de zes punten het hele verschil uitmaakten. Dat zijn ze niet, en de plek waar de kloof groter wordt, is precies de plek waar Meta Muse Spark 1.2 opnieuw heeft gepositioneerd om te concurreren.

Fable 5 staat op de eerste plaats in een groot deel van de Design Arena-head-to-head-ladders: 1399 Elo en rang 1 in game-ontwikkeling, 1367 en rang 1 in ASCII-kunst, 1353 en rang 1 in SVG-generatie, plus rang 1 in de agents-arena voor Godot-game-ontwikkeling (1344), Android native (1318), agentische game-ontwikkeling (1300) en HTML-slides (1260), en tweede plaats in webapps en full-stackwerk. Muse Spark 1.2 heefthelemaal geen Design Arena-vermeldingen — zijn voorganger verzamelde een respectabele middenmoot-prestatie (1334 in game-ontwikkeling op rang 5, 1309 in algemene codecategorieën op rang 9), maar de nieuwe versie is nog geen enkele keer beoordeeld.

De indexen per dimensie wijzen dezelfde kant op. Artificial Analysis geeft Claude Fable 5 een codeerindex van 76,5 en een agentische index van 52,8. Muse Spark 1.1 stond op 71,3 en 37,5 — vijf punten achter op coderen en vijftien achter op agentisch werk. Voor 1.2 zijn nog geen cijfers per dimensie gepubliceerd, dus de eerlijke conclusie is dat we weten dat het gat op de samengestelde index met drie punten is gesloten en we niet weten hoeveel daarvan op de agentische as terechtkwam.

Muse Spark 1.2 vs Claude Fable 5

De eigen productpositionering van Fable 5 stelt dat de voorsprong groter wordt naarmate de taak langer en complexer is. Dat is een leveranciersclaim en als zodanig ongeverifieerd, maar het is consistent met de vorm van de onafhankelijke data: de grootste marges van Fable 5 liggen in de agents-arena, waar een model een plan over vele beurten moet vasthouden, in plaats van bij eenmalige generatie.

Waar Muse Spark 1.2 simpelweg het juiste antwoord is

Drie dingen maken het de juiste keuze, ongeacht de zes punten.

Audio- en video-invoer. Meta's vermelding adverteert tekst, afbeeldingen, video, audio en PDF-invoer. Claude Fable 5 accepteert tekst, afbeeldingen en bestanden — geen audio, geen video. Voor elke pijplijn die opnamen of beeldmateriaal verwerkt, is dit geen afweging, maar een harde filter. Eén eerlijk voorbehoud: de specificatiekaart van Artificial Analysis voor Muse Spark 1.2 vermeldt alleen tekst en afbeeldingen als geëvalueerd, dus het bredere aanbod wordt geadverteerd, niet onafhankelijk geverifieerd.

Snelheid. 165.0 tokens per seconde tegen 71.7. Muse Spark 1.2 streamt output ruim twee keer zo snel, en staat op #16 van 185 qua snelheid tegen een klassemediaan van 71 — Fable 5 zit op de mediaan.

Kosten bij volume. Alles in de vorige sectie.

{{1}}Voeg een vierde categorie toe voor iedereen wiens verzoeken echt enorm zijn: beide modellen adverteren ongeveer een miljoen tokens aan context — 1.048.576 voor Muse Spark 1.2, 1.000.000 voor Fable 5 — maar Muse Spark 1.2 rekent een vast tarief over het geheel, terwijl de cache-schrijfprijzen van Fable 5 betekenen dat het vasthouden van een groot stabiel voorvoegsel in het begin echt geld kost, voordat het je iets begint te besparen.{{/1}}

Geen van deze is een snel model.

Dit is het gedeelte dat de meeste head-to-heads overslaan, en het verandert de architectuur in plaats van de factuur.

Bij maximale redeneerinspanning meet Artificial Analysis een tijd tot eerste token van 26.12 seconden voor Muse Spark 1.2 en 141.26 seconden voor Claude Fable 5, met een end-to-end responstijd voor Fable 5 van 148.24 seconden. Bij die instellingen hoort geen van beide voor een gebruiker te staan.

Productiecijfers zijn veel vriendelijker en de moeite waard om te weten. Op OrcaRouter toont Claude Fable 5 een p50-tijd tot eerste token van 7,04 seconden en een p95 van 10,00 seconden over een voortschrijdende week — dat is echt verkeer bij welke inspanning aanroepers ook aanvragen, geen benchmark op maximum. Muse Spark 1.1 heeft ter referentie een p50 van 1,84 seconden. Muse Spark 1.2 heeft nog geen productietelemetrie.

Muse Spark 1.2 vs Claude Fable 5

Het structurele punt: beide modellen hebben verplichte redenering. Fable 5's inspanningsregelaar loopt van laag tot maximaal en staat standaard op hoog; Muse Spark 1.2's loopt van minimaal tot extra hoog en staat standaard op medium. Geen van beide laat je het redeneren uitschakelen. Als je antwoorden binnen een seconde nodig hebt, is deze hele vergelijking het verkeerde schap — daar is een model van de Luna- of Flash-Lite-klasse voor.

De stack van twee modellen, geprijsd buiten bereik.

Dit als een winnaar-neemt-alles-keuze framen is de vergissing, want het verkeer is niet homogeen. Bijna elke productieagent heeft een lange staart van routinestappen — een bestand lezen, een diff samenvatten, een patch opmaken, beslissen welke tool je vervolgens aanroept — en een korte kop van echt moeilijke stappen waar een fout antwoord een uur kost.

Neem dezelfde duizend agentstappen per dag. Alles op Claude Fable 5: ongeveer $750. Alles op Muse Spark 1.2: ongeveer $88. Verdeel 900 routinestappen over het goedkope model en 100 moeilijke over het dure: ongeveer $79 plus $75, of $154 per dag. Dat is een vijfde van de volledige Fable-rekening, terwijl je de geavanceerde capaciteit behoudt voor de tiende van de oproepen die het daadwerkelijk nodig hebben — en dat is ruwweg $220,000 per jaar verschil op één agentlus.

De reden dat split de moeite waard is om te bouwen in plaats van alleen te beschrijven, is dat het vroeger twee leveranciersrelaties, twee SDK's en twee sets credentials vereiste. Dat is nu niet meer zo. Claude Fable 5 staat in de OrcaRouter-catalogus voor $10,00 en $50,00 — adviesprijs van de leverancier, doorberekend met 0% opslag — en Muse Spark 1.1 staat er voor $1,25 en $4,25 op dezelfde basis, achter hetzelfde OpenAI-compatibele endpoint. Met de routing-DSL kun je "goedkoop model eerst, opschalen bij lage betrouwbaarheid of bij een mislukte testrun" uitdrukken als één enkele aanroep in plaats van als orchestration-code die je zelf onderhoudt, en met model fusion kun je de werkelijk ambigue stappen tegelijk naar een panel van modellen sturen en vergelijken. Muse Spark 1.2 zelf staat nog niet in de catalogus — Meta levert het direct aan, als enige provider — dus vandaag is het dichtstbijzijnde dat je kunt bouwen aan deze stack het gebruik van 1.1 op de goedkope arm.

Dat detail over de enkele provider verdient een eigen regel in een risicobeoordeling. Claude Fable 5 heeft meerdere serveringsroutes en automatische failover daartussen. Muse Spark 1.2 heeft precies één endpoint, beheerd door Meta. Als dat uitvalt, is er geen fallback die hetzelfde model is.

Een kostenmodel, geen oordeel

Het nuttige resultaat van deze vergelijking is niet "welk model wint." Het is een drempelwaarde die je voor je eigen werklast kunt berekenen.

Schat het aandeel van je calls waarin een antwoord van Muse Spark 1.2-klasse faalt en een antwoord van Fable 5-klasse slaagt. Vermenigvuldig dat met wat een fout kost — engineerminuten, een slechte merge, een retry-loop, een klant. Vergelijk dat met 66 cent per stap, wat het kost om een enkele call van Muse Spark 1.2 naar Claude Fable 5 te upgraden in het bovenstaande voorbeeld van 60K-in / 3K-out. Als het verwachte verlies door een fout antwoord meer dan 66 cent bedraagt, stuur die stap dan naar Fable 5. Zo niet, doe dat dan niet.

Voor de meeste teams plaatst die berekening Fable 5 bij codebeoordeling, definitieve patchgeneratie, architectuurplanning en alles wat met productiegegevens te maken heeft, en plaatst Muse Spark 1.2 bij al het overige — bestandslezen, samenvatting, testtriage, toolselectie, het high-volume midden van een agentlus waar de kosten reëel zijn en de inzet per aanroep niet.

Eén ding om in de gaten te houden: de Design Arena-ladders en de per-dimensie-indexen voor Muse Spark 1.2, die allebei nog niet bestaan. Het sterkste bewijs van Fable 5 zit juist in de head-to-head-arena's waar Meta's nieuwe model helemaal geen staat van dienst heeft. Wanneer die staat van dienst verschijnt, verschuift deze drempel — mogelijk flink.

Vergeleken in dit artikel2

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

Neem contact op

Word lid van de community

DiscordEmailXGitHubYouTube