
Muse Spark 1.2 vs Claude Fable 5: Vad sex indexpunkter faktiskt kostar
- metaNYMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenNYQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekNYDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- qwenNYQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens · 197 tok/s
- orcaNYOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligens77Kodning
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligens77Kodning
- grokxAI: Grok 4.52026-07-0856Intelligens72Kodning
- tencentTencent: Hy32026-07-0642Intelligens59Kodning
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligens42Kodning
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligens39Kodning
- anthropicAnthropic: Claude Sonnet 52026-06-3055Intelligens72Kodning
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligens52Kodning57Matematik
- z-aiZ.ai: GLM 5.22026-06-1653Intelligens69Kodning60Matematik
Artificial Analysis publicerar något som de flesta benchmarktabeller utelämnar: vad det kostade. Att köra sitt Intelligence Index med nio utvärderingar kostade $637.85 på Muse Spark 1.2 och $5,630.52 på Claude Fable 5. Identisk benchmarksvit, identisk testmiljö, en nota 8,8 gånger större än den andra. Fable 5 fick 60 mot Muse Spark 1.2:s 54.
Dela skillnaden så får du talet som den här jämförelsen egentligen handlar om: för den arbetsbelastningen kostar de sista sex intelligenspoängen ungefär $832 per poäng. Huruvida du bör betala det är inte en riktmärkesfråga. Det är en fråga om hur mycket av din trafik som faktiskt behöver dessa poäng, och svaret för de flesta team är en liten och identifierbar andel.
Den marginella indexpunkten har ett pris, och det är brant.
Båda siffrorna kommer från samma oberoende utvärderare som kör samma sammansättning — GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience och AA-LCR. Ingen av dem är ett leverantörspåstående. Fable 5 ligger på rank #3 av 185 modeller; Muse Spark 1.2 på #13, mot en klassmedian på 32. Båda ligger väl över genomsnittet; endast en befinner sig i framkant.

Listpriserna förklarar större delen av gapet och underskattar resten:
• Input — Muse Spark 1.2 $1.25 per miljon, Claude Fable 5 $10.00. Åtta gånger.
• Resultat — 4,25 $ mot 50,00 $. Nästan tolv gånger.
• Cachad indata — $0,15 mot $1,00. Ungefär sju gånger, och Fable 5 tar dessutom ut $12,50 per miljon för att skriva cachen, eller $20,00 för en TTL på en timme, där Muse Spark 1.2 inte publicerar någon separat cache-skrivavgift alls.
• Blandad taxa — Artificial Analysis anger Muse Spark 1.2 till 0,78 dollar per miljon tokens och Fable 5 till 7,70 dollar. Strax under tio gånger.
Fable 5 var den dyraste modell som Artificial Analysis någonsin hade benchmarkat när den lanserades, och den har behållit den titeln. Det är värt att vara precis om varför: modellen förbrände färre output tokens än Muse Spark 1.2 under genomsökningen av indexet — 87M mot 95M — så hela kostnadsskillnaden är taxa, inte mångordighet. Fable 5 är inte slösaktig. Den är helt enkelt prissatt som en produkt i framkant.
Översatt till ett agentsteg som läser 60 000 tokens av repository-kontext och skriver 3 000 tokens av patch: ungefär 8,8 cent på Muse Spark 1.2, ungefär 75 cent på Claude Fable 5. Tusen steg om dagen är 88 dollar mot 750 dollar. Under ett år är 32 000 dollar mot 274 000 dollar.
Där Claude Fable 5 inte är utbytbar
Kostnadsargumentet skulle vara ensidigt om de sex punkterna utgjorde hela skillnaden. Det gör de inte, och platsen där gapet vidgas är exakt där Meta har ompositionerat Muse Spark 1.2 för att konkurrera.
Fable 5 håller förstaplatsen inom en bred del av Design Arenas head-to-head-stegar: 1399 Elo och rank 1 inom spelutveckling, 1367 och rank 1 inom ASCII-konst, 1353 och rank 1 inom SVG-generering, samt rank 1 inom agents-arenan för Godot-spelutveckling (1344), Android native (1318), agentisk spelutveckling (1300) och HTML-slides (1260), med andraplats inom webbappar och fullstack-arbete. Muse Spark 1.2 har inga Design Arena-noteringar överhuvudtaget — dess föregångare hade ett respektabelt mittfältsfacit (1334 i spelutveckling på rank 5, 1309 i allmänna kodkategorier på rank 9), men den nya versionen har inte rankats en enda gång.
Indexen per dimension pekar åt samma håll. Artificial Analysis ger Claude Fable 5 ett kodindex på 76,5 och ett agentiskt index på 52,8. Muse Spark 1.1 låg på 71,3 och 37,5 — fem poäng efter på kodning och femton efter på agentiskt arbete. Inga siffror per dimension har ännu publicerats för 1.2, så den ärliga slutsatsen är att vi vet att det sammanvägda indexet minskade gapet med tre poäng, men vi vet inte hur mycket av det som hamnade på den agentiska axeln.

Fable 5:s egen produktpositionering hävdar att försprånget växer med uppgiftens längd och komplexitet. Det är ett leverantörspåstående och inte verifierat som det framställs, men det överensstämmer med formen på de oberoende uppgifterna: Fable 5:s största marginaler finns i agent-arenan, där en modell måste hålla ihop en plan över många vändor, snarare än i enkel generering.
Där Muse Spark 1.2 helt enkelt är det rätta svaret
Tre saker gör det till det rätta valet oavsett de sex punkterna.
• Ljud- och videoinmatning.Metas lista annonserar text, bilder, video, ljud och PDF i. Claude Fable 5 tar emot text, bilder och filer — inget ljud, ingen video. För alla pipelines som berör inspelningar eller filmmaterial är detta inte en avvägning, det är ett hårt filter. En ärlig brasklapp: Artificial Analysis specifikationskort för Muse Spark 1.2 anger endast text och bild som utvärderade, så den bredare ytan annonseras snarare än oberoende verifieras.
• Hastighet. 165.0 tokens per sekund jämfört med 71.7. Muse Spark 1.2 streamar utdata mer än dubbelt så snabbt, och rankas #16 av 185 i hastighet mot en klassmedian på 71 — Fable 5 ligger på medianen.
• Kostnad vid volym. Allt i föregående avsnitt.
Lägg till en fjärde för den vars förfrågningar är genuint enorma: båda modellerna annonserar ungefär en miljon token i kontext — 1,048,576 för Muse Spark 1.2, 1,000,000 för Fable 5 — men Muse Spark 1.2 tar en fast avgift för alltihop, medan Fable 5:s prissättning för cache-skrivning innebär att hålla ett stort stabilt prefix kostar riktiga pengar i förskott innan det börjar spara något åt dig.
Ingen av dessa är en snabb modell.
Detta är avsnittet som de flesta direktjämförelser hoppar över, och det förändrar arkitekturen snarare än fakturan.
Vid maximal resonemangsinsats mäter Artificial Analysis tiden till första token till 26,12 sekunder för Muse Spark 1.2 och 141,26 sekunder för Claude Fable 5, med en end-to-end-svarstid för Fable 5 på 148,24 sekunder. Ingen av dem bör stå framför en användare vid dessa inställningar.
Produktionssiffrorna är mycket vänligare och värda att känna till. På OrcaRouter visar Claude Fable 5 en p50-tid till första token på 7.04 sekunder och en p95 på 10.00 sekunder under en rullande vecka — det är verklig trafik oavsett vilken insats anropare begär, inte ett riktmärke vid maxinsats. Muse Spark 1.1 har, som referens, en p50 på 1.84 sekunder. Muse Spark 1.2 har ännu ingen produktionstelemetri.

Den strukturella poängen: båda modellerna har obligatoriskt resonerande. Fable 5:s ansträngningsratt går från låg till max och är som standard hög; Muse Spark 1.2:s går från minimal till xhigh och är som standard medium. Ingen av dem låter dig stänga av tänkandet. Om du behöver svar under en sekund är den här jämförelsen helt fel hylla — det är vad en modell i Luna- eller Flash-Lite-klassen är till för.
Tvåmodellsstacken, prissatt.
Att framställa detta som ett vinnare-tar-allt-val är misstaget, eftersom trafiken inte är homogen. Nästan varje produktionsagent har en lång svans av rutinsteg — läsa en fil, sammanfatta en diff, formatera en patch, besluta vilket verktyg som ska anropas härnäst — och ett kort huvud av verkligt svåra steg där ett felaktigt svar kostar en timme.
Ta samma tusen agentsteg om dagen. Allt på Claude Fable 5: cirka 750 dollar. Allt på Muse Spark 1.2: cirka 88 dollar. Dela upp 900 rutinmässiga till den billiga modellen och 100 svåra till den dyra: cirka 79 dollar plus 75 dollar, eller $154 om dagen. Det är en femtedel av hela Fable-notan samtidigt som man behåller toppkapaciteten på den tiondel av anropen som faktiskt behöver det – och det är en skillnad på ungefär 220 000 dollar om året på en enda agentloop.
Anledningen till att split är värt att bygga snarare än att bara beskriva är att det tidigare krävde två leverantörsrelationer, två SDK:er och två uppsättningar autentiseringsuppgifter. Det gör det inte nu. Claude Fable 5 finns i OrcaRouter-katalogen för $10.00 och $50.00 — leverantörens listpris, vidarefakturerat med 0 % påslag — och Muse Spark 1.1 finns där för $1.25 och $4.25 på samma grund, bakom samma OpenAI-kompatibla endpoint. Routnings-DSL:n låter dig uttrycka "billig modell först, eskalera vid låg konfidens eller vid en misslyckad testkörning" som ett enda anrop snarare än som orkestreringskod du underhåller, och modellfusion låter dig skicka de verkligt tvetydiga stegen till en panel av modeller på en gång och jämföra. Muse Spark 1.2 är ännu inte i katalogen — Meta levererar den direkt, som enda leverantör — så idag är det närmaste du kan bygga till denna stack att använda 1.1 på den billiga armen.
Den där leverantörsdetaljen förtjänar en egen rad i en riskbedömning. Claude Fable 5 har flera leveransvägar och automatisk växling mellan dem. Muse Spark 1.2 har exakt en slutpunkt, som drivs av Meta. Om den går ner finns det ingen reserv som är samma modell.
En kostnadsmodell, inte en dom.
Det användbara resultatet av denna jämförelse är inte "vilken modell som vinner." Det är ett tröskelvärde du kan beräkna för din egen arbetsbelastning.
Uppskatta andelen av dina anrop där ett svar av Muse Spark 1.2-klass misslyckas och ett svar av Fable 5-klass lyckas. Multiplicera med vad ett misslyckande kostar — ingenjörsminuter, en dålig merge, en retry-loop, en kund. Jämför det med 66 cent per steg, vilket är vad det kostar att uppgradera ett enskilt anrop från Muse Spark 1.2 till Claude Fable 5 i exemplet ovan med 60K in / 3K ut. Om den förväntade förlusten från ett felaktigt svar överstiger 66 cent, dirigera det steget till Fable 5. Om den inte gör det, gör inte det.
För de flesta team placerar den beräkningen Fable 5 på kodgranskning, slutlig patchgenerering, arkitekturplanering och allt som rör produktionsdata, och placerar Muse Spark 1.2 på allt annat — filläsning, sammanfattning, testtriage, verktygsval, den högvolymsmässiga mitten av en agentloop där kostnaden är verklig och insatserna per anrop inte är det.
En sak att hålla koll på: Design Arena-stegarna och de per-dimensionella indexen för Muse Spark 1.2, varav inget ännu existerar. Fable 5:s starkaste bevis finns just i head-to-head-arenalerna där Metas nya modell inte har några resultat alls. När de resultaten väl dyker upp, flyttas denna tröskel – möjligen en hel del.
Jämförda i den här artikeln2
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
