Muse Spark 1.2 vs Claude Haiku 4.5: Identiskt blandat pris, motsatta idéer om tänkande
Guides & Insights

Muse Spark 1.2 vs Claude Haiku 4.5: Identiskt blandat pris, motsatta idéer om tänkande

Författare

Jim Song

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Artificial Analysis prissätter Muse Spark 1.2 till $0,78 per miljon tokens genomsnittligt och Claude Haiku 4.5 till $0,77. En cent ifrån varandra, från två labb som inte var överens om något annat. Metas modell kan inte sluta resonera; Claude Haiku 4.5 resonerar bara när du ber den om det. Meta ger dig 1 048 576 tokens kontext; Claude Haiku 4.5 ger dig 200 000. Meta släppte denna den 5 augusti 2026 som en kodningsmodell med en terminalagent bifogad; Claude Haiku 4.5 släpptes i oktober 2025 som den snabba, billiga arbetaren som en större modell säger åt vad den ska göra. Samma pris per token, helt olika maskiner.

Detta sammanträffande är den användbara utgångspunkten för en jämförelse, eftersom det eliminerar den variabel människor vanligtvis beslutar utifrån och tvingar frågan att istället handla om form. Det som följer använder oberoende siffror där sådana finns — Artificial Analysis för indexpoäng och labblatens, OrcaRouters egen sjudagars produktionstelemetri för verklig trafiklatens — och flaggar leverantörsrapporterade siffror som sådana, inklusive en av leverantörens benchmark-rubriker som saknar motsvarighet från tredje part.

Specifikationskontrasten, en dimension i taget.

Pris — Muse Spark 1.2 för $1.25 in / $4.25 ut per miljon; Claude Haiku 4.5 för $1.00 in / $5.00 ut. Meta är billigare på input, Claude Haiku 4.5 på output.

Cache — $0.15 per miljon vid en Muse Spark 1.2 cache-träff, en rabatt på 88 %; $0.10 per miljon vid en Claude Haiku 4.5 cache-läsning, en rabatt på 90 %, med cache-skrivningar debiterade till $1.25.

Kontext — 1 048 576 tokens mot 200 000. En 5,2× skillnad, och det enskilt största gapet mellan dem.

Maximal utdata — Claude Haiku 4.5 anger ett tak på 64 000 tokens; slutpunkten för Muse Spark 1.2 anger ingen maximal slutförandelängd alls, vilket är ovanligt nog för att testas snarare än att antas.

Resonemang — obligatoriskt på Muse Spark 1.2, med fem ansträngningsnivåer från minimal till xhigh och en standard på medium; valfritt på Claude Haiku 4.5, som är en icke-resonerande modell tills du aktiverar utökat tänkande och ger den en tankebudget.

Indata — Meta stödjer text, bilder, video, ljud och PDF; Claude Haiku 4.5 tar emot text och bilder. Båda returnerar text.

Vikter och leverantörer — båda stängda. Muse Spark 1.2 tillhandahålls endast via Metas egen Model API; Claude Haiku 4.5 finns tillgänglig från leverantören och via de vanliga molnåterförsäljarna och aggregatorerna.

Ålder — Muse Spark 1.2 är bara dagar gammal. Claude Haiku 4.5 har varit i produktion sedan 15 oktober 2025, med en kunskapsgräns från juli 2025 och nio månaders ackumulerad fälterfarenhet bakom sig.

Indexgapet är verkligt. Siffran alla kommer att citera är det inte.

Artificial Analysis ger Muse Spark 1.2 betyget 54 på sitt Intelligence Index, rank #13 av 185. Dess nuvarande notering för Claude Haiku 4.5 är 24. Ställ dem sida vid sida så har du en rubrik; titta på vad noteringarna faktiskt är så faller rubriken samman.

54:an är Muse Spark 1.2 utvärderad med xhigh, dess dyraste resonemangsinställning. 24:an är Claude Haiku 4.5 utvärderad som en modell utan resonemang — med tänkande avstängt — och Artificial Analysis flaggar den som en uppskattning snarare än en slutförd körning. På en tidigare version av samma index, före v4.1-omviktningen, placerade Artificial Analysis Claude Haiku 4.5 på 55 med resonemang aktiverat och 42 utan det. De äldre siffrorna kan inte heller jämföras med 54, eftersom indexversioner skalar om och en poäng från v3-eran är inte en v4.1-poäng.

Så det ärliga påståendet är snävare än vad topplistan får det att se ut: Muse Spark 1.2 med maximal insats uppnår 54 på det nuvarande indexet; det finns inget publicerat v4.1-resultat för Claude Haiku 4.5 med utökat tänkande aktiverat, så det finns ännu ingen likvärdig jämförelse mellan dessa två vid full insats. Den som visar dig 54 mot 24 jämför en modell som överväger fullt ut mot en modell som blivit tillsagd att inte överväga.

Där leverantören har publicerat en siffra är den specifik: Claude Haiku 4.5 får 73,3 % på SWE-bench Verified, genomsnitt över 50 försök med en tankebudget på 128K. Det är en leverantörssiffra, och tankebudgeten är enorm för en modell som marknadsförs på snabbhet – men det är samma utvärdering som branschen citerar för frontmodeller, och den placerar Haiku i en klass som dess pris inte antyder. Metas motsvarande anspråk för Muse Spark 1.2 är Terminal-Bench 2.1 på 82,9 % och DeepSWE v1.1 på 59,3 %, också leverantörsdrivna, på Metas egen testmiljö med varje konkurrent kopplad till sin egen agentprodukt. Två leverantörer, två riktmärken, ingen överlappning. Det finns för närvarande ingen enskild utvärdering där båda dessa modeller har en publicerad poäng från samma utvärderare.

Fyra latenssiffror, två olika historier

Latens är där formuleringen 'samma pris' slutar vara en kuriositet och börjar vara en beslutsfaktor, och det är också där mätkällan har störst betydelse.

I benchmark-miljön registrerar Artificial Analysis tid till första token på 26,12 sekunder för Muse Spark 1.2 vid xhigh, och 1,00 sekund för Claude Haiku 4.5. En 26× skillnad, och om det vore hela bilden skulle jämförelsen vara över.

I produktion är det omvänt. Under sju dagar med verklig trafik på OrcaRouter — där anropare använder vilken ansträngningsnivå de faktiskt vill ha — visar Claude Haiku 4.5 en p50-tid till första token på 3,84 sekunder och en p95 på 10,00 sekunder, vid 214 tokens per sekund och en felfrekvens på 1,0 %. Muse Spark 1.1, den version av Metas modell som finns i katalogen, visar en p50 på 1,84 sekunder och en p95 på 6,00 sekunder, vid 519 tokens per sekund och utan registrerade fel. Vid livetrafik är Meta-modellen den snabbare.

Båda uppsättningarna siffror är sanna och de mäter olika saker. Labbsiffran är varje modell med maximal betänketid och en kall cache, vilket är ett rättvist test av taket och ett dåligt test av en chattruta. Produktionssiffran inkluderar cacheträffar, korta prompter, låga ansträngningsnivåer och allt annat som verkliga applikationer gör, vilket är ett rättvist test av medianen och inget test alls av värsta fallet. Fällan är att citera den ena och resonera om den andra. Om du dimensionerar en användarvänd timeout är p95 din siffra. Om du frågar vad ett djupt agentiskt steg kostar i verklig tid, är benchmarksiffran närmare sanningen — och det ärliga förbehållet är att ingen sådan produktionssiffra finns för själva Muse Spark 1.2 ännu, eftersom den är för ny och inte allmänt dirigerad.

Båda labben sålde dig en subagent. De menade olika saker.

Leverantörens säljargument för Claude Haiku 4.5 var tydliga när det gäller hierarkin: Sonnet-klassens modeller planerar och orkestrerar, medan Haiku-instanser exekverar parallellt under dem. Billiga, snabba, utbytbara, många samtidigt. Produktdesignen följer samma logik — ett 200K-fönster räcker gott för en avgränsad deluppgift och är medvetet inte tillräckligt för ett helt repository, tänkande är avstängt som standard eftersom en arbetare som reflekterar är en arbetare som kostar orkestreraren pengar, och leverantörens egen marknadsföring pekar ut realtidschatt, kundservice och parprogrammering som mål.

Metas pitch för Muse Spark 1.2 gör anspråk på båda ändarna av samma hierarki. Metas copy säger att modellen kan vara den primära agenten som samlar in kontext, planerar och delegerar, eller en underagent som exekverar parallellt under en sådan. Muse Code, terminalagenten som släpptes tillsammans med den, koordinerar flera beständiga underagenter per uppgift i isolerade worktrees, på en replay-exakt event-log runtime. Miljontokenfönstret och det alltid aktiva resonerandet är vad en planerare behöver; de är precis vad du inte skulle välja för en fan-out-worker, eftersom varje parallell instans betalar för eftertanke du inte bad om.

Läst som arkitektur snarare än marknadsföring, det är den verkliga skillnaden: leverantören byggde en arbetare och förväntar sig att du tar med en orkestrerare; Meta byggde en orkestrerare och hävdar att den också kan fungera. Om du redan driver en hierarki, är det intressanta experimentet inte att välja mellan dem — det är Muse Spark 1.2 som planerar och Claude Haiku 4.5 som utför, vilket är en form som ingen av leverantörerna kommer att sälja till dig som ett paket.

Vad ett verkligt steg kostar på varje

Per-miljon-priser avgör ingenting på resonemangsmodeller, eftersom modellen själv väljer hur många tokens den lägger ned. Prissätta steget i stället.

Ta en avgränsad koduppgift: 60 000 tokens av repository-kontext in, 3 000 tokens av patch ut. Kallt, Claude Haiku 4.5 kostar $0,060 för input plus $0,015 för output — 7,5 cent. Muse Spark 1.2 kostar $0,075 plus $0,013 — 8,8 cent. Nära nog för att vara brus, precis som den blandade taxan lovade.

Lägg nu till det som den blandade avgiften döljer. Muse Spark 1.2 kan inte stänga av resonemang, och vid sin standardinställning medium avger ett sådant steg troligen några tusen resonemangstoken före patchen – de debiteras som utdata. Lägg till 3 000 så blir samma steg $0,075 + $0,026 = 10,1 cent, ungefär 35 % högre än Haiku på identiska indata. Claude Haiku 4.5 med tänkande avstängt betalar ingenting för resonemang och ligger kvar på 7,5 cent; med en stor resonemangsbudget kommer den att överträffa Muse Spark 1.2, eftersom Claude Haiku 4.5 tar $5,00 per miljon utdata mot Metas $4,25.

Cachning vänder återigen på tyngdpunkten. Håll repository-kontexten stabil så att den träffar cachen, och Haikus inmatning sjunker till 0,006 dollar och Muse Spark 1.2:s till 0,009 dollar — inmatningssidan slutar helt att spela roll och hela jämförelsen blir en kamp om output-tokens, vilket är en kamp om hur mycket varje modell tänker. För en arbetsbelastning som upprepar kontext är cache-nyckelns stabilitet värd mer än modellvalet, och det gäller för båda dessa modeller.

1M-fönstret är den enda plats där matematiken inte går ihop. Allt som verkligen behöver mer än 200 000 tokens i ett enda anrop kan inte köras på Claude Haiku 4.5 till något pris. Antingen delar du upp och orkestrerar — vilket är vad leverantören avser — eller så använder du en modell med utrymmet.

Att prova båda utan ett andra kontrakt

Claude Haiku 4.5 finns i OrcaRouter-katalogen för $1.00 och $5.00 — leverantörens listpris, eftersom OrcaRouter kör med 0 % påslag och förmedlar leverantörens prissättning oförändrad, vilket också innebär att en prisändring från leverantören är live hos oss samma dag snarare än vid nästa kontraktsperiod. Produktionslatenssiffrorna ovan kommer från samma routinglager.

Muse Spark 1.2 finns inte i katalogen. Metas Model API är för närvarande den enda platsen där den kan anropas, så en verklig head-to-head idag innebär en integration genom oss och en direkt med Meta. Muse Spark 1.1 är värdbaserad, till samma $1,25 och $4,25 som Meta tar för 1.2, vilket gör den till en rimlig ersättare för familjens kostnads- och latensprofil men inte för de kodningsvinster som 1.2 säljs in med. När 1.2 blir dirigerbar blir jämförelsen en ändring av modellsträngen på en rad mot samma nyckel – och för orchestrator-plus-worker-experimentet som beskrivits ovan är routing-DSL:n hur du kopplar en planner och en fan-out-worker till ett enda anrop istället för att bygga överlämningen själv.

Välj efter arbetets form, inte poängen.

Välj Claude Haiku 4.5 när arbetet är avgränsat och användaren väntar. Supportagenter, klassificering, extraktion, chatt, parprogrammeringskompletteringar och den parallella arbetarnivån i en agenthierarki. Det är en känd kvantitet med nio månaders fälthistorik, tänkande är valfritt så du betalar bara för eftertanke när du vill ha den, och 200K räcker för nästan vilken avgränsad deluppgift som helst. Dess publicerade SWE-bench Verified-resultat säger att den är långt mer kapabel än priset antyder, förutsatt att du är villig att lägga den tankebudget som resultatet använde.

Välj Muse Spark 1.2 när arbetsenheten är ett repository snarare än en request. Multi-fil-refaktoreringar, utökad felsökning, generering av hela projekt, långsiktiga agentloopar där ingen tittar på en spinner. Miljon-tokenfönstret eliminerar ett uppdelningsproblem som Haiku inte kan lösa till något pris, och det obligatoriska resonemanget som förstör det för chatt är rätt standard när en felaktig plan kostar mer än en långsam sådan.

Vad som bör avgöra det är inte indexnumret. Ställ två frågor i stället: behöver ett enskilt anrop någonsin se mer än 200 000 tokens, och väntar en människa på den första token? Ett ja på den första pekar på Meta. Ett ja på den andra pekar på leverantören. Ett ja på båda betyder att du vill ha två modeller, vilket är det ärliga svaret oftare än endera leverantörens marknadsföring medger.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

Kontakta oss

Gå med i vår community

DiscordEmailXGitHubYouTube