
Muse Spark 1.2 vs DeepSeek V4 Flash: Fyra indexpunkter för nio gånger notan
- metaNYMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenNYQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekNYDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- minimaxNYMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens · 2278 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligens77Kodning
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligens77Kodning
- grokxAI: Grok 4.52026-07-0856Intelligens72Kodning
- tencentTencent: Hy32026-07-0642Intelligens59Kodning
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligens42Kodning
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligens39Kodning
- anthropicAnthropic: Claude Sonnet 52026-06-3055Intelligens72Kodning
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligens52Kodning57Matematik
$72.02 och $637.85. Det är de belopp som Artificial Analysis spenderade på att köra DeepSeek V4 Flash och Muse Spark 1.2 genom samma nio benchmarks, och modellerna hamnade fyra poäng ifrån varandra — 50 mot 54 på Intelligence Index. Metas modell är bättre. Den är också 8,9 gånger dyrare att köra igenom identiskt arbete, med stängda vikter, serverad av exakt en leverantör och fem dagar yngre än DeepSeek V4 Flash. Huruvida fyra poäng är värt det beror helt på vad du bygger, och den här jämförelsen handlar mest om att göra den frågan besvarbar.
Båda modellerna anlände inom en vecka från varandra — DeepSeek V4 Flash (build 0731) den 31 juli 2026, Muse Spark 1.2 den 5 augusti — och båda marknadsförs för långsiktigt agentarbete. Varje indexpoäng, latenssiffra och utvärderingskostnad nedan kommer från Artificial Analysis, som själva kör benchmarktesterna och publicerar notan. Där en siffra kommer från Meta eller från leverantörens egen dokumentation snarare än från en oberoende körning, framgår det av meningen.
De fyra siffrorna som avgör detta
• Intelligence Index — Muse Spark 1.2 54 (#13 av 185), DeepSeek V4 Flash 50 (#3 av 101 i sin klass, mot ett klassmedian på 25).
• Vägt pris per miljon tokens — $0.78 mot $0.06. Tretton gånger.
• Kostnaden för samma nio-benchmarksvit — $637.85 mot $72.02.
• Var du kan köra den — en leverantör, stängda vikter jämfört med sex API-leverantörer plus MIT-licensierade vikter du kan hosta själv.
Samma svit, två mycket olika fakturor

Kolumnen för utvärderingskostnad är den mest ärliga kostnadsjämförelse som finns för två modeller, eftersom det är samma arbete, prissatt enligt varje modells egna priser, där varje modell använder så många tokens som den själv väljer att använda. Muse Spark 1.2 behövde $637.85 för att slutföra Intelligence Index. DeepSeek V4 Flash behövde $72.02 – billigare än varje annan välkänd modell som Artificial Analysis har mätt, ett resultat som fick en egen nyhetscykel i början av augusti.
Det som gör den klyftan intressant är att den uppstår trots att DeepSeek V4 Flash-modellen är den mer mångordiga, inte på grund av den. Vid körningen av sviten genererade DeepSeek V4 Flash 210 miljoner utdata-token jämfört med Muse Spark 1.2:s 95 miljoner – mer än dubbelt så många. Metas modell är betydligt mer token-effektiv för samma uppgift, och det spelar ingen roll alls, eftersom DeepSeek V4 Flash tar $0.28 per miljon utdata-token jämfört med Metas $4.25. En 15× prisfördel slukar en 2.2× mångordighetsnackdel utan att märka det.
Detta är vad du bör ta med i din egen kostnadsmodell. Token-effektivitet är en verklig egenskap och resonemangsmodeller skiljer sig åt avsevärt i detta, men vid nuvarande marknadspriser är det en andra ordningens term. Prislistan avgör, och den tippar över endast när två modeller ligger inom ungefär 3× i pris.
Var de fyra punkterna är — och vad ingen har publicerat

Här är den obekväma delen av den här matchningen: Intelligence Index är en sammansättning av nio utvärderingar inom agenter, kodning, allmän förmåga och vetenskapligt resonerande, och Artificial Analysis har ännu inte publicerat uppdelningen per riktmärke för Muse Spark 1.2. Så ”54 mot 50” är för närvarande en rubrik utan en nedbrytning. Fyra poäng kan vara ett gap inom kodning, ett gap i lång kontext, ett gap i hallucinationsresistens – eller fyra små gap som tar ut varandra i din arbetsbelastning.
Varje leverantörs egna siffror fyller en del av tomrummet, och ingen av dem kan kontrolleras mot den andra. Meta rapporterar Terminal-Bench 2.1 på 82,9 % för Muse Spark 1.2 (upp från 76,2 % för 1.1) och DeepSWE v1.1 på 59,3 % (upp från 53,0 %) — körda på Metas testmiljö, pass@1 över fem försök, där varje konkurrerande modell är kopplad till sin egen agentprodukt. V4 Flash-versionen positionerade modellen som en efterträningsuppgradering anpassad för agent- och terminalarbete på en mixture-of-experts-arkitektur med totalt 284B parametrar / 13B aktiva. Det finns inget riktmärke där båda labben har publicerat en jämförbar siffra, och ingen tredje part har reproducerat något av resultaten.
Det som är oberoende fastställt är begränsat och värt att säga rakt ut: på ett sammansatt index, genomfört av en utvärderare, slutade Muse Spark 1.2 fyra poäng före, till 8,9 gånger kostnaden. Allt mer detaljerat än så är fortfarande leverantörsmaterial.
Tre sätt att betala för Muse Spark 1.2, ett och ett halvt för DeepSeek
Prisjämförelser här är ovanligt svårhanterliga, eftersom Meta skickar två prislistor och leverantören själv skickar vikterna.
• Meta standardnivå — 1,25 dollar för indata, 0,15 dollar för cachad indata, 4,25 dollar för utdata per miljon, med ett hastighetstak på cirka 3 000 förfrågningar per minut.
• Meta-bidragsnivå — $0,10 för inmatning, $0,002 för cachad inmatning, $0,20 för utdata, i utbyte mot tillstånd att träna framtida Meta-modeller på din trafik, begränsad till 60 förfrågningar per minut.
• DeepSeek V4 Flash-lista — 0,14 USD för indata, 0,28 USD för utdata, 0,003 USD vid cacheträff (98 % rabatt, den mest aggressiva cacheprissättningen av alla modeller i denna prisklass), från sex konkurrerande API-leverantörer.
• DeepSeek V4 Flash self-hosted — MIT-licensierade öppna vikter, så priset är din egen hårdvara och taket är din egen kapacitet.
Läs den andra och tredje raden tillsammans så vänder rankingen: på bidragsnivån är Muse Spark 1.2 billigare per token än DeepSeek V4 Flash, till $0,10/$0,20 mot $0,14/$0,28, samtidigt som den får fyra poäng högre. Det är den mest aggressiva prissättningen i hela denna jämförelse och nästan ingen kommer att kunna använda den, eftersom 60 förfrågningar per minut är 2 % av standardbudgeten och i praktiken utesluter allt produktionsutskick. Den är prissatt för utvärdering och småteamarbete, och valutan är dina prompts. Huruvida den affären är tillgänglig för dig är ett datastyrningsbeslut som hör hemma hos juridik, inte en rad du byter i en konfigurationsfil.
Sidan med öppna vikter fungerar tvärtom. MIT-vikter innebär att prisgolvet inte alls sätts av leverantören — om din volym motiverar GPU:erna kan ingen höja ditt pris, avveckla din modell eller ändra villkoren. Den valfriheten har ingen motsvarighet på Meta-sidan, oavsett nivå.
En leverantör mot sex

Muse Spark 1.2 serveras av Metas Model API och ingen annanstans. Inga tredjepartsvärdar, inget kvantiseringsval, ingen reservväg, och — när detta skrivs — ingen OpenRouter-listning, inget Hugging Face-repo och ingen post i OrcaRouter-katalogen. En stängd modell med en enda leverantör är per konstruktion en enda felpunkt, och för en modell som är fem dagar gammal finns det ingen drifttidshistorik som kan lugna dig.
DeepSeek V4 Flash är det motsatta fallet. Sex API-leverantörer erbjuder den idag, vikterna är MIT-licensierade, och den finns i OrcaRouter-katalogen för 0,15 dollar in och 0,29 dollar ut — leverantörens listpris, vidarebefordrat med 0 % påslag — med automatisk redundans mellan leverantörer, så att en enskild värd som försämras inte drar ner arbetsbelastningen med sig. Det är det praktiska argumentet för den billigare modellen som inte har något att göra med dess poäng: du kan flytta den, spegla den eller lämna den helt, och inget av dessa alternativ kräver en ny integration.
För Muse Spark 1.2 idag innebär en utvärdering ett andra kontrakt, en andra faktura och en andra SDK-väg. Metas modell är värd att testa på sina egna meriter, men var tydlig med att den operativa kostnaden för att köra den inte bara är tokenpriset.
Latens, uppmätt på riktig trafik
I benchmark-miljön registrerar Artificial Analysis tid till första token på 1,33 sekunder för DeepSeek V4 Flash och 26,12 sekunder för Muse Spark 1.2 vid dess xhigh-resonemangsinställning, med utmatningshastigheter på 103,3 respektive 165,0 tokens per sekund. Metas modell genererar snabbare när den väl har startat och tar mycket lång tid att starta, vilket är precis hur obligatorisk eftertanke vid maximal ansträngning ser ut.
Produktionssiffror berättar en mildare version av samma historia. Under sju dagar av live-routning på OrcaRouter visar DeepSeek V4 Flash en p50-tid till första token på 439 millisekunder och en p95 på 1,96 sekunder, med 111 tokens per sekund och en felfrekvens på 1,6 %. Det finns ingen motsvarande produktionssiffra för Muse Spark 1.2 eftersom den ännu inte routas någonstans; Muse Spark 1.1, den närmaste tillgängliga proxyn, kör en p50 på 1,84 sekunder och en p95 på 6,00 sekunder. Medianrespons under en sekund är en kategori som DeepSeek V4 Flash befinner sig i och som ingen Muse Spark-version har gått in i.
Båda modellerna anger ungefär en miljon tokens kontext — 1 048 576 för båda, där DeepSeek V4 Flash begränsar completions till 384 000 tokens och Muse Spark-slutpunkten inte anger något tak för completions alls. Kontextmässigt är denna matchning oavgjord på pappret och overifierad i praktiken för båda.
Tre frågor värda att ställa innan du byter
Är det faktiskt billigare att självhosta DeepSeek V4 Flash än $0,15 per miljon?
Vanligtvis inte, och det är just poängen. En 284B-parameters blandning av experter med 13B aktiva kräver seriös multi-GPU-kapacitet för att kunna serveras med rimlig latens, och till 0,15 dollar per miljon inmatade tokens är den värdbaserade avgiften svår att slå på annat än mycket hög och mycket jämn volym. Värdet med MIT-licensen för de flesta team är inte att de kommer att driva den själva – det är att de trovärdigt skulle kunna göra det, vilket sätter ett tak för vad en leverantör kan ta betalt och eliminerar risken för nedläggning. Se det som en försäkring, och köp de värdbaserade tokensen.
Gör bidragsnivån Muse Spark 1.2 till den billigare modellen?
På prislistan, ja; i praktiken endast för arbetsbelastningar under 60 förfrågningar per minut vars data du har tillstånd att donera. Om båda villkoren är uppfyllda — en forskningsspik, ett internt verktyg, en benchmark-miljö på syntetiska indata — då är en modell som ligger fyra indexpoäng före till ett lägre pris per token verkligen det bättre köpet och du bör ta den. Om något av dem brister är standardnivån det verkliga priset, och standardnivån är 13× V4 Flash-modellens blandade taxa.
Fyra indexpunkter låter lite. När spelar det någon roll?
När fel ackumuleras. Vid ett enda anrop för klassificering eller sammanfattning är ett sammansatt gap på fyra punkter ofta osynligt, och att betala 9× för det är oförsvarligt. I en agentloop med femtio steg multipliceras en till synes liten skillnad i framgång per steg till en stor skillnad i hur ofta hela körningen måste startas om — och en omstart kostar hela banan, inte ett steg. Det är fallet där Metas pris är försvarbart. Det är också fallet där du bör mäta på din egen uppgift snarare än att lita på ett sammansatt mått, eftersom ingen har publicerat det agentiska delindexet som skulle avgöra det för 1.2.
Domen, och villkoret som är kopplat till den
För nästan varje arbetsbelastning där kostnad är en verklig begränsning är DeepSeek V4 Flash rätt standardval: fyra poäng efter på ett sammansatt index, tretton gånger billigare blandat, medianlatens under en sekund i produktion, sex leverantörer, MIT-vikter och ingen leverantör som kan ändra villkoren för dig. Det är för närvarande den billigaste välkända modellen att köra genom en fullständig benchmark-svit, och den nådde inte dit genom att vara dålig.
Muse Spark 1.2 är värt sitt pris i en specifik typ av arbete: långsiktig agentisk kodning där en misslyckad bana är dyr, där den extra eftertanken amortiseras över minuter av arbete snarare än känns av en väntande användare, och där du kan nöja dig med en enda leverantör och ingen oberoende uppdelning av vad de fyra poängen består av. Meta har levererat tre modeller på fyra månader och flyttat elva indexpunkter under den tiden, så fallet kan snabbt stärkas – men idag vilar det på leverantörsdrivna kodningsbenchmarks och en sammansatt poäng.
Om du ska välja den här veckan, kör båda i femtio steg av din egen agentloop och jämför slutförda trajektorier per dollar snarare än tokens per dollar. Den enda mätningen svarar bättre på denna jämförelse än något publicerat riktmärke i den.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
