
Muse Spark 1.2 mot GPT-5.6 Luna: Tre indexpunkter för 4,6 gånger tokenpriset
- AlibabaNYQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiNYZ.ai: GLM 5.3 Flash2026-08-2658Intelligens72Kodning
- DeepSeekNYDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M tokens
- z-aiNYZ.ai: GLM 5.32026-08-1860Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1552Intelligens68Kodning
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1261Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
Artificial Analysis körde samma nio-benchmark-svit genom båda dessa modeller och behöll kvittona. Att köra Muse Spark 1.2 genom det kostade $637.85. Att köra GPT-5.6 Luna genom det kostade $174.06. För den 3.7x skillnaden i utgifter kom Metas modell ut tre poäng före — 54 mot 51 på Intelligence Index. Huruvida det är en bra affär är hela frågan, och svaret beror mycket mindre på benchmarken än på två saker som nästan ingen skriver om: hur ditt agentramverk hanterar prompt-cachning och huruvida din arbetsbelastning någonsin behöver höra eller titta på något.
Varje siffra nedan är antingen en oberoende Artificial Analysis-mätning, en live API-lista eller OrcaRouters egen produktionstelemetri — det sistnämnda är värt att flagga på förhand eftersom det motsäger benchmarksiffrorna på ett lärorikt sätt. Inget här är ett leverantörspåstående utklätt till ett resultat; där leverantören är den enda källan, säger meningen det.
Resultattavlan är närmare än prislappen antyder
Muse Spark 1.2 får 54 poäng på Artificial Analysis Intelligence Index med sin xhigh-resonemangsinställning, vilket placerar den på 13:e plats av 185 modeller mot ett klassmedian på 32. GPT-5.6 Luna får 51 med maximal ansträngning. Tre poäng på ett sammansatt index av GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience och AA-LCR.
Tre poäng är reellt men litet, och delpoängen för föregående generation antyder var det kommer ifrån. Artificial Analysis siffror per dimension placerar Muse Spark 1.1 på ett kodningsindex på 71,3 och ett agentiskt index på 37,5; GPT-5.6 Luna ligger på 71,4 och 45,6. Kodningen var helt jämn, och Luna var åtta poäng före på agentiskt arbete – exakt den dimension som Meta skrev om 1.2:s produktbeskrivning för att hävda. Den sammanvägda poängen försköts tre poäng till Metas fördel. Ingen har ännu publicerat en nedbrytning per dimension för 1.2, så huruvida det agentiska gapet verkligen stängdes är overifierat.

När det gäller blandat tokenpris är gapet inte subtilt. Artificial Analysis blandade taxa placerar Muse Spark 1.2 på $0,78 per miljon tokens och GPT-5.6 Luna på $0,17. Listpriser: $1,25 in och $4,25 ut för Muse Spark 1.2, $0,20 in och $1,20 ut för Luna.
Prissatt per arbetsenhet snarare än per token, kostar ett enda steg för en kodningsagent som läser 60 000 tokens kontext och skriver 3 000 tokens utdata ungefär 8,8 cent på Muse Spark 1.2 och ungefär 1,6 cent på GPT-5.6 Luna. För tusen steg per dag blir det 88 dollar mot 16 dollar — en skillnad på ungefär 26 000 dollar per år för en enda agentloop.
Cachning är där gapet antingen sluts eller fördubblas
Båda modellerna säljer aggressiva priser för cachad indata, och förhållandet mellan dem är inte detsamma som förhållandet mellan deras listpriser. Muse Spark 1.2 läser cachad indata för $0.15 per miljon, en rabatt på 88 % från dess pris på $1.25. GPT-5.6 Luna läser cachad indata för $0.01 per miljon, en rabatt på 95 % från $0.20.
Kör om samma agentsteg med 60 000-tokenprefixet serverat varmt: Muse Spark 1.2 sjunker från 8,8 cent till cirka 2,2 cent. Luna sjunker från 1,6 cent till cirka 0,4 cent. Den absoluta skillnaden minskar från 7,2 cent till 1,8 cent per steg, men multipeln förblir ungefär densamma – cachning räddar inte den dyrare modellen, den gör bara båda billigare med liknande faktorer. Det den däremot ändrar är vilken radpost som dominerar: cachad är Muse Spark 1.2:s kostnad 59 % utdatatoken snarare än 85 % indatatoken, så modellens mångordighet börjar spela större roll än dess kontextstorlek.
Det är inte ett hypotetiskt problem här. Muse Spark 1.2 genererade 95M output-tokens genom Intelligence Index, mot en median på 65M. Artificial Analysis egen sammanfattning kallar det "något mångordigt". Luna förbrukade 130M, vilket låter värre tills man multiplicerar med $1,20 istället för $4,25.
Métas produkttexter hävdar att prompt-cachning kan minska den effektiva kostnaden med 60–80 % beroende på hur mycket kontext som upprepas. Det är en uppskattning från leverantören, inte en mätning, men beräkningen ovan hamnar inom intervallet.
Latens: den axel där benchmarken inverterar sanningen
Läser du bara Artificial Analysis latenssiffror skulle du dra slutsatsen att Muse Spark 1.2 är den responsiva. Tid till första token: 26,12 sekunder för Muse Spark 1.2, 126,99 sekunder för GPT-5.6 Luna. Nästan fem gånger snabbare.
Båda dessa mäts vid varje modells dyraste resonemangsinställning — xhigh för Muse Spark, max för Luna. Ingen av dem är vad du kommer att se. På OrcaRouter, under en vecka med riktig trafik vid vilken ansträngningsnivå som anropare faktiskt begär, visar GPT-5.6 Luna en p50-tid till första token på 1,84 sekunder och en p95 på 9,68 sekunder. Muse Spark 1.1 visar en identisk p50 på 1,84 sekunder med en snävare p95 på 6,00 sekunder. Det finns ännu ingen produktionstelemetri för 1.2 eftersom den är för ny.

Den strukturella skillnaden är mer användbar än endera siffran. GPT-5.6 Lunas resonemang är valfritt — ansträngningsratten går från ingen genom låg, medel, hög, xhög till max, och du kan verkligen stänga av tänkandet för klassificering, routning eller extraktion. Muse Spark 1.2:s resonemang är obligatoriskt. Ratten bottnar vid minimal, och det finns ingen inställning som ger dig vikterna utan att betala för övervägande. För allt som är högvolym- och latenskänsligt är det en designbegränsning, inte en tuningparameter.
Uthållig genomströmning ligger nära: 165,0 tokens per sekund för Muse Spark 1.2 mot 177,9 för Luna, båda väl över klassmedianen på 71.
Prisfotnoten som alla kommer att snubbla över.
GPT-5.6 Lunas pris är för närvarande listat olika på olika ställen, och om du bygger en kostnadsmodell bör du veta det innan du anger en siffra. Artificial Analysis och OrcaRouters katalog visar båda $0,20 per miljon input och $1,20 per miljon output — den kurs som följde på GPT-5.6-prissänkningen i juli, och den kurs som Artificial Analysis använde för att beräkna eval-räkningen på $174,06 ovan. Vissa marknadsplatslistor visar för närvarande $0,10 och $0,60 med en separat högre nivå som träder in över 272 000 prompt-tokens. Det säkra är att kontrollera priset på den endpoint du faktiskt anropar snarare än den i jämförelseartikeln.
Detaljen om nivåindelningen är verklig oavsett vilken basavgift som gäller, och den är genuint underbevakad: Lunas pris trappas upp när en enskild begäran överstiger ungefär 272 000 prompt-tokens. Inmatningen fördubblas ungefär, utmatningen ökar med hälften, och cachade läsningar skalar med det. Om ditt skäl till att titta på Luna är dess kontextfönster på 1,05 miljoner tokens, notera att du lämnar den officiella avgiften ungefär en fjärdedel in. Muse Spark 1.2 har en fast avgift över hela sina 1 048 576 tokens utan extra avgift för långa kontexter — för genuint långa enskilda begäranden minskar den effektiva skillnaden mellan de två avsevärt.
Det som Luna inte kan göra till något pris
Modalitetsskillnaden är det tydligaste skälet att välja den ena framför den andra, och den förekommer inte på någon topplista.
• Indata — Muse Spark 1.2 accepterar text, bilder, video, ljud och PDF-dokument enligt Metas listning. GPT-5.6 Luna accepterar text, bilder och filer. Inget ljud, ingen video. Om din pipeline hanterar inspelningar eller videomaterial är Luna inte en kandidat alls.
• Maximal utdata — Luna anger ett tak på 128 000 token för slutförande. Muse Spark 1.2:s slutpunkt anger ingen maximal längd för slutförande, vilket är ovanligt nog att du bör testa det snarare än att planera runt det.
• Kunskapsgräns — Luna's publiceras som den 16 februari 2026. Meta publicerar ingen gräns för Muse Spark 1.2, så budgetera för hämtning oavsett.
• Servering — Luna är allmänt tillgänglig världen över genom flera vägar. Muse Spark 1.2 serveras av exakt en leverantör: Meta. En slutpunkt, en regionspolicy, en sak som kan gå ner.
• Moderering — båda är modererade slutpunkter.
En ärlig invändning gällande den multimodala fördelen: Artificial Analysis tekniska specifikationskort för Muse Spark 1.2 listar text- och bildinmatning som det som utvärderades, inte hela den femmodala ytan som Meta marknadsför. API:et accepterar mer än vad någon oberoende part har testat.

Användning, eftersom det råkar vara mätbart.
Benchmarks berättar vad en modell kan göra; trafiken berättar vad människor anförtror den att göra. 4 679,4 miljoner tokens. Muse Spark 1.1 – samma 1M-kontext, jämförbart indexresultat, fyra veckor äldre i katalogen – hanterade 4,4 miljoner. Det är en faktor på ungefär tusen.
En del av det handlar om distribution: Luna är standard i fler verktyg och har varit allmänt tillgänglig globalt längre, medan Muse Spark-familjen lanserades endast i USA. Men ett gap på tusen mot ett på en router där båda bara skiljer en modellsträng från varandra är inte enbart en fråga om distribution. Det är den praktiska anledningen till att Luna är det säkrare standardvalet och Muse Spark 1.2 är det du medvetet utvärderar.
Värt att notera vad du kan och inte kan hyra idag: GPT-5.6 Luna finns i OrcaRouter-katalogen för $0.20 och $1.20, samma siffror som på leverantörens egen prislista, eftersom vi kör med 0 % påslag och förmedlar leverantörens listpris rakt av. Muse Spark 1.1 finns där för $1.25 och $4.25 på samma grund. Muse Spark 1.2 finns ännu inte i katalogen – den levereras direkt av Meta. Så det billigaste sättet att göra den här jämförelsen ärligt idag är Luna mot Muse Spark 1.1 på en nyckel, genom att ändra en sträng mellan körningarna, och sedan testa mot 1.2 när den kommer.
Välj en.
Ta GPT-5.6 Lunaom arbetsbelastningen är högvolym och textbaserad: chatt, klassificering, extraktion, routning, lätt verktygsanvändning. Den är en fjärdedel av det sammanvägda priset, den låter dig stänga av resonemanget helt, dess 1,84-sekunders p50 är ett verkligt uppmätt produktionsnummer snarare än en benchmarkartefakt, och den är modellen med tusen gånger mer live-trafik bakom sig. Tre indexpunkter överlever inte den aritmetiken.
Välj Muse Spark 1.2 om arbetsbelastningen är långsiktig agentisk kodning — flerfiliga refaktoriseringar, utökad felsökning, arbete över hela repot — eller om den involverar ljud- eller videoinmatning, där Luna helt enkelt inte kan konkurrera. Det är också det bättre valet för verkligt enorma enskilda förfrågningar, eftersom dess pris är fast över hela miljonen tokens medan Lunas pris trappas upp efter 272K.
Ta båda om du är ärlig om hur agentsystem faktiskt byggs. Det vinnande mönstret är en billig modell som hanterar den rutinmässiga majoriteten av anropen och en dyr sådan reserverad för de steg där kvalitet lönar sig. Båda modellerna ligger bakom en OpenAI-kompatibel endpoint, så den uppdelningen är en routingregel snarare än en andra leverantörsrelation — och om den dyra delen går ner mitt i körningen innebär automatisk failover att din utvärdering inte tyst förgiftar sig själv med ett halvt dataset.
Det man bör hålla utkik efter under nästa månad är uppdelningen per dimension. Muse Spark 1.2:s hela säljargument är agentisk förmåga, och i förra generationen var det den dimension där Luna ledde med åtta poäng. Tills någon publicerar ett agentiskt index för 1.2, är den sammanlagda ökningen på tre poäng det enda bevis som finns för att Meta har kommit ikapp.
