Muse Spark 1.2 och Muse Code-1
Guides & Insights

Muse Spark 1.2 och Muse Code: Metas tredje modell på fyra månader slutar oavgjort med Grok 4.5

Författare

Jim Song

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Meta släppte Muse Spark 1.2 den 5 augusti 2026, fyra veckor efter Muse Spark 1.1 och ungefär fyra månader efter den första Muse Spark. Den här kom med något som de två tidigare inte hade: en egen kodningsagent från Meta, Muse Code, släpptes i beta och tränades tillsammans med modellen den körs på. Och på den enda resultattavlan som varken Meta eller dess rivaler kontrollerar, gör releasen att Meta hamnar i ett dött lopp med SpaceXAI — Muse Spark 1.2 och Grok 4.5 får nu båda 54 på Artificial Analysis Intelligence Index.

Två saker är värda att hålla isär innan någon av siffrorna nedan får någon innebörd. Intelligence Index-poängen, latenssiffrorna och tokenantalen kommer från Artificial Analysis, som gör sina egna utvärderingar och publicerar notan; de är oberoende. De kodningsresultat som Meta inledde sitt tillkännagivande med — Terminal-Bench 2.1, DeepSWE v1.1 och ett internt riktmärke — kördes av Meta, på Metas testmiljö, där varje konkurrerande modell parades ihop med sin egen agentprodukt. Båda typerna av siffror är användbara. De är inte samma slags bevis, och den här artikeln håller isär dem.

Vad Meta faktiskt släppte

Muse Spark 1.2 and Muse Code-2

Tillkännagivandet, publicerat på Metas AI-forskningsblogg och daterat den 5 augusti, täcker två produkter på en gång.

Muse Spark 1.2 — en kodningsfokuserad uppdatering av Muse Spark-familjen. Meta säger att man har skalat upp träningsresurserna för kodningsuppgifter och breddat mångfalden av träningsmiljöer samtidigt som man bibehållit den allmänna agentförmågan som 1.1-versionen marknadsfördes med. De angivna träningsmålen är långsiktiga: generering av hela kodbaser, stora end-to-end-projekt och det Meta kallar auto-research, med planering för att sekvensera arbete, målkonditionering för att hålla riktningen över många steg, och kontextkomprimering för att hålla det relevanta tillståndet vid liv när en session pågår länge.

Muse Code — en terminalbaserad kodningsagent i betaversion, installerad med ett enradigt shell-skript från Metas utvecklardomän. Den kör beständiga asynkrona bakgrundsagenter som överlever en session, på en lokal händelselogg-runtime som Meta beskriver som replay-exakt och omstartssäker, och den koordinerar flera underagenter per uppgift i isolerade arbetsträd. Den levereras med tre inbyggda färdigheter: /plan för godkännandestyrd planering, /grill för stresstestning av redan utfört arbete, och /goal för att driva en uppgift till slutförande.

Kopplingen är inte tillfällig. Meta säger att de två tränades tillsammans – modellen finjusterades på rejection-samplade trajektorier från harnesset, med receptoptimeringar för mål, kompaktering och subagenter. Det är samma samträningsgrepp som gav upphov till Claude Code och Codex, och det får konsekvenser för alla som läser benchmark-siffror: modellens uppmärksammade kodningsresultat producerades i det harness som den tränades mot. Det är inte fusk, det är så agentisk utvärdering fungerar nu. Det innebär dock att ett resultat på 1,2 som uppnåtts genom något annat scaffold är en öppen fråga snarare än ett säkert antagande.

Resten av specifikationen är oförändrad från 1.1, vilken i sig är informativ. Kontexten förblir på 1 048 576 token. Resonemang förblir obligatoriskt över fem ansträngningsnivåer – minimal, låg, medel, hög, xhög – med medel som standard; det finns ingen konfiguration där du får vikterna utan att betala för viss eftertanke. Vikterna är stängda, utan något Hugging Face-repositorium, och Metas eget Model API förblir den enda förstapartsplatsen för att anropa det.

43, sedan 51, sedan 54

Muse Spark 1.2 and Muse Code-3

Artificial Analysis poängsätter Muse Spark 1.2 med 54 på sitt Intelligence Index på inställningen xhigh reasoning, vilket rankar den som nummer 13 av 185 modeller mot en klassmedian på 32. Indexet är en viktad sammansättning av nio utvärderingar — GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience och AA-LCR — jämnt fördelade över agenter, kodning, allmän förmåga och vetenskapligt resonemang.

Läst som en serie snarare än en ögonblicksbild är Meta-banan den faktiska historien. Den ursprungliga Muse Spark fick 43 i april. Muse Spark 1.1 nådde 51 den 9 juli, en ökning med åtta poäng på ett kvartal. Muse Spark 1.2 lägger till ytterligare tre på mindre än en månad. Meta har rört sig 11 indexpoäng på fyra månader och levererar nu snabbare än vad utvärderingsekosystemet hinner med – det finns fortfarande ingen publicerad uppdelning per riktmärke för 1.2, och ingen Design Arena-post för den alls, medan 1.1 har båda.

På plats 54 är Meta i nivå med Grok 4.5, modellen som SpaceXAI levererade en dag före Muse Spark 1.1, och bakom en tät frontgrupp: Claude Opus 5 på 61, Claude Fable 5 på 60, GPT-5.6 Sol på 59. Avståndet till toppen är sex eller sju poäng. Avståndet från där Meta började året är elva. Huruvida det minskar beror på om takten håller i sig, och Meta ligger på en fyraveckors releasetakt just nu.

Men ett oavgjort resultat i ett sammansatt index är inte ett oavgjort resultat för en arbetsuppgift, och det är värt att säga vad 54 avgör och inte avgör. Det avgör att Muse Spark 1.2 tillhör samma sammanhang som Grok 4.5 när det gäller sammantagen förmåga. Det säger dig inte vilken som skriver bättre patchar, eftersom det delindex för kodning som skulle besvara den frågan inte har publicerats för 1.2 ännu.

Metas kodnummer, läs noga.

Metas tillkännagivande leder på tre listor. På sina egna körningar, rapporterade som pass@1 över fem försök med varje konkurrerande modell parad med sin egen agentprodukt:

Terminal-Bench 2.1 – 82,9 % för Muse Spark 1.2, upp från 76,2 % för 1.1. Claude Opus 5 ligger före med 86,7 %.

DeepSWE v1.1 – 59,3 %, upp från 53,0 %.

Metas interna kodningsbenchmark — 70,6 %, upp från 68,3 %.

Deltavärdena är den trovärdiga delen. En förbättring på 6,7 poäng på Terminal-Bench och 6,3 på DeepSWE, mätt på samma sätt på samma testbänk av samma team med en månads mellanrum, är en rimlig indikation på hur mycket 1.2 förbättrades jämfört med 1.1 inom det Meta optimerade. Placeringen mellan leverantörer är den del man ska ta med en nypa salt: testbänksparningen är en stor fri variabel, och ett labb som ställer in sin egen testbänk tillsammans med sin egen modell är inte i stånd att ställa in allas andras lika väl. Meta var tvåa på sin egen bild, vilket åtminstone inte är den vanliga formen av en leverantörsbenchmark, men ingen tredje part har reproducerat något av det i skrivande stund.

Den andra prislistan

Det mest avgörande i den här utgåvan finns inte på prestandadiagrammen. Muse Spark 1.2 levereras med två prislistor.

Standardnivå — 1,25 USD per miljon indatatokens, 0,15 USD per miljon vid cacheträff, 4,25 USD per miljon utdata. Oförändrad från 1.1, till öret. Hastighetstaket ligger på cirka 3 000 förfrågningar per minut. Groundning med webbsökning debiteras separat med 2,50 USD per tusen sökningar.

Bidragsnivå — $0,10 indata, $0,002 cachad indata, $0,20 utdata. Det är 12,5× billigare på indata och 21,25× billigare på utdata. Inträdespriset är tillstånd för Meta att träna framtida modeller på din trafik, och en begränsning på 60 förfrågningar per minut — 2 % av standardbudgeten.

För $0,10 och $0,20 skulle Muse Spark 1.2 underbjuda nästan varje frontier-nära modell på marknaden, inklusive budgetnivån med öppna vikter som den annars förlorar mot prismässigt. Det är den intressanta siffran i denna lansering, och det är inte riktigt ett prissättningsbeslut. Sextio förfrågningar per minut utesluter i sig de flesta produktionsmässiga fan-out-mönster, så nivån är inriktad på experimentation och arbete i små team snarare än på att servera. Och "vi kan träna på din trafik" är en fråga för den som godkänner datastyrning i din organisation, inte för den som väljer modeller. Behandla det som en juridisk granskning med en rabatt bifogad, inte en billigare SKU.

Vad 54:an kostar att producera

Muse Spark 1.2 and Muse Code-4

Artificial Analysis publicerar vad dess egna utvärderingskörningar kostar, och i den kolumnen framträder Muse Spark 1.2:s form. Att ta sig igenom den nio benchmarks omfattande sviten kostade 637,85 dollar och förbrukade 95 miljoner output-tokens, jämfört med 548,07 dollar och 94 miljoner för Muse Spark 1.1 – till identisk prissättning per token. De extra 16 procenten är ren eftertanke.

Latenssiffrorna rör sig på samma sätt. Uppmätt vid xhigh är tiden till första token 26.12 sekunder för 1.2 jämfört med 2.90 sekunder för 1.1, och utmatningshastigheten sjunker från 213.5 till 165.0 token per sekund. Meta köpte tre indexpunkter med tanketid, och den obligatoriska resonemangsdesignen innebär att du inte kan avböja köpet — bara välja hur mycket av det du gör.

Den där 26-sekunderssiffran kommer att citeras fel, så här är korrigeringen i förväg: det är en mätning vid den dyraste ansträngningsnivån som modellen exponerar, och API:et har medium som standard. Som referenspunkt från verklig trafik snarare än en benchmark-rigg, visar Muse Spark 1.1 levererad via OrcaRouter — vid vilken ansträngningsnivå anroparna faktiskt begär — en 7-dagars p50-tid till första token på 1,84 sekunder och en p95 på 6,00 sekunder, med 519 tokens per sekund och en felfrekvens på noll. Benchmark-latens vid maximal ansträngning och produktionslatens vid standardansträngning är olika storheter, och de skiljer sig vanligtvis med en storleksordning. Läs 26,12 s som taket för djup resonering, inte som vad en förfrågan kommer att kännas som.

Var du kan ringa det idag

Muse Spark 1.2 serveras av Metas egen Model API och, i skrivande stund, ingen annanstans — den dirigerades inte via OpenRouter vid lanseringen, det finns inget Hugging Face-repositorium, och den finns inte i OrcaRouter-katalogen. Muse Spark 1.1 kostar $1,25 och $4,25 — samma siffror som Meta tar ut, eftersom OrcaRouter tar 0% påslag och skickar vidare leverantörens listpris rakt av.

Det spelar större roll för jämförelsen än för själva modellen. Om du bygger en kostnadsmodell för den här releasen, de modeller du skulle benchmarka den mot — Claude Opus 5, Claude Fable 5, GPT-5.6 Sol, Grok 4.5, DeepSeek V4 Flash — sitter bakom en enda nyckel till listpris, så siffran i ditt kalkylblad är siffran på fakturan, och en prissänkning från leverantören landar samma dag snarare än efter en förnyelse. För Muse Spark 1.2 specifikt är svaret idag Metas endpoint, ett andra kontrakt och en separat faktura.

Vad tillkännagivandet inte besvarade

Inget oberoende kodningsnummer. Artificial Analysis publicerar ett sammansatt index för 1.2 men ännu inte de kodnings- och agentiska delindex som det publicerade för 1.1 (71,3 respektive 37,5). Eftersom agentiskt arbete var 1.1:s svagaste dimension med bred marginal, och agentisk kodning är precis vad 1.2 påstår sig ha åtgärdat, är detta siffran som skulle avgöra lanseringen.

Ingen reproduktion av harness-resultaten. Varje kodningssiffra i tillkännagivandet är Meta-körd. Ingen har ännu publicerat Muse Spark 1.2-poäng från ett neutralt ramverk.

Ingen multimodal verifiering.Muse Spark-listningen annonserar text-, bild-, video-, ljud- och PDF-inmatning. Den oberoende utvärderingen täcker text och bild. Metas 1.2-budskap har nästan helt övergått till mjukvaruarbete, och mixed-media-användningsfallet 1.1 såldes uttryckligen och har för närvarande varken marknadsföring eller mätning bakom sig.

Ingen genomströmningshistorik. Volymen på slutpunkten är fortfarande för låg för att den vanliga rullande latensstatistiken ska fyllas i.

Vad du ska titta på under de kommande fyra veckorna

Tre saker kommer att avgöra om denna release är vad Meta säger att den är. Den första är ett oberoende agentpoäng för 1.2 — om delindexet som låg på 37.5 för 1.1 har rört sig väsentligt, är kodningsargumentet verkligt. Den andra är om någon återskapar Terminal-Bench-resultatet utanför Muse Code; en modell som bara presterar i sin egen testmiljö är en produkt, inte en förmåga. Den tredje är vad som händer med bidragsnivån: om taket på 60 förfrågningar lossnar, ändrar en modell nära frontlinjen, med $0.10 in och $0.20 ut, budgetnivåns aritmetik på ett sätt som en trepoängs indexökning aldrig skulle göra.

Och om takten håller i sig, kommer Muse Spark 1.3 i början av september. Av detta att döma är siffran att hålla koll på när den landar inte indexpoängen. Det är huruvida Meta kan lägga till kapacitet utan att lägga till ytterligare tjugo sekunders tänkande framför varje begäran.

Jämförda i den här artikeln3

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

Kontakta oss

Gå med i vår community

DiscordEmailXGitHubYouTube