Meta Muse Spark 1.1 Recension
Guides & Insights

Meta Muse Spark 1.1 Recension: Fortfarande den snabba, inte längre den billiga

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

I fyra veckor var argumentet för Meta Muse Spark 1.1 ren aritmetik. $1.25 per miljon tokens in, $4.25 ut, för en nativt multimodal modell som hanterade verktyg bättre än nästan allt i sin prisklass. Sedan, den 5 augusti 2026, lanserade Meta Muse Spark 1.2 tillsammans med Muse Code – sin första terminalbaserade kodningsagent – och lade till något som den nya modellen fick men 1.1 aldrig: en bidragsnivå på $0.10 in och $0.20 ut. Tolv gånger billigare på input, tjugoett gånger billigare på output, i utbyte mot att låta Meta träna på dina prompts. Muse Spark 1.1:s pris rörde sig inte en cent. Dess position gjorde det.

Det är den ärliga ramen för att granska den här modellen nu. Muse Spark 1.1 har inte fasats ut, har inte fått ny prissättning och är fortfarande den snabbare och bättre dokumenterade av Metas två resonemangsmodeller – men den är inte längre det billigaste sättet att hyra en Meta-modell, och agenten som Meta satsar hårdast på körs inte på den. Den här granskningen täcker vad 1.1 är, vad den mätbart är bra på, vad augustilanseringen ändrade och den snävare uppsättning uppgifter där den fortfarande är rätt val. Där en siffra kommer från Metas egna utvärderingar står det i meningen; där den kommer från Artificial Analysis eller från produktionstrafik står det också.

Snabb bedömning

• Vad det är — en nativt multimodal resonemangsmodell (text, bild, video, PDF och ljud in, text ut) med konfigurerbar resonemangsnivå, byggd för att köra verktyg och styra en dator. Stängda vikter, levererad av Meta.

• Pris — $1,25 inmatning / $4,25 utmatning per miljon tokens, $0,15 vid cacheträff. Oförändrat sedan lanseringen, och fortfarande ungefär en fjärdedel av GPT-5.6 Sol:s utmatningspris ($5/$30) och en sjättedel av Claude Opus 4.8:s ($5/$25).

• Intelligens — 51 på Artificial Analysis Intelligence Index, rank #22 av 185 i sin klass mot en klassmedian på 32. En oberoende mätning, inte ett Meta-påstående.

• Styrka — verktygsanvändning och agentiskt resonerande, plus genuin hastighet: 213,5 utdatatokens per sekund, vilket Artificial Analysis rankar som #2 av 185.

• Svaghet — ren resonemangsförmåga och rå kodning är medelmåttiga, återkallande av långa kontexter är inte i framkant, och den är mångordig: 94M utdatatokens för att slutföra Intelligence Index mot en median på 65M.

• Det nya förbehållet — Muse Spark 1.2 får nu tre poäng högre och, på sin bidragsnivå, kostar en tjugondel så mycket. 1.1:s återstående fördel är latens, och den är en stor sådan.

Vad Meta släppte den 5 augusti — och vad det gjorde med 1.1

Muse Code är en terminalbaserad kodagent, för närvarande i beta, som installeras från ett enradigt skalskript på macOS och Linux (ingen Windows-version) och körs som muse-binären. Den tar sig an kompletta mjukvaruutvecklingsuppgifter i stora kodbaser: planera ändringen, skriva koden, validera resultatet. Metas säljargument är arkitektonisk sammanhållning — agenten och modellen tränades tillsammans snarare än att de bultades ihop — och funktionslistan är riktad rakt mot Claude Code och Codex: bakgrundsagenter som fortsätter arbeta när du stänger terminalen, återupptagning via händelselogg, parallella arbetsträd för underagenter och en OS-sandlåda med godkännanden aktiverade som standard. Demon som Meta publicerade för det är en GPU-kerneloptimeringsloop som kör fler än 1 000 verktygsanrop under upp till 24 timmar på NVIDIA Hopper-hårdvara.

Muse Code kör Muse Spark 1.2, inte 1.1. Det är den första praktiska konsekvensen för alla som läser den här recensionen: om du vill ha Metas agent är du på den nya checkpointen.

Den andra konsekvensen är prissättningen, och den är den mer intressanta. Meta släppte 1.2 med två distinkta modell-ID:n snarare än ett:

• Standard (muse-spark-1.2) — 1,25 USD för input, 0,15 USD för cachad input, 4,25 USD för output per miljon tokens. Identisk med Muse Spark 1.1. Meta förbinder sig att prompts och completions på denna nivå inte används för att förbättra sina produkter.

• Contributor (muse-spark-1.2-contributor) — $0,10 för indata, $0,002 för cachad indata, $0,20 för utdata. I utbyte ger du Meta tillåtelse att träna framtida modeller på dina uppmaningar och svar.

• Muse Spark 1.1 — det finns ingen bidragsgivarnivå. Den ligger kvar på standardpris, och Meta har inte meddelat någon utfasning.

Metas egen beskrivning av bidragsnivån är att den är "mer än 10 gånger billigare än till och med betala-per-användning-nivån", vilket är en underdrift: de verkliga multiplarna är 12,5× på indata och 21,25× på utdata, med cachad indata till ett nästan gratis pris på $0,002. Det är "lågt pris"-rubriken som lanseringen genererade, och den tillhör enbart 1.2.

Meta Muse Spark 1.1 Review

Prishistorien, omskriven

Innan du planerar din budget utifrån 0,20 dollar per output-token, läs resten av contributor-nivåns villkor, eftersom det är just de som gör den billig. Rate limiterna sjunker från dokumenterade 3 000 förfrågningar per minut på standardnivån till 60 på contributor-nivån — en gräns som tillåter en utvecklare att experimentera på en bärbar dator men förbjuder en produktionsflotta av agenter. Och dataaffären är ingen formalitet: dina prompts och din modells svar blir träningsmaterial. För den som hanterar kunddata, proprietär källkod eller något som omfattas av sekretess är contributor-nivån inte en billigare version av samma produkt; det är en annan produkt. Meta bekräftade just detta vid samma lansering genom att lägga till ett alternativ med noll datalagring för företagskunder på den betalda nivån.

Så den ärliga jämförelsen är inte "1.1 at $4.25 versus 1.2 at $0.20." Det är: vid standardprissättning kostar de två modellerna exakt lika mycket, och 1.2 är den med högre poäng. Nivån på $0.20 är ett verkligt och aggressivt erbjudande, men den riktar sig till individer och experiment, och den är endast tillgänglig på den nyare modellen.

Det som faktiskt driver kostnaden på båda modellerna är cachning, inte listpriset. Ta ett representativt agentsteg: 60 000 tokens med databas- eller dokumentkontext in, 3 000 tokens med plan-och-svar ut. Vid kall cache blir det 0,075 dollar för inmatning plus 0,013 dollar för utdata – ungefär 8,8 cent, eller 88 dollar över tusen steg. Håll kontextprefixet stabilt så att det träffar cachen till 0,15 dollar per miljon och inmatningen sjunker till 0,009 dollar, vilket ger steget ungefär 2,2 cent och körningen över tusen steg 22 dollar. En skillnad på 75 procent, som helt styrs av om ditt agentramverk återanvänder ett stabilt prefix eller bygger om prompten varje varv. Om du vidtar en enda teknisk åtgärd efter att ha läst den här recensionen, låt det vara stabilitet i cache-nyckeln snarare än modellval.

En strukturell notering om var du hyr den. Muse Spark 1.1 finns i OrcaRouter-katalogen för $1.25 och $4.25 med en cacheavläsning på $0.15 – samma siffror som Meta tar ut, eftersom OrcaRouter kör 0% påslag och skickar vidare leverantörens listpris direkt, så en prisändring från leverantören hamnar här samma dag som den hamnar där. Muse Spark 1.2 finns ännu inte i katalogen och levereras direkt av Meta. Det har betydelse för den jämförelse du förmodligen är på väg att köra: GPT-5.6 Sol, Claude Opus 4.8, Grok 4.5 och Gemini 3.1 Pro ligger alla bakom en enda nyckel till listpris, så du kan benchmarka dem mot Muse Spark 1.1 på en enda utvärderingsuppsättning utan ett andra avtal, och siffran i ditt kalkylblad är siffran på fakturan.

Vad Muse Spark 1.1 egentligen är

Muse Spark är flaggskeppsmodellen för resonemang från Meta Superintelligence Labs, gruppen som Mark Zuckerberg startade under Alexandr Wang. Det markerar en strategisk vändning: där Metas Llama-modeller hade öppna vikter är Muse-familjen — Spark, plus bild- och videogeneratorerna — stängd och levereras som en produkt och ett API. Spark 1.0 lanserades den 8 april 2026; 1.1 följde den 9 juli i samband med den offentliga förhandsversionen av Meta Model API. Den praktiska förändringen för utvecklare är att Meta nu är en förstaparts-API-leverantör som konkurrerar direkt med de två etablerade API-leverantörerna, inte bara en utgivare av modellvikter — och lanseringen av en kodningsagent den 5 augusti är den tydligaste bekräftelsen på det hittills.

Version 1.1 var ett betydande steg framåt snarare än en punktversion. På Artificial Analysis ökade den med åtta poäng på Intelligence Index på tre månader, från 43 till 51. Dess kodningsindex steg med 12 poäng till 71, SciCode förbättrades till 58 % och Humanity's Last Exam steg till 45 %. Meta sade att de största förbättringarna skedde inom verktygsanvändning, datoranvändning, kodning och multimodal förståelse – i linje med en modell som är anpassad för att agera snarare än att bara svara.

När det gäller kontexten har den tidigare förvirringen klarnat: Artificial Analysis och OrcaRouter listar båda fönstret på 1 048 576 token, och Meta beskriver ett fönster som modellen aktivt komprimerar. Att hålla en miljon token är dock inte detsamma som att hämta från dem, och 1.1:s poäng på cirka 54,1 för långkontextshämtning säger att återkallelsen är ordinär. Behandla fönstret som en kapacitet, inte en garanti.

Resoneringsansträngning: Omedelbar, Begrundande, och vredet nedanför.

På Metas konsumentyta exponerar Muse Spark två namngivna lägen: Instant answers som svarar omedelbart utan förlängt resonemang, som en vanlig chattrunda; Contemplating som kör flera agenter parallellt med hjälp av en "thought compression"-teknik lånad från förstärkningsinlärning, och Meta positionerar det mot DeepMind Deep Think och GPT-5.4 Pro för krävande vetenskapligt och analytiskt arbete. Genom API:t framträder samma förmåga som en konfigurerbar resonemangsinsatsparameter – Artificial Analysis publicerar sina poäng vid modellens xhigh-inställning, den dyraste som exponeras.

Behandla den ratten som ett kostnadsreglage, inte ett kvalitetsreglage. Parallellt agentresonemang förbrukar långt fler token än en enda genomkörning, och de benchmarksiffror du läste togs fram med maximal ansträngning. Välj som standard den lägre änden för rutinanrop och reservera den höga insatsen för de fall där ett felaktigt första svar är kostsamt.

Hur den får betyg: stark med verktyg, medel utan.

Det tydligaste sättet att läsa Muse Spark 1.1 är med verktyg kontra utan verktyg. Med verktyg leder den agenttesterna: MCP Atlas 88.1 mot Claude Opus 4.8:s 82.2, JobBench 54.7 mot 48.4, Legal Agent Bench 20.0 mot Grok 4.5:s 12.9, och Humanity's Last Exam med verktyg 62.1 mot 57.9. Utan verktyg är den ordinär – vanliga Humanity's Last Exam landar runt 45, långt efter Gemini 3.1 Pro:s cirka 77 på samma test.

När det gäller exekveringsprecision ligger det också efter ledarna: OSWorld-Verified datoranvändning 80,8 mot Opus 4.8:s 83,4, SWE-Bench Pro kodning 61,5 mot 69,2, DeepSWE 1.1 långsiktig kodning 53,3 mot GPT-5.5:s 67,0 och BabyVision visuellt resonemang 76,3 mot 83,6. Många av dessa siffror är leverantörsrapporterade, flera från Metas egna utvärderingar, och de körs på olika testmiljöer — se dem som vägledande och testa på nytt på dina egna uppgifter.

Meta Muse Spark 1.1 Review

Den oberoende bilden från Artificial Analysis är mer kompakt och mer användbar. Intelligence Index 51, rank #22 av 185, mot en klassmedian på 32. Hastighet 213,5 utdatatokens per sekund, rank #2 av 185 — detta är en genuint snabb modell. Prisrank #31, pris vid cache-träff 0,15 $ för 88 % rabatt. Verbositet 94M utdatatokens för att ta sig igenom indexet mot en median på 65M, vilket är där en stor del av den faktiska notan kommer ifrån. Total kostnad för att utvärdera den på hela sviten: 548,07 $.

En varning värd att bära med sig: Meta marknadsför text-, bild-, video-, ljud- och PDF-inmatning, men Artificial Analysis tekniska specifikationskort för 1.1 registrerar endast text och bild som utvärderade. Båda kan vara sanna – API:et accepterar mer än vad benchmark-verktyget testade – men ingen utanför Meta har publicerat resultat på ett video- eller ljudarbetsflöde. Om analys av blandade medier är anledningen till att du är här, avsätt tid för att verifiera det själv.

Bör du gå över till 1.2? Latenssvaret

På kodningssidan säger Meta ja, och siffrorna är internt konsekventa: Terminal-Bench 2.1 stiger från 76,2 % till 82,9 %, DeepSWE v1.1 från 53,0 % till 59,3 % och det interna kodningsriktmärket från 68,3 % till 70,6 %. Dessa är Meta-genomförda utvärderingar, med pass@1 beräknat över fem försök i Metas egen testmiljö — standardförbehållet gäller, det vill säga att konkurrerande modeller i en leverantörs testmiljö ofta är underoptimerade. I en oberoende utvärdering har Artificial Analysis flyttat Muse Spark 1.2 till 54 på Intelligence Index, rank #13 av 185, tre poäng över 1.1.

Det Meta köpte de poängen med är eftertänksamhet, och det syns i varje tidsmätning. Artificial Analysis mäter tiden till första token till 26.12 sekunder för 1.2 mot 2.90 sekunder för 1.1 — båda vid respektive modells högsta resonemangsinsats. Utskriftshastigheten sjönk från 213.5 till 165 tokens per sekund. Verbositeten ökade något, 95M mot 94M tokens, och kostnaden för att köra den identiska benchmarksviten steg från $548.07 till $637.85 med identisk prissättning per token. Den sista siffran är den tydligaste beskrivningen av avvägningen: samma prislista, 16% fler förbrukade tokens, tre indexpoäng mer.

Läs 26-sekunderssiffran noggrant, för den är lätt att misstolka. Det är en benchmarkmätning vid maximal ansträngning, och API:et har som standard en mellaninställning. Som referenspunkt för verklig trafik visar Muse Spark 1.1 på OrcaRouter – som hanterar vilken ansträngningsnivå anroparna faktiskt begär – en p50-tid till första token på 1,84 sekunder och en p95 på 6,00 sekunder under en vecka med produktionstrafik, med en felfrekvens på noll. Benchmarklatens vid maximal ansträngning och produktionslatens vid standardansträngning är olika storheter, och gapet mellan dem är vanligtvis mer än en storleksordning.

Så avgörs beslutet tydligt av arbetslastens form. Om du kör långsiktiga kodningsagenter som håller ett repository i kontexten och arbetar i minuter åt gången, är 1.2 den bättre modellen och latensnackdelen fördelas över en uppgift som ändå aldrig skulle kännas omedelbar. Om du betjänar något interaktivt — en chatt-yta, en verktygsanropsloop med en väntande människa, ett latens-SLO mätt i sekunder — förblir Muse Spark 1.1 den bättre anpassade modellen i familjen, och dess hastighetsrankning är inget avrundningsfel. Inget med augustilanseringen ändrar på det.

Utvecklarupplevelse och begränsningar

Meta Model API förblir en publik förhandsversion, även om lanseringen i augusti utökade den globala åtkomsten och lade till företagsalternativet med noll datalagring. Meta levererar ett OpenAI-liknande gränssnitt och SDK-åtkomst, och Spark är live för konsumenter i Meta AI:s "Thinking"-läge. Hastighetsbegränsningar publiceras nu istället för att man gissar sig till dem — 3 000 förfrågningar per minut dokumenterade för standardnivån — men förhandsstatus är fortfarande förhandsstatus, så ha en reservväg för de dagar kapaciteten är begränsad. Automatisk växling mellan leverantörer är precis den typ av infrastruktur som en slutpunkt av förhandsversionsklass motiverar, och det är anledningen till att dirigera en förhandsmodell genom en gateway inte kostar dig något och ger dig en andra väg.

Meta Muse Spark 1.1 Review

Genom OrcaRouter är modell-ID:t meta/muse-spark-1.1 och både /v1/chat/completions och /v1/responses är tillgängliga, så en befintlig OpenAI-kompatibel klient behöver bara en bas-URL och en modellsträng och inget annat:

import openai as openai_client

client = openai_client.Client(base_url="https://api.orcarouter.ai/v1", api_key="YOUR_API_KEY")

= client.chat.completions.create(model="meta/muse-spark-1.1", messages=[{"role": "user", "content": "Planera och kör verktygen för att åtgärda detta problem."}])

print(response.choices[0].message.content)

Där det passar — och där det inte passar

Bra för: verktygskörning och automation av datoranvändning där svarstiden är synlig för en person; kostnadskänsligt resonemang i stor skala på data som du inte kan lämna till en träningsuppsättning; arbetsflöden som blandar text med bilder, video, PDF-filer eller ljud, med din egen verifiering på mediasidan; och team som vill ha ett snabbt, billigt standardalternativ med en premiummodell i reserv för de svåraste stegen.

Svag passform: {{1}}topplistans kodningsprecision och den svåraste greenfield-utvecklingen, som fortfarande tillhör Claude Opus 4.8 och GPT-5.6 Sol{{/1}}; {{2}}rena resonemangsproblem utan verktyg{{/2}}; {{3}}visuella precisionsuppgifter där Gemini 3.1 Pro leder{{/3}}; {{4}}långsiktigt repository-arbete, som nu uttryckligen är 1.2:s och Muse Codes jobb{{/4}}; och {{5}}allt där du behöver Metas billigaste möjliga token, eftersom den nivån inte finns på den här modellen{{/5}}.

Vanliga frågor

Är Muse Spark 1.1 fortfarande tillgänglig nu när 1.2 har släppts?

Ja. Meta meddelade ingen nedläggning och ingen prishöjning vid lanseringen den 5 augusti – 1.1 finns kvar på Meta Model API till $1,25 och $4,25 per miljon tokens, och den finns i OrcaRouter-katalogen till samma priser. Bevakningen av lanseringen beskriver genomgående att den fortsätter till befintliga API-priser. Det sagt, Metas tekniska fokus har tydligt flyttats: kodningsagenten, de nya riktmärkena och den billiga prisnivån hör alla till 1.2.

Kan jag få Muse Spark 1.1 på $0.10-bidragsnivån?

Nej. Contributor-nivån är ett separat modell-ID på den nyare kontrollpunkten, muse-spark-1.2-contributor. Det finns ingen 1.1-motsvarighet, så de billigaste Meta-resonemangstokens kräver att man byter version — och accepterar en gräns på 60 förfrågningar per minut samt tillstånd för Meta att träna på dina uppmaningar och fullföljningar.

Ska jag uppgradera till Muse Spark 1.2?

Om din arbetsbelastning är långvarig kodning eller agentarbete i repository-skala: ja, den får högre poäng på både Metas egna kodutvärderingar och Artificial Analysis oberoende index, till samma standardpris. Om din arbetsbelastning är interaktiv eller latenskänslig: nej, 1.2 ger ungefär nio gånger så lång tid till första token och 23 % av utmatningshastigheten i utbyte mot tre indexpoäng, och dess resonemang kan inte stängas av. Båda ligger på samma API, så bytet är i vilket fall som helst en modellsträng — vilket är det billigaste möjliga A/B-testet och värt att köra på din egen trafik innan du bestämmer dig.

Är Muse Spark 1.1 öppen källkod?

Nej, och det är just poängen med linjen. Till skillnad från Metas Llama-modeller har Muse-familjen stängda vikter och levereras som en produkt och ett API. Det finns inga vikter på Hugging Face, ingen väg till självhosting och inga tredjepartsleverantörer — Meta är den enda parten som serverar den här modellen, vilket gör ett routningslager med failover till det praktiska svaret på risken med en enda leverantör snarare än en andra leverantör.

Domen, en version senare

Muse Spark 1.1 är en snabb, billig, genuint multimodal agentmodell som är stark på verktygsanvändning och ärligt talat medelmåttig på ren kodning och resonemang. Ingenting uppmätt hos den blev sämre i augusti. Det som ändrades är formen på familjen runt omkring den: Meta har nu en modell med bättre poäng till samma standardpris, en dramatiskt billigare prisklass för utvecklare som är villiga att byta bort sina data, och en agentprodukt som varken kör på 1.1 eller på något du kan rikta mot 1.1.

Vad som återstår är en snävare men verklig rekommendation. Om du behöver Metas resonemangskvalitet i en mänskligt märkbar hastighet — en sekund till första token i produktion, 213 tokens per sekund därefter — är 1.1 fortfarande den version man ska välja, och de tre indexpunkter som 1.2 tillför är inte värda en niofaldig väntan. Om du inte behöver den hastigheten finns det inte längre särskilt mycket anledning att stanna kvar. Hur som helst är det en enda modellsträng, så det ärliga rådet är att köra båda på ditt eget utvärderingsset i en dag och låta din latensbudget bestämma.

Jämförda i den här artikeln3

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen