
Muse Spark 1.2 mot Muse Spark 1.1: Bör du uppgradera?
- metaNYMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenNYQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekNYDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- qwenNYQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens · 2038 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligens77Kodning
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligens77Kodning
- grokxAI: Grok 4.52026-07-0856Intelligens72Kodning
- tencentTencent: Hy32026-07-0642Intelligens59Kodning
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligens42Kodning
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligens39Kodning
- anthropicAnthropic: Claude Sonnet 52026-06-3055Intelligens72Kodning
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligens52Kodning57Matematik
- z-aiZ.ai: GLM 5.22026-06-1653Intelligens69Kodning60Matematik
Meta ersatte Muse Spark 1.1 med Muse Spark 1.2 den 5 augusti 2026 utan att ändra priset, kontextfönstret, modalitetslistan, de parametrar som stöds eller resonemangsratten. Migrationen ser därför gratis ut – samma modellsträngfamilj, samma fakturering, inget att omförhandla. Den är inte gratis. Oberoende mätningar placerar den nya versionens tid till första token på 26,12 sekunder mot den gamla versionens 2,90, och dess uthålliga utdata på 165 tokens per sekund mot 213,5. Du köper tre poäng av uppmätt intelligens med ungefär nio gånger så lång väntan innan något kommer tillbaka.
Huruvida det är värt att göra beror nästan helt på hur länge dina uppgifter kör. Här är vad som faktiskt skiljer sig, vad som förblev identiskt, och vad ingen kan berätta för dig ännu.
Beslutet på fyra rader
• Intelligensindex: 51 → 54, oberoende mätt av Artificial Analysis vid varje versions xhigh-inställning.
• Tid till första token: 2,90s → 26,12s, samma källa, samma villkor.
• Kostnad för att köra den identiska benchmarksviten: $548.07 → $637.85, med identisk prissättning per token. De extra 16 % är ren tokenförbrukning.
• Allt ett upphandlingsformulär frågar om: oförändrat.

Vad är genuint identiskt
Detta är värt att räkna upp, eftersom det är anledningen till att en migrering ser trivial ut på pappret, och eftersom en skillnad som inte existerar är en som du inte behöver testa för.
• Pris — 1,25 dollar per miljon inmatningstokens, 4,25 dollar per miljon utdatatokens, 0,15 dollar per miljon vid cacheträff, 2,50 dollar per tusen inbyggda webbsökningar. Alla dessa siffror är desamma i båda versionerna.
• Kontext — 1,048,576 token på båda, utan någon tilläggsavgiftsnivå för lång kontext på någon av dem.
• Modaliteter — text, bilder, video, ljud och PDF in; text ut. Båda listningarna annonserar samma fem inmatningstyper.
• Resoneringsreglage — obligatoriskt på båda, fem nivåer (minimal, låg, medel, hög, extrahög), standard medel på båda. Det finns ingen inställning på någon av versionerna som stänger av tänkandet.
• Parametrar — tools, tool_choice, structured_outputs, response_format, reasoning_effort, include_reasoning, max_tokens, temperature, top_p, top_k, repetition_penalty. Identiska listor.
• Servering — en leverantör, Meta självt, på båda. Inga tredjepartsvärdar, inga kvantiseringsvarianter.
• Blandat pris — Artificial Analysis anger båda till 0,78 USD per miljon tokens med sin blandade viktning, vilket är vad du kan förvänta dig av identiska prislistor.
Om du hade hoppats att uppgraderingen skulle komma med mer kontext, en garanti för fullföljningslängd eller en billigare cache, så gjorde den inte det. Detta är en vikt- och efterträningsrelease med en prislista som kopierats rakt av från den föregående.
Vad som faktiskt rörde sig
Artificial Analysis är för närvarande den enda oberoende parten som har utvärderat båda versionerna, och den utvärderade båda med högsta resonemangsinsats, så jämförelsen är likvärdig.
• Intelligensindex — 51 för 1.1 (rank #22 av 185) till 54 för 1.2 (rank #13). Nio platser på en lista där klassens median är 32, så förbättringen ger reell position, inte bara en decimal.
• Tid till första token — 2.90s till 26.12s. Detta är den främsta regressionen och den är inte marginell.
• Utmatningshastighet — 213,5 till 165,0 tokens per sekund. Fortfarande rankad #16 av 185 och fortfarande beskriven av Artificial Analysis som "anmärkningsvärt snabb", men 23 % långsammare än modellen den ersätter.
• Ordrikedom — 94M utdatatokens för att ta sig igenom indexet, jämfört med 95M. I praktiken oförändrat, och båda cirka 45% över medianen på 65M.
• Total utvärderingskostnad — $548.07 till $637.85. Eftersom verbositeten knappt förändrades och priserna inte förändrades alls, kommer den 16-procentiga ökningen från något annat än den synliga utdatan: längre interna resonemangsspår, fler försök eller fler verktygsvändningar per uppgift.
Mönstret är sammanhängande. Meta gjorde inte modellen billigare, snabbare eller större. De fick modellen att överväga längre innan den förband sig, och den extra eftertanken visar sig som latens, som något långsammare strömning och som en räkning som är 16 % högre för identiskt arbete. Tre indexpoäng är vad det köpte.
Hur illa latensen verkligen är
Siffran 26,12 sekunder kommer att citeras utan sitt sammanhang, så behandla den rätt: den mäts vid xhigh, den dyraste av fem ansträngningsnivåer, på en benchmarksvit som är utformad för att vara svår. API:et har som standard medium.
För en uppfattning om hur standardinställningen faktiskt känns, visar Muse Spark 1.1 på OrcaRouter — som betjänar riktiga anropare på vilken ansträngningsnivå de än begär — en p50-tid till första token på 1,84 sekunder och en p95 på 6,00 sekunder under en rullande vecka. Det är produktionsdata på produktionsmässiga ansträngningsnivåer, och det är mer än en storleksordning under benchmarksiffran. Version 1.2 har ännu ingen produktionstelemetri.

Så den ärliga läsningen är inte "1.2 tar 26 sekunder att svara." Det är: på den inställning där 1.2 tjänar sina tre extra poäng, kostar den första token dig 26 sekunder, och på samma inställning kostade den gamla modellen dig tre. Om du redan körde på xhigh — vilket är exakt den konfiguration där intelligensvinsten finns — är det den siffra du ärver. Om du kör på medium eller lägre, kommer du att se något mycket kortare, och du kommer också att se mindre av förbättringen.
Den kopplingen är den verkliga fällan i denna uppgradering. Du kan inte ta intelligensen utan övervägandet, eftersom övervägandet är där intelligensen kommer ifrån.
Ompositioneringen bakom siffrorna
Meta publicerade inget lanseringsinlägg för 1.2 – Muse Sparks tillkännagesida beskriver fortfarande 1.1 – men de skrev om produktbeskrivningen, och omskrivningen förklarar avvägningen.
Muse Spark 1.1 såldes som en multimodal resonemangsmodell med en ovanligt bred indatayta, avsedd för "multimodala agenter, djup forskning över blandade medier och långkontextanalys": långa rapporter, mediebibliotek, inspelningar och video tillsammans med text.
Muse Spark 1.2:s beskrivning släpper nästan allt det och nämner istället mjukvaruutveckling — omfaktorisering av flera filer, längre felsökningssessioner, generering av hela repositoryt — och lägger sedan till ett explicit påstående om flera agenter: modellen kan agera som huvudagent som samlar in sammanhang, planerar och delegerar, eller som en underagent som exekverar parallellt under en sådan. Den hävdar också att promptcache kan minska den effektiva kostnaden med 60–80 % beroende på hur mycket sammanhang som upprepas mellan anrop. Den sista siffran är Metas uppskattning snarare än ett uppmätt resultat, även om cachepriset på 0,15 dollar gör den aritmetiskt trovärdig.
Läs latensregressionen mot den ompositioneringen – då ser det inte längre ut som ett misstag. Ingen som refaktoriserar ett dussin filer bryr sig om 26 sekunders planering. Meta valde en kund, och det är inte den som 1.1 såldes till.
Vad 1.1 fortfarande har som 1.2 inte har
Fyra veckors existens är inte tillräckligt för att bygga upp en meritlista, och på tre konkreta sätt är den äldre modellen för närvarande den bättre dokumenterade produkten.
• Ett arenarekord. Muse Spark 1.1 har en omfattande Design Arena-historik: 1334 Elo på rank 5 inom spelutveckling, 1334 på rank 7 inom UI-komponenter, 1320 på rank 3 inom ASCII-konst, 1318 inom datavisualisering, 1309 inom allmänna kodkategorier, plus en fullständig agents-arena-stege som täcker webbappar, HTML-slides och Godot-spelutveckling. Muse Spark 1.2 har inga registreringar alls. På den axel som Meta nu marknadsför hårdast finns det noll data från direkta jämförelser för den nya modellen.
• Delindexpoäng. Artificial Analysis publicerar ett kodningsindex på 71.3 och ett agentiskt index på 37.5 för 1.1. Det finns ingen publicerad motsvarighet för 1.2. Eftersom det agentiska resultatet var 1.1:s svagaste dimension med bred marginal, och agentisk förmåga är precis vad 1.2 påstår sig förbättra, är detta siffran som skulle avgöra uppgraderingsfrågan — och den existerar ännu inte.
• Produktionstelemetri. 1.1 har en veckas riktig p50- och p95-latens bakom sig och 4,4M tokens av live-trafik på OrcaRouter. 1.2 har inget av detta; dess endpoint rapporterar för närvarande ingen latens- eller genomströmningsstatistik alls eftersom volymen är för låg för att sampla.
• Någonstans att hyra den förutom Meta. Muse Spark 1.1 finns i OrcaRouter-katalogen för 1,25 $ och 4,25 $ — Metas eget listpris, vidarebefordrat med 0 % påslag. Muse Spark 1.2 finns inte där ännu, så idag är det en direkt Meta-integration med en enda leverantör och ingen reservväg.

Inget av detta betyder att 1.2 är sämre. Det betyder att bevisen för 1.2 består av ett sammansatt betyg från en utvärderare, medan bevisen för 1.1 är en månad av arenor, delindex och live-trafik. Denna asymmetri bör påverka hur du fasar migreringen, inte om du genomför den.
En migreringschecklista som faktiskt är kort
Eftersom prislistan och parameterytan är identiska, är bytet en modellsträngsändring. Arbetet ligger i att verifiera de tre saker som faktiskt flyttades.
• Mät din egen tid till första token med din egen ansträngningsnivå. Acceptera varken siffran 2.90s eller 26.12s. Kör dina riktiga prompts med vilken reasoning_effort du faktiskt skickar och jämför direkt. Det här är den enda siffran som kan döda migrationen helt.
• Kontrollera din timeout- och streamingkonfiguration. En 9x ökning av första-token-latensen vid hög ansträngning kommer att överskrida klienttimeouts som var avstämda mot 1.1, och kommer att få alla icke-streamingintegrationer att se ut som en hängning.
• Räkna om kostnaden från uppmätta tokenantal, inte från prislistan. Priserna är identiska, så eventuella kostnadsförändringar är beteendemässiga. Artificial Analysis såg 16 % mer utgifter för samma arbete; huruvida du ser det beror på din uppgiftsmix.
• Verifiera cache-nyckelstabiliteten först. Med ett stabilt prefix på 60 000 token sjunker ett typiskt agentsteg från cirka 8,8 cent till cirka 2,2 cent på båda versionerna. Den svängningen på 75 % är större än vad versionsändringen gör, och den är helt under din kontroll.
• Återtesta ljud- och videovägarna uttryckligen.Båda listningarna annonserar samma fem inmatningsmodaliteter, men Artificial Analysis specifikationskort för 1.2 registrerar endast text och bild som utvärderade. Meta skrev om pitchen bort från mixed-media-arbete. Ingen oberoende part har kontrollerat om förmågan höll.
• Håll 1.1 tillgänglig som en fallback. Att köra båda bakom en nyckel innebär att återställningen är en konfigurationsändring snarare än en incident, och det låter dig A/B-testa de två mot live-trafik istället för att argumentera om ett benchmark.
Vem rör sig nu, vem väntar
Byt nu om du kör långsiktiga kodningsagenter med hög resonemangsinsats. Uppgifterna tar redan minuter, latensstraffet försvinner i det, intelligensvinsten mäts av en tredje part snarare än hävdas av Meta, och tre indexpunkter är ett meningsfullt hopp på den här nivån — nio placeringar på en lista med 185 modeller.
Väntaom något du serverar är interaktivt. Det finns ingen konfiguration där 1.2 är mer responsiv än 1.1, och obligatoriskt resonerande innebär att du inte kan köpa tillbaka responsivitet genom att stänga av tänkande. Version 1.1 förblir den snabbare modellen på varje ansträngningsnivå och kostar exakt lika mycket.
Vänta om din arbetsbelastning är analys av blandade medier — användningsfallet med långa rapporter, video och ljud som 1.1 uttryckligen byggdes och marknadsfördes för. Meta slutade annonsera det, och den enda oberoende utvärderingen av 1.2 täcker text och bilder. Förmågan kan mycket väl vara intakt; det finns helt enkelt inga belägg åt endera hållet, och 1.1 har en månad av det.
Vänta om du behöver arenadata. En modell som marknadsförs med generering av hela repositorier, utan Design Arena-poster och utan publicerat agentiskt delindex, ber dig att ta Meta på orden för det de ändrade. Ge det tre eller fyra veckor, så kommer det inte längre att vara sant — och då blir detta beslut mycket lättare att fatta baserat på bevis snarare än på en enda sammansatt siffra.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
