Genererat hero-kort med titeln Claude Sonnet 5.5 vs Muse Glimmer, med underrubriken en 30B-laptopmodell mot den nya Sonnet, med tre statistik-kort: Intelligence Index 56 vs 17, kontextfönster 1M vs 131K tokens, och vikter stängda vs Apache 2.0, med en sidfot som lyder Index enligt Artificial Analysis v4.3.2; Muse Glimmer-specifikationer enligt Meta.
Guides & Insights

Claude Sonnet 5.5 vs Muse Glimmer: En 30B-laptopmodell mot den nya Sonnet

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Den övergripande frågan för den här sidan är om jämförelsen över huvud taget är legitim, och det ärliga svaret är att Claude Sonnet 5.5 och Muse Glimmerinte är konkurrenter i egentlig mening. På Artificial Analysiss Intelligence Index, revision v4.3.2, får Claude Sonnet 5.5 56 poäng och Muse Glimmer 17 poäng, och den skillnaden är inte brus — den motsvarar ungefär avståndet mellan en generell modell i framkanten och en mycket bra liten sådan. Det som ändå gör att den här sammanställningen är värd att läsa är att Muse Glimmer har en egenskap som den andra inte kan köpa till något pris: den är en modell med öppna vikter och 30 miljarder parametrar, publicerad av Meta den 10 augusti 2026 under Apache 2.0, kvantiserad till 4 bitar så att den ryms under 20 GB VRAM, och konstruerad för att köras med nätverket urkopplat. Claude Sonnet 5.5 lanserades den 28 september 2026 som leverantörens snabbaste och smartaste Sonnet, med ett pris på 2,00 dollar per miljon indatatoken och 10,00 dollar per miljon utdatatoken, och är endast åtkomlig över nätverk. Det verkliga beslutet handlar inte om vilken modell som är bättre. Det handlar om var du vill att tokens ska köras.

Två modeller, två definitioner av jobbet

Muse Glimmer kommer från Meta Superintelligence Labs som en 30B-parametermodell, tränad genom logitdestillation från Metas större lärarmodell Muse Spark, och finjusterades sedan på långkontextsagentdata och förstärktes för verktygsanvändning. Meta släppte den redan kvantiserad: 4-bit tar minnesanvändningen från över 55 GB vid full precision till under 20 GB, vilket är det som får den att rymmas inom en 24 GB- eller 32 GB-konsument-GPU. Meta testade den på ett Nvidia RTX 5090 och på Apple M4 Max- och M5 Max-kisel. Den tar emot text- och bildinmatning, returnerar text, kör ett kontextfönster på 131 072 token som Meta säger kan utökas till 262 144, och har en kunskapsgräns i januari 2026.

Artificial Analysis model page for Muse Glimmer (high), an open-weights model released August 2026, showing an Intelligence Index of 17, an output speed of 143.8 tokens per second, $0.325 per million input tokens and $1.35 per million output tokens, $0.06 per Intelligence Index task, 59M output tokens generated during the Index evaluation, a 131K-token context window and a January 2026 knowledge cutoff.

Claude Sonnet 5.5 är den andra modellen i A​nthropics 5.5-generation och den som företaget positionerar som den bästa kombinationen av snabbhet och intelligens i sitt sortiment. Den har ett fönster på 1 000 000 tokens, upp till 128 000 utdatatokens synkront och 300 000 på Message Batches API bakom output-300k-2026-03-24 headern, accepterar text, bilder och filer, erbjuder adaptivt tänkande vid valbar ansträngning med en cutoff i juni 2026, och är tillgänglig med noll datalagring från lansering. Lagring kostar 0,20 USD per miljon tokens vid cacheläsningar och 2,50 USD per miljon vid cacheskrivningar. A​nthropic säger att den kör 30 % snabbare än Claude Sonnet 5 och kostar upp till 30 % mindre per uppgift vid oförändrade priser – leverantörens påståenden, inte oberoende reproducerade.

Kontrasten i specifikationen är värd att se i ett svep, eftersom nästan varje rad är en annan sorts sak snarare än en bättre eller sämre:

• Vikter — Muse Glimmer Apache 2.0, nedladdningsbara, kvantiserade till 4-bitars jämfört med Claude Sonnet 5.5 stängd

• Var den körs — Muse Glimmer på din egen GPU, offline kontra Claude Sonnet 5.5 på A​nthropics infrastruktur

• Parametrar — Muse Glimmer 30B totalt, under 20 GB vid 4-bit jämfört med Claude Sonnet 5.5 – ej offentliggjorda

• Kontext — Muse Glimmer 131 072 tokens, kan utökas till 262 144 jämfört med Claude Sonnet 5.5 1 000 000 tokens

• Pris per miljon — Muse Glimmer ingen kostnad per token, din hårdvara vs Claude Sonnet 5.5 $2.00 in / $10.00 ut

• Intelligence Index v4.3.2 — Muse Glimmer 17 vs Claude Sonnet 5.5 56

• Kostnad per Index-uppgift enligt mätning — Muse Glimmer $0.06 vs Claude Sonnet 5.5 $7.60

Två siffror på den listan förtjänar att analyseras närmare, eftersom båda är fällor. Den första är siffran 0,06 dollar per uppgift: det är vad Artificial Analysis betalade för att anropa Muse Glimmer (high) via en hostad endpoint till priset 0,325 dollar per miljon indatatoken och 1,35 dollar per miljon utdatatoken, så den mäter ekonomin i att hyra den här modellen, inte i att köra den. Vid egen drift försvinner den marginella kostnaden per token och ersätts av en GPU som du redan äger eller måste köpa. Den andra är själva Index-gapet — en 30B-modell kvantiserad till 20 GB bedöms med samma måttstock som frontiermodeller, och resultattavlan säger detsamma när den placerar Muse Glimmer bland de främsta modellerna med öppna vikter samtidigt som den noterar att den är dyr för sin storlek.

Generated comparison scoreboard titled Claude Sonnet 5.5 vs Muse Glimmer, the scoreboard, contrasting weights closed vs Apache 2.0, where it runs Anthropic infrastructure vs your own GPU offline, parameters undisclosed vs 30B at 4-bit, context window 1,000,000 vs 131,072 tokens, AA Index 56 vs 17, and output speed 138.7 vs 143.8 tokens per second, with a footer reading AA Index and speed per Artificial Analysis v4.3.2; Muse Glimmer specifications per Meta.

Där Muse Glimmer är genuint bra, och där det går åt skogen

Den sammansatta poängen är alldeles för trubbig för att vara hela svaret, eftersom Muse Glimmer inte är sjutton rakt igenom. Den är snabb – Artificial Analysis mäter 143,8 utdatatoken per sekund, före Claude Sonnet 5.5:s 138,7 – och den är koncis, genererar 59M token i Index-utvärderingen mot Claude Sonnet 5.5:s 410M. Och i en utvärdering ligger den nära frontlinjen: recall över lång kontext, där den får 83,3 % mot Claude Sonnet 5.5:s 82,7 %. En 30B-modell som matchar en splitterny Sonnet i frontlinjen på långkontextsretrieval är den mest överraskande raden på den här sidan, och det stämmer överens med sättet Meta tränade den på – agentisk data för lång kontext, destillering från en mycket större lärarmodell.

De agentiska resultaten är där modellens tak visar sig och rankningen slutar vara smickrande. På Terminal-Bench 4.0 får Muse Glimmer 0,5 % mot Claude Sonnet 5.5:s 63,6 %. Dess poäng på automatiseringsbenchmarken är 0,068 mot 0,713. Humanity's Last Exam: 22,0 % mot 55,0 %. Ett utfall på en så liten nivå i en exekveringsbenchmark innebär att modellen inte slutför uppgifter, och ingen besparing genom lokal hosting gör en uppgift som aldrig blir klar billigare.

Forskningslitteraturen är också tydlig på den här punkten, och det är värt att säga rakt ut i stället för att begrava det: en peer-review-granskad studie om multiagentorkestrering, där Muse-Glimmer-30B var en av de testade modellerna, fann att den inte återfann någon av sina kandidater. M​etas egen benchmarktabell för modellen är ett leverantörsdokument och märks som ett sådant här; siffrorna från Artificial Analysis ovan är oberoende mätningar, och det är dem som den här artikeln lutar sig mot.

Så uppdelningen är tydlig. Muse Glimmer är stark för sin storlek på att läsa en lång inmatning och svara på den, snabb, billig att köra, och den ryms i en GPU i laptopklass. Det är inte en modell man ger en mjukvaruuppgift i flera steg och sedan lämnar. Det är den ärliga gränsen, och en jämförelse skriven enbart utifrån sammansatta poäng skulle dölja det.

Vad du faktiskt köper till frontier-priset

Claude Sonnet 5.5:s premium köper kapacitet först, och gapet på sjutton punkter i Index är den mest framträdande formen av det. Men tre andra saker följer med den $10.00 höga outputkostnaden som inte syns på någon topplista.

Det första är fönstret. En miljon tokens är ungefär sju och en halv gånger Muse Glimmers 131 072, och Anthropic tar standardpriset för allt detta, med cacheläsningar till en tiondel av indatapriset så att det blir överkomligt, snarare än teoretiskt, att bära en stor kontext över många anrop. En prompt i förvarsstorlek får inte plats i det mindre fönstret överhuvudtaget, så detta är en skillnad i kapacitet och inte en preferens.

Den andra är verktygstrohet. Fem beteenden ändrades mellan Claude Sonnet 5 och Claude Sonnet 5.5, och alla fem handlar om verktygsanvändning och resonemang: samplingsparametrar som inte är standard returnerar nu en 400, thinking: {"type": "disabled"} returnerar nu en 400 och blir between_tools, tvingat verktygsval av "any" eller ett namngivet verktyg avvisas, så loopar måste flytta till auto med strikt verktygsanvändning, det äldre computer_20251124-verktyget avvisas i Claude API och Google Cloud, och tänkandeblock är nu bundna till modellen som producerade dem och till kontot. En sjätte ändring får ingenting att misslyckas men tystnar: texten mellan verktygsanrop returneras inuti tänkandeblock, så en strömmande applikation slutar visa utdata tills den anger ett visningsvärde eller stänger av tänkande i förväg. Det är en dags migreringsarbete för alla som använder Sonnet 5, och det är inträdespriset till den agentiska tillförlitligheten som benchmarkraderna ovan mäter.

Det tredje är proveniens och datahantering. Noll datalagring är tillgänglig från lansering, A​nthropic publicerar ett tidigast avvecklingsdatum den 28 september 2027, och modellen är tillgänglig på Claude API, Bedrock, Goo​gle Cloud och Microsoft Foundry. För en reglerad köpare är detta upphandlingsfakta som avgör köpet innan benchmarken gör det.

Offline är ett krav, inte en kostnadsbesparing

Anledningen till att den här kombinationen hör hemma på en och samma sida är att Muse Glimmer för en specifik klass av driftsättning inte är ett billigare alternativ – det är det enda alternativet. En begäran som inte kan lämna enheten, ett fabriksgolv eller en fältplats utan anslutning, en luftgapad miljö där ett API-anrop utgör en regelefterlevnadsöverträdelse, eller en latensbudget där en tur och retur redan är för mycket: inget av dessa löses av en bättre modell bakom ett nätverk. Apache 2.0-vikter som ryms under 20 GB och körs offline är hela svaret, och Claude Sonnet 5.5, oavsett pris, deltar inte i frågan.

Metas publicerade tester på RTX 5090 samt Apples M4 Max- och M5 Max-kisel är den praktiska referensen för vad ”körs lokalt” innebär här, och 4-bitarskvantiseringen är det som över huvud taget gör dessa mål uppnåeliga — minnesavtrycket vid full precision är över 55 GB. Den som planerar en driftsättning bör betrakta hårdvarusiffrorna som Metas, snarare än som uppmätta här.

För alla andra är de två modellerna komplement snarare än substitut, och det operativt krångliga är att en Anthropic API-modell och en självhostad Meta-modell normalt innebär två helt separata stackar. OrcaRouter sätter över 200 modeller bakom en enda OpenAI-kompatibel endpoint, med leverantörens listpris vidarebefordrat och utan påslag, automatisk failover mellan uppströmsleverantörer och ett routing-DSL för att komponera anrop – vilket täcker den hostade halvan av det upplägget, och Metas större lärare Muse Spark 1.2 går att routa hit som meta/muse-spark-1.2 till $1,25 för indata och $4,25 för utdata per miljon tokens över ett fönster på 1 048 576 tokens, med cacheläsningar för $0,15. Den bär 42,8 miljoner tokens trafik i veckan genom den här katalogen, vilket är det användbara med upplägget: den hostade läraren ligger på samma nyckel som allt annat, och modellen du kör lokalt behöver aldrig röra ett nätverk alls.

Tre noteringar om ärlighet, eftersom de är lätta att få fel. Muse Glimmer är i sig inte en av våra vägar – modellkortet finns inte i vår katalog, och den här sidan säger det i stället för att antyda något annat. Skärmbilden nedan är sidan för den modell som faktiskt finns, Muse Spark 1.2, vilken är den checkpoint som Muse Glimmer destillerades från snarare än Muse Glimmer själv. Claude Sonnet 5.5 finns inte heller i vår katalog, en dag efter släppet; vägen till den är Anthropics eget API, och Claude Sonnet 5 har gått att route:a här sedan 30 juni för $2.00 och $10.00 för alla som vill ha staging-målet.

OrcaRouter model page for meta/muse-spark-1.2, dated 2026-08-05, showing $1.25 input and $4.25 output per million tokens, a p50 time to first token of 2.05 s, a 1,048,576-token context window, and 42.8M tokens of recent traffic.

Hur man bestämmer

Utgå från begränsningen, inte från poängen. Om begäran inte får lämna en maskin eller ett nätverk är Muse Glimmer svaret och Index-gapet irrelevant — en 30B Apache 2.0-modell som körs offline och matchar en frontiermodell i långkontextåterkallning är, för den uppgiften, det bästa som finns tillgängligt. Om begäran måste slutföra en programvaruuppgift i flera steg är en 30B-modell som får en halv procent på Terminal-Bench inte med i matchen oavsett vilken hårdvara du redan äger.

Mellan dessa två poler är avgörandet mätning snarare än åsikt: tokens per slutförd uppgift på din egen arbetsbelastning, prissatt två gånger — en gång till Claude Sonnet 5.5:s $2.00 och $10.00, och en gång till GPU:ns amorterade kostnad. Det enda nummer som omramar hela jämförelsen, $0.06 per Index-uppgift mot $7.60, är en siffra för hyrd hosting för en modell som de flesta kommer att köra själva, och att citera det som om det vore en likvärdig besparing skulle vara det enkla misstag som den här sidan finns för att undvika.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen