Muse Glimmer-titelkort: Metas 30B open-weight agentmodell för lokala GPU:er, med chips som visar Apache 2.0, ryms på 24-32 GB GPU:er, och destillerad från Muse Spark 1.2.
Guides & Insights

Muse Glimmer: Metas 30B Open-Weight-agentmodell hävdas slå Gemma4-31B och Qwen3.6-27B

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Ett X-inlägg på morgonen den 10 augusti 2026 uttryckte det mer rakt på sak än något pressmeddelande: "Holy meta is back." Det inlägget reagerade på releasen — Muse Glimmer, Metas första öppenviktsmodell sedan Llama 4 — som kom samma dag, och Metas eget tillkännagivande är nästan lika aggressivt som tweeten. Modellens benchmarktabell med 30 miljarder parametrar gör anspråk på att den slår Go​ogles Gemma4-31B i 19 av 24 rader och Alibabas Qwen3.6-27B i 14 av 24, med den agentiska benchmarken MCP-Atlas i toppen, där Meta rapporterar 75,5 mot 54,2 respektive 62,5.

Innan "smoked" blir ett faktum i ditt huvud, notera vem som producerade dessa siffror. Varje poäng i Metas tabell kördes av Meta, mot konkurrerande modeller vars inställningar Meta själv medgav att man inte hade justerat. Muse Glimmer har ännu ingen post på Artificial Analysis, den oberoende topplistan som spårar denna exakta storleksklass — där Qwen3.6-27B för närvarande har ett Intelligence Index på 46 och Gemma4-31B ligger på 39. Detta är därför två berättelser på en gång: en verkligt betydelsefull open-weight-utgåva från Meta, och ett benchmark-påstående som kommer att ta veckor att verifiera. Den här texten håller dem åtskilda.

Vad Muse Glimmer faktiskt är

Muse Glimmer är en tät, multimodal 30B-modell — text plus bildinmatning genom en dedikerad perceptionskodare — tränad på mer än 100 språk och utgiven under den permissiva Apache 2.0-licensen. Vikterna finns på Hugging Face under meta-models/Muse-Glimmer-30B. Det är en destillerad version av Metas större proprietära flaggskepp, Muse Spark 1.2, och träningsreceptet visar det: logit-destillering från läraren i förträningen, mellanträning på data med längre kontext och mycket agentdata, sedan övervakad finjustering kombinerad med on-policy-destillering och förstärkningsinlärning.

Produktbeskrivningen är lika specifik som tekniken. Meta byggde Glimmer för "alltid påslagna lokala agentarbetsflöden" – en agent som lever på din dator och kan anropa verktyg, följa planer i flera steg, återhämta sig när ett verktygsanrop misslyckas i stället för att stanna, och justera resonemangsinsatsen upp eller ner. De avsedda uppgifterna är de oglamorösa: lokal kodning, funktionsanrop, schemahantering, filorganisation och LLM-som-domare-utvärdering. Den är kompatibel med agentorkestreringsramverk som OpenClaw, vilket är så många faktiskt kommer att köra den.

Hårdvaruhistorien är den andra halvan av pitchningen. Vid full precision kräver en 30B-modell över 55 GB minne; Metas ~4-bitars kvantisering minskar det till ungefär 17–20 GB, vilket ryms på ett 24 GB eller 32 GB konsumentkort (ett RTX 5090 är referensen) och på avancerade Macar med enhetligt minne. En spekulativ avkodnings-drafter — en liten medföljande modell som Meta kallar DFlash — snabbar upp generationen: Meta rapporterar cirka 3.1x på ett RTX 5090 (från 74.9 till 233 tokens/sek i llama.cpp), 1.8x på en M5 Max och 1.5x på en M4 Max, där enhetligt minne redan är mindre bandbreddsbegränsat.

Varför den här releasen är viktig bortom specifikationsbladet

Tweeten fångade formen rätt. Sedan Llama 4 under våren 2025 hade Meta varit tyst om öppna vikter och dragit sig tillbaka till en proprietär frontlinje under Meta Superintelligence Labs och AI-chefen Alexandr Wang. Muse Glimmer är den offentliga återkomsten till strategin med öppna vikter som gjorde Llama till den mest nedladdade familjen inom AI – och den kom insvept i den hittills starkaste signalen om avsikt: Zuckerberg publicerade en essä på 14 sidor, "The Future is for Everyone," i samband med lanseringen, där han argumenterade för att den verkliga AI-risken är koncentrerad kontroll och att öppna vikter är hur Amerika förblir konkurrenskraftigt mot Kinas laboratorier med öppna modeller. Han efterlyste lösare amerikansk reglering av AI med öppen källkod, och Meta tillkännagav en fond på 1 miljard dollar, "Future is for Everyone Fund." Meta sade också att man planerar att släppa vikterna för den mycket större Muse Spark 1.2 "inom de kommande veckorna."

Den kontexten ändrar hur du bör läsa benchmark-tabellen. Det här är inte en forskningslabbskuriositet som släpps i tysthet; det är ett strategiskt uttalande med en modell bifogad. Glimmer är positionen "billig lokal agent" i Metas utbud, som medvetet underminerar argumentet att seriöst agentarbete kräver ett moln-API. Huruvida den faktiskt levererar det är precis vad verifieringsfrågan handlar om.

Three-way scoreboard comparing Muse Glimmer, Gemma4-31B and Qwen3.6-27B: MCP-Atlas 75.5/54.2/62.5, DeepSearch QA 74.6/61.7/71.1, GAIA2 43.3/36.4/40.0, SWE-Bench Pro 51.2/36.9/50.2, TerminalBench 2.1 51.7/--/60.7, and AA Intelligence Index --/39/46. Footer: rows 1-5 vendor-reported by Meta; AA Index per Artificial Analysis (no Muse Glimmer entry yet).

Påståendet "rökt", rad för rad.

Metas tabell jämför Muse Glimmer mot Gemma4-31B och Qwen3.6-27B över 24 benchmark-rader. Där den hävdar de största vinsterna är mönstret konsekvent: allmänt agentiskt resonemang och sökning.

• MCP-Atlas (agentiskt verktygsanvändande) — Muse Glimmer 75.5, Gemma4-31B 54.2, Qwen3.6-27B 62.5. Detta är rubrikraden och det största glappet i uppsättningen.

• DeepSearch QA — 74.6 mot 61.7 och 71.1.

• GAIA2 (allmän assistent) — 43.3 mot 36.4 och 40.0.

• WildClawBench (agentic suite) — 47,6 mot 37,6 och 43,2.

• SWE-Bench Pro — 51.2 mot 36.9 och 50.2. Observera det tredje numret: 50.2 är Metas egen mätning av Qwen3.6-27B, medan Alibabas egen publicerade siffra är 53.5. Samma modell, två olika resultat beroende på vem som körde den.

• AIME 2026 — 94.7, IFBench 77.0 och AA-LCR 80.0 mot Ge​mma's 68.3.

Det är en stark rad. Men tabellen visar ingen total dominans, och raderna där Muse Glimmer förlorar är lika informativa som de där den vinner. Qwen3.6-27B håller ställningarna när det gäller praktisk datoranvändning och terminaltungt arbete: SWE-Bench Verified 77,2 mot Glimmers 76,0, OSWorld-Verified 75,6 mot 65,9 och TerminalBench 2.1 60,7 mot 51,7, plus en konsekvent fördel på multimodala tester som ScreenSpot Pro, OmniDocBench och MMMU-Pro. Gemma4-31B å sin sida har det bättre säkerhetsresultatet på de två mätvärden som Meta rapporterar — den lägsta överträdelsefrekvensen på CI Memories och den lägsta attackframgångsfrekvensen på Siren AgentDojo — och vinner knappt på de snäva resonemangstesten (GPQA Diamond, Humanity's Last Exam).

Läser man det rakt av är Metas påstående att de "slår de andra två på de flesta agentiska benchmarks", och på sin egen tabell är det ungefär sant. Förbehållen är poängen. Meta körde varje rad själv och medgav att testuppställningarna för rivalmodellerna inte var justerade på samma sätt som dess egen. Det är ingen anklagelse om bedrägeri — ojusterade rivaluppställningar är en rutinmässig, till och med förväntad, synd i den här branschen — men det är precis därför leverantörsdrivna tabeller får oberoende bekräftelse. Ovanstående avvikelse för Q​wen SWE-Bench Pro är hela problemet i miniatyr.

Vad den oberoende resultattavlan säger

Artificial Analysis listar ännu inte Muse Glimmer – modellen är bara några dagar gammal, och AA:s index bygger på egna körningar, som tar tid. Men AA följer båda rivalerna, vilket ger dig det uppmätta fält som nykomlingen påstår sig ge sig in i. Enligt det aktuella indexet har Qwen3.6-27B ett intelligensindex på 46, som AA beskriver som den mest intelligenta modellen med öppna vikter under 150B parametrar; Gemma4-31B ligger på 39. Det är oberoende siffror, inte leverantörspåståenden.

Den oberoende bilden visar också en kostnadsaspekt som rubriksiffrorna döljer. AAs effektivitetsdata visar att Qwen3.6-27B genererar cirka 54,6 tokens/sekund jämfört med Gemma4-31B:s 34,8, och Gemmas tid till första token är snabbare – men Qwen använder ungefär 3,7 gånger fler utdatatokens för att köra hela indexet, vilket gör den cirka 21 gånger dyrare att utvärdera från början till slut. Tokenkrävande modeller är dyrare i den verkliga världen även när deras benchmarkresultat är bättre, och det är ett beslutsunderlag som ingen leverantörstabell frivilligt erbjuder.

Så det ärliga tillståndet i världen i skrivande stund är: ett starkt leverantörsrapporterat resultat, inget oberoende resultat alls ännu för Muse Glimmer, och ett konkurrerande fält som är oberoende mätt och uppdelat efter uppgift. "Rökte Ge​mma och Q​wen" är ett trovärdigt påstående; det är ännu inte ett verifierat utfall. Verifieringsmarkörerna att hålla utkik efter är en post i AA-indexet, LMArena Elo och community-reproduktioner — som alla vanligtvis dyker upp inom några veckor efter en sådan här release.

Screenshot of Artificial Analysis' Small Open Source Models comparison page, showing the 4B-40B open-weight class with Openness and Intelligence index columns and the header noting that Qwen3.6-27B and Qwen3.5-27B are the highest-intelligence small open-source models.

Vad det faktiskt kostar att driva

Muse Glimmer är gratis — Apache 2.0, ingen avgift per token, ingen betalning till Meta. Kostnaden är hårdvaran du sätter under den. En 30B-modell i 4-bit behöver cirka 17–20 GB resident minne plus utrymme för KV-cache, perceptionskodaren och DFlash-draftern, vilket är anledningen till att Metas egna rekommendation är ett 24GB- eller 32GB-kort eller en högpresterande Mac. Om du äger den hårdvaran är marginalkostnaden för att köra en alltid påslagen lokal agent i princip el. Om du inte gör det är ett 24GB-GPU eller en maxad M-serie-Mac en verklig kostnadspost — och sedan den 9 augusti finns det ett tredje alternativ: hyra den. De första hostade API-listningarna, live från och med det datumet, prissätter Muse Glimmer till 0,35 USD per miljon inmatade tokens och 1,50 USD per miljon utgående tokens på ett 131K-kontextfönster. Det är en leverantörslistad marknadsplatsavgift snarare än ett Meta-pris, men det är det belopp du faktiskt kan betala idag om du hellre inte köper hårdvara.

Det är jämförelsen som är värd att göra noggrant, eftersom ”öppna vikter, noll pris” möter ”hosted API, pris per token” på helt olika villkor. När du räknar på siffrorna, prissätt båda sidor ärligt. På vår sida hos OrcaRouter är priset du ser för någon av de 200+ hostade modellerna leverantörens listpris som förs vidare med 0 % påslag, så en prissänkning från leverantören syns här samma dag snarare än efter en marginalomräkning — vilket gör jämförelsen mellan lokal och hostad rak. Muse Glimmer i sig är ännu inte en av dessa 200+ modeller, så det där vidareförda priset gäller inte för den idag. Men disciplinen är poängen: sättet att prissätta en oprövad modell med öppna vikter är din egen trafik, inte en leverantörstabell, och routing-DSL:en finns för att köra just den jämförelsen när en modell ligger bakom ett API du kan anropa.

Hur du faktiskt skulle använda det den här veckan

Eftersom den levereras med öppna vikter är "åtkomst" inte en registrering – det är en nedladdning. Basrepo:t är meta-models/Muse-Glimmer-30B på Hugging Face, med en GGUF-variant som redan publicerats och kvantiseringsvarianter som kommer från tredjeparter. Stödet för körningsmiljöer vid lanseringen omfattade llama.cpp, MLX och ExecuTorch, med integrationer för Ollama, LM Studio, vLLM och SGLang som släpptes dagarna efter releasen, och hårdvaruoptimeringsarbete listat för AMD, Arm, Dell, Intel och Nvidia. Den praktiska vägen för de flesta är: hämta GGUF-filen, ladda den i llama.cpp eller en lokal runner och rikta en agent-stomme mot den. Meta erbjuder ingen publik API för själva Glimmer, och den lokala vägen är den som modellen byggdes kring – men den värdbaserade vägen är inte längre hypotetisk: tredjepartsplattformar började servera den den 9 augusti, så "ladda ner och kör" och "anropa ett API" är båda levande alternativ nu.

{{1}}En ärlig notering specifikt om oss:{{/1}} {{2}}Muse Glimmer är fortfarande inte tillgänglig via OrcaRouter.{{/2}} {{3}}Vi dirigerar värdbaserade API:er, och i och med den här uppdateringen har modellen inte landat i vår katalog{{/3}} — {{4}}0%-påslaget och en-nyckel-för-allt-upplägget gäller för de 200+ modeller vi dirigerar, och den här är ännu inte en av dem.{{/4}} {{5}}När så sker når samma nyckel som når resten av katalogen även den, utan nytt avtal, och automatisk failover är mekanismen som gör det säkert att rikta verklig trafik mot en helt ny, leverantörsrapporterad modell innan den har en oberoende meritlista.{{/5}} {{6}}Det är samma anledning till att routing-DSL:et finns:{{/6}} {{7}}en obeprövad modell bör förtjäna en produktionsväg på dina data, inte på sitt eget pressmeddelande.{{/7}}

Skärmdumpen nedan är Hugging Face-kortet som det såg ut på releasedagen — raden "inte driftsatt av någon inferensleverantör" syftar på Hugging Faces egen förstapartsinferens, vilket är en separat sak från tredjepartslistningarna av värdbaserade API:er som publicerades den 9 augusti.

Screenshot of the Hugging Face model card for meta-models/Muse-Glimmer-30B, showing the Apache 2.0 license, 30B parameter size, Meta Superintelligence Lab authorship, and the line that the model is not deployed by any inference provider.

Vad du ska titta på

Tre saker kommer att avgöra den här historien, i ungefärlig hastighetsordning. För det första: den utlovade open-weights-utgåvan av Muse Spark 1.2 – om lärarmodellen levereras under de ”kommande veckorna” upphör Glimmer att vara en engångsföreteelse och blir början på en fullfjädrad open-weights-serie, vilket är den verkliga strategiska tolkningen av ”Meta är tillbaka.” För det andra: oberoende mätning – en post i Artificial Analysis index, en LMArena-placering och community-reproduktioner kommer att visa om 19-av-24-påståendet överlever kontakten med någon som inte är Meta. För det tredje: hosting-vågen – den har redan börjat. Leverantörer började servera Glimmer den 9 augusti, så frågan om lokalt kontra hostat är nu ett faktiskt val du kan göra med en enda API-nyckel; det som återstår att hålla koll på är hur stor spridning hosting får och vad priset per token gör när releasveckans nyhet har lagt sig.

Twittret hade rätt om nyheten. Huruvida det hade rätt om domen — det är en fråga som tar veckor att besvara, och den ärliga ståndpunkten just nu är att ingen utanför Meta har kört tillräckligt för att veta. Det som redan är sant är att en 30B Apache-2.0-agentmodell som får plats på ett konsument-GPU och backas av en fullständig strategisatsning är en release att planera kring, oavsett vad dess oberoende poäng slutar på.

Frågor värda att faktiskt besvara

Är Muse Glimmer verkligen öppen källkod?

Det är öppna vikter under den tillåtande Apache 2.0-licensen — vem som helst kan ladda ner, modifiera, finjustera och distribuera den kommersiellt utan att betala Meta. Den omsorgsfulla formuleringen är "öppna vikter" snarare än fullt öppen källkod i OSI-bemärkelse, eftersom träningsdatan, Muse Spark-lärarvikterna och en del verktyg inte ingår. För praktiska ändamål — du kan köra den, leverera den och sälja en produkt byggd på den — är det samma upplägg som gjorde Llama till den mest använda öppna familjen inom AI.

Slår Muse Glimmer verkligen Gemma4-31B och Qwen3.6-27B?

På Metas egen tabell, ja på de flesta agentiska och sökrelaterade benchmarktester, med förbehållet att Meta själv genomförde jämförelsen och inte finjusterade konkurrenternas konfigurationer. Den ärliga bilden är mer specifik: Meta vinner raderna för agentiskt resonemang, Qwen3.6-27B vinner på praktisk datoranvändning och terminalarbete samt de flesta multimodala tester, och Gemma4-31B har den bättre säkerhetsstatistiken. Per lanseringsdagen finns det ingen oberoende indexpost för Muse Glimmer överhuvudtaget, så betrakta påståendet 19 av 24 som rapporterat av leverantören tills någon annan kör det.

Kan jag köra det på en laptop?

Bara om "laptop" betyder en med ett diskret GPU på 24–32 GB eller en högklassig M-serie-Mac med tillräckligt med enhetligt minne — en 4-bitars Muse Glimmer behöver cirka 17–20 GB plus utrymme för KV-cache, perceptionskodaren och DFlash-draftern. Det är ett rejält inköp för de flesta, och det är den dolda kostnaden i en "gratis" modell. Med integrerad grafik eller en 16 GB-maskin skulle du få tung kvantisering och långsamma utdata snarare än den ständigt aktiva agent som releasen är byggd kring.

Var får jag tag på det — är det via ett API?

Vikterna finns på Hugging Face på meta-models/Muse-Glimmer-30B (med en GGUF-variant), och du kör den lokalt via llama.cpp, MLX, ExecuTorch, eller de lokala körningarna som nu integrerar den. Hostad API-åtkomst är också live, från och med 9 augusti, via tredjepartsplattformar till listade priser på 0,35 USD per miljon inmatningstokens och 1,50 USD per miljon utmatningstokens — så du behöver inte längre äga ett 24 GB GPU för att anropa den. Meta själva erbjuder fortfarande inget publikt API för Glimmer, och den finns inte heller på OrcaRouter ännu. När den landar i vår katalog kommer samma nyckel som når resten av katalogen att nå den; tills dess är de två ärliga vägarna lokal inferens eller en tredjepartshostad plattform.

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

Kontakta oss

Gå med i vår community

DiscordEmailXGitHubYouTube