Muse Glimmer titelkaart: Meta's 30B open-gewicht agentmodel voor lokale GPU's, met chips met de tekst 'Apache 2.0', 'Past op 24-32 GB GPU's' en 'Gedistilleerd uit Muse Spark 1.2'.
Guides & Insights

Muse Glimmer: Meta's 30B open-gewicht agentmodel beweert Gemma4-31B en Qwen3.6-27B te verslaan

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Een X-bericht op de ochtend van 10 augustus 2026 zei het botter dan welk persbericht ook: "Heilige meta is terug." De release waarop dat bericht reageerde — Muse Glimmer, Meta's eerste open-weightmodel sinds Llama 4 — verscheen dezelfde dag, en Meta's eigen aankondiging is bijna even agressief als de tweet. De benchmarktabel van het model met 30 miljard parameters beweert dat het Google's Gemma4-31B verslaat op 19 van de 24 rijen en Alibaba's Qwen3.6-27B op 14 van de 24, met als kop de agentische benchmark MCP-Atlas, waar Meta 75,5 rapporteert tegen respectievelijk 54,2 en 62,5.

Voordat "smoked" een feit in je hoofd wordt, let op wie die cijfers heeft geproduceerd. Elke score in Meta's tabel is door Meta zelf berekend, tegen concurrerende modellen waarvan Meta zelf toegaf dat het hun configuraties niet had afgestemd. Muse Glimmer heeft nog geen vermelding op Artificial Analysis, het onafhankelijke leaderboard dat wél deze exacte grootteklasse bijhoudt — waar Qwen3.6-27B momenteel een Intelligence Index van 46 heeft en Gemma4-31B op 39 staat. Dit zijn dus twee verhalen tegelijk: een werkelijk belangrijke open-weight-release van Meta, en een benchmarkclaim waarvan de verificatie weken zal duren. Dit artikel houdt ze gescheiden.

Wat Muse Glimmer eigenlijk is

Muse Glimmer is een 30B dense, multimodaal model — tekst plus beeldinvoer via een speciale perceptie-encoder — getraind op meer dan 100 talen en uitgebracht onder de permissieve Apache 2.0-licentie. De gewichten zijn te vinden op Hugging Face onder meta-models/Muse-Glimmer-30B. Het is een gedistilleerde versie van Meta's grotere propriëtaire vlaggenschip, Muse Spark 1.2, en het trainingsrecept laat dat zien: logit-destillatie van de leraar tijdens pre-training, mid-training op gegevens met langere context en veel agenten, gevolgd door gesuperviseerde fine-tuning in combinatie met on-policy-destillatie en reinforcement learning.

De productbrief is net zo specifiek als de technologie. Meta bouwde Glimmer voor 'altijd actieve lokale agent-workflows' — een agent die op je machine leeft en tools kan aanroepen, meerstappenplannen kan volgen, kan herstellen wanneer een toolaanroep mislukt in plaats van te stoppen, en de redeneerinspanning omhoog of omlaag kan bijstellen. De beoogde taken zijn de onglamoureuze: lokale codering, functieaanroepen, agendabeheer, bestandsorganisatie, LLM-as-a-judge-evaluatie. Het is compatibel met agent-orchestratieframeworks zoals OpenClaw, waarmee veel mensen het daadwerkelijk zullen draaien.

Het hardwareverhaal is de andere helft van de pitch. Bij volledige precisie heeft een 30B-model meer dan 55 GB geheugen nodig; Meta's ~4-bit-kwantisering brengt dat op ruwweg 17–20 GB, wat past op een consumenten-GPU van 24 GB of 32 GB (een RTX 5090 is de referentie) en op high-end Macs met unified memory. Een speculative-decoding-drafter — een klein begeleidend model dat Meta DFlash noemt — versnelt de generatie: Meta rapporteert ongeveer 3,1x op een RTX 5090 (van 74,9 tot 233 tokens/sec in llama.cpp), 1,8x op een M5 Max en 1,5x op een M4 Max, waar unified memory al minder door bandbreedte wordt beperkt.

Waarom deze release meer betekent dan de specificatielijst

De tweet schetste het treffend. Sinds Llama 4 in het voorjaar van 2025 was Meta stil geworden over open weights en had het zich teruggetrokken op een propriëtaire frontierlijn onder Meta Superintelligence Labs en chief AI-officer Alexandr Wang. Muse Glimmer is de publieke terugkeer naar de open-weightsstrategie die Llama tot de meest gedownloade modelfamilie in AI maakte — en het kwam binnen met het sterkste signaal van intentie tot nu toe: Zuckerberg publiceerde bij de lancering een essay van 14 pagina's, "The Future is for Everyone", waarin hij betoogt dat het echte AI-risico geconcentreerde controle is en dat open weights de manier zijn waarop Amerika concurrerend blijft met de open-modellenlabs van China. Hij riep op tot soepelere Amerikaanse regelgeving voor open-source AI, en Meta kondigde een "Future is for Everyone Fund" van $1 miljard aan. Meta zei ook dat het van plan is om de weights van de veel grotere Muse Spark 1.2 "in de komende weken" vrij te geven.

Die context verandert hoe je de benchmarktabel moet lezen. Dit is geen stille publicatie uit een onderzoekslab; het is een strategieverklaring met een model eraan gekoppeld. Glimmer is de positie van "goedkope lokale agent" in Meta's line-up, die bewust het argument ondergraaft dat serieus agentisch werk een cloud-API vereist. Of het dat daadwerkelijk waarmaakt, is precies waar de verificatievraag over gaat.

Three-way scoreboard comparing Muse Glimmer, Gemma4-31B and Qwen3.6-27B: MCP-Atlas 75.5/54.2/62.5, DeepSearch QA 74.6/61.7/71.1, GAIA2 43.3/36.4/40.0, SWE-Bench Pro 51.2/36.9/50.2, TerminalBench 2.1 51.7/--/60.7, and AA Intelligence Index --/39/46. Footer: rows 1-5 vendor-reported by Meta; AA Index per Artificial Analysis (no Muse Glimmer entry yet).

De claim 'gerookt', rij voor rij

Meta's tabel vergelijkt Muse Glimmer met Gemma4-31B en Qwen3.6-27B over 24 benchmarkrijen. Waar de tabel de grootste winsten claimt, is het patroon consistent: algemeen agentisch redeneren en zoeken.

• MCP-Atlas (agentisch toolgebruik) — Muse Glimmer 75.5, Gemma4-31B 54.2, Qwen3.6-27B 62.5. Dit is de koprij en de grootste kloof van de set.

• DeepSearch QA — 74.6 tegenover 61.7 en 71.1.

• GAIA2 (algemene assistent) — 43.3 tegen 36.4 en 40.0.

• WildClawBench (agentic suite) — 47.6 tegen 37.6 en 43.2.

• SWE-Bench Pro — 51.2 tegen 36.9 en 50.2. Let op het derde getal: 50.2 is Meta's eigen meting van Qwen3.6-27B, terwijl Alibaba's eigen gepubliceerde cijfer 53.5 is. Hetzelfde model, twee verschillende scores, afhankelijk van wie het heeft uitgevoerd.

• AIME 2026 — 94,7, IFBench 77,0 en AA-LCR 80,0 tegenover Ge​mma's 68,3.

Dat is een sterke rij. Maar de tabel is geen volledige overwinning, en de rijen waarin Muse Glimmer verliest zijn net zo informatief als die waarin het wint. Qwen3.6-27B houdt het veld bij praktisch computergebruik en terminal-intensief werk: SWE-Bench Verified 77.2 tegen Glimmers 76.0, OSWorld-Verified 75.6 tegen 65.9, en TerminalBench 2.1 60.7 tegen 51.7, plus een consistente voorsprong op multimodale tests zoals ScreenSpot Pro, OmniDocBench en MMMU-Pro. Gemma4-31B laat op zijn beurt het betere veiligheidsrecord zien op de twee metrieken die Meta rapporteert — het laagste schendingspercentage op CI Memories en het laagste aanvalsuccespercentage op Siren AgentDojo — en wint nipt op de smalle redeneertests (GPQA Diamond, Humanity's Last Exam).

Letterlijk genomen is Meta's bewering dat het 'de andere twee verslaat op de meeste agentische benchmarks', en op de eigen tabel is dat ongeveer waar. De kanttekeningen zijn de kern. Meta heeft elke rij zelf uitgevoerd en gaf toe dat de testopstellingen voor de rivaliserende modellen niet waren afgestemd zoals de eigen opstelling. Dat is geen beschuldiging van fraude — niet-afgestemde opstellingen van rivalen zijn een routinematige, zelfs verwachte zonde in deze industrie — maar het is precies de reden waarom door leveranciers geproduceerde tabellen onafhankelijke bevestiging krijgen. De discrepantie met Q​wen SWE-Bench Pro hierboven is het hele probleem in het klein.

Wat het onafhankelijke scorebord zegt

Artificial Analysis vermeldt Muse Glimmer nog niet — het model is pas een paar dagen oud, en de index van AA is gebaseerd op eigen runs, die tijd kosten. Maar AA volgt wel beide rivalen, waardoor je het gemeten veld krijgt waarin de nieuwkomer beweert te stappen. Volgens de huidige index heeft Qwen3.6-27B een Intelligence Index van 46, door AA omschreven als het meest intelligente open-weights-model met minder dan 150B parameters; Gemma4-31B staat op 39. Dat zijn onafhankelijke cijfers, geen beweringen van leveranciers.

Het onafhankelijke beeld laat ook een kostenaspect zien dat de kopcijfers verbergen. AA's efficiëntiegegevens tonen Qwen3.6-27B met ongeveer 54,6 tokens/sec tegenover 34,8 voor Gemma4-31B, waarbij de time-to-first-token van Ge​mma sneller is — maar Q​wen gebruikt ruwweg 3,7x meer outputtokens om de volledige index te verwerken, wat het ongeveer 21x duurder maakt om end-to-end te evalueren. Tokenverslindende modellen zijn in de echte wereld duurder, zelfs als hun benchmarkscores beter zijn, en dat is beslissingsinformatie die geen enkele leverancierstabel zal prijsgeven.

Dus de eerlijke stand van zaken op dit moment is: een sterk door de leverancier gerapporteerd resultaat, nog helemaal geen onafhankelijk resultaat voor Muse Glimmer, en een concurrerend veld dat onafhankelijk wordt gemeten en per taak is opgesplitst. "Smoked Ge​mma en Q​wen" is een bewering die recht overeind staat; het is nog geen geverifieerde uitkomst. De verificatiemarkers om in de gaten te houden zijn een AA-indexvermelding, LMArena Elo en community-reproducties — die allemaal meestal binnen enkele weken na een release als deze verschijnen.

Screenshot of Artificial Analysis' Small Open Source Models comparison page, showing the 4B-40B open-weight class with Openness and Intelligence index columns and the header noting that Qwen3.6-27B and Qwen3.5-27B are the highest-intelligence small open-source models.

Wat het daadwerkelijk kost om te draaien

Muse Glimmer is gratis — Apache 2.0, geen kosten per token, geen betaling aan Meta. De kosten zitten in de hardware waarop je het draait. Een 30B-model met 4-bit heeft ongeveer 17–20GB resident geheugen nodig, plus ruimte voor de KV-cache, de perceptie-encoder en de DFlash-drafter. Daarom adviseert Meta zelf een 24GB- of 32GB-kaart of een high-end Mac. Als je die hardware hebt, zijn de marginale kosten van een altijd actieve lokale agent feitelijk alleen elektriciteit. Zo niet, dan is een 24GB-GPU of een maxed-out M-serie Mac een echte kostenpost — en sinds 9 augustus is er een derde optie: huren. De eerste hosted API-vermeldingen, die vanaf die datum live zijn, prijzen Muse Glimmer op $0,35 per miljoen inputtokens en $1,50 per miljoen outputtokens op een contextvenster van 131K. Dat is een door de provider vermeld markttarief in plaats van een Meta-prijs, maar het is het bedrag dat je vandaag daadwerkelijk kunt betalen als je liever geen hardware koopt.

Dat is de vergelijking die zorgvuldig gemaakt moet worden, want 'open gewichten, nul prijs' ontmoet 'gehoste API, prijs per token' op heel verschillende voorwaarden. Als je de cijfers draait, prijs beide kanten eerlijk. Aan onze kant bij OrcaRouter is de prijs die je voor elk van de 200+ gehoste modellen ziet, de catalogusprijs van de aanbieder, doorberekend met 0% opslag, dus een prijsverlaging van een leverancier is hier dezelfde dag live in plaats van na een margeherberekening — wat de lokaal-vs-gehoste vergelijking rechttoe rechtaan maakt. Muse Glimmer zelf is nog niet een van die 200+ modellen, dus die doorberekening is daar vandaag niet op van toepassing. Maar de discipline is het punt: de manier om een onbewezen open-gewichtenmodel te prijzen is je eigen verkeer, niet een leverancierstabel, en de routing-DSL bestaat om precies die vergelijking te draaien zodra een model achter een API zit die je kunt aanroepen.

Hoe je het deze week echt zou gebruiken

Omdat het als open weights wordt geleverd, is "toegang" geen aanmelding — het is een download. De basis-repo is meta-models/Muse-Glimmer-30B op Hugging Face, met een GGUF-variant die al is gepubliceerd en kwantiseringsvarianten die van derden komen. Op dag één was er runtime-ondersteuning voor llama.cpp, MLX en ExecuTorch; integraties voor Ollama, LM Studio, vLLM en SGLang volgden in de dagen na de release, en hardware-optimalisatiewerk is vermeld voor AMD, Arm, Dell, Intel en Nvidia. De praktische route voor de meeste mensen is: haal de GGUF op, laad hem in llama.cpp of een lokale runner, en richt er een agent-scaffold op. Meta biedt geen openbare API aan voor Glimmer zelf, en het lokale pad is waar het model omheen is gebouwd — maar het gehoste pad is niet langer hypothetisch: platforms van derden begonnen het op 9 augustus aan te bieden, dus "downloaden en draaien" en "een API aanroepen" zijn nu beide reële opties.

Eén eerlijke kanttekening specifiek over onszelf: Muse Glimmer is nog steeds niet beschikbaar via OrcaRouter. Wij routeren gehoste API's, en met deze update is het model nog niet in onze catalogus beland — de 0%-opslag en de één-sleutel-voor-alles-deal gelden voor de 200+ modellen die wij wél routeren, en dit is er nog niet één van. Wanneer het zover is, bereikt dezelfde sleutel die de rest van de catalogus bereikt, ook dit model, zonder nieuw contract, en automatische failover is het mechanisme dat het veilig maakt om echt verkeer naar een gloednieuw, door de leverancier gerapporteerd model te sturen voordat het een onafhankelijke trackrecord heeft. Dat is dezelfde reden waarom de routing-DSL bestaat: een onbewezen model hoort een productiepad te verdienen op basis van jouw data, niet op basis van zijn eigen persbericht.

De onderstaande screenshot is de Hugging Face-kaart zoals die op de releasedag werd weergegeven — de regel 'niet geïmplementeerd door een inference-provider' verwijst naar Hugging Face's eigen first-party-inferentie, wat iets anders is dan de door derden gehoste API-vermeldingen die op 9 augustus live gingen.

Screenshot of the Hugging Face model card for meta-models/Muse-Glimmer-30B, showing the Apache 2.0 license, 30B parameter size, Meta Superintelligence Lab authorship, and the line that the model is not deployed by any inference provider.

Wat te kijken

Drie dingen zullen dit verhaal beslechten, in ruwe volgorde van snelheid. Ten eerste, de beloofde Muse Spark 1.2 open-weights-release — als de leraar in de "komende weken" verschijnt, houdt Glimmer op een eenmalige te zijn en wordt het de dunne kant van een volledige open-weights-line-up, wat de echte strategische lezing is van "Meta is terug." Ten tweede, onafhankelijke meting: een Artificial Analysis-indexvermelding, een LMArena-plaatsing en community-reproducties vertellen je of de 19-van-24-claim het overleeft bij iemand die niet Meta is. Ten derde, de hostinggolf — die is al begonnen. Aanbieders begonnen Glimmer op 9 augustus aan te bieden, dus de vraag lokaal-versus-gehost is nu een echte keuze die je kunt maken met één API-sleutel; wat nog te volgen valt, is hoe breed het hostingaanbod wordt en wat de prijs per token doet zodra de release-weeknieuwigheid is verdwenen.

De tweet had gelijk over het nieuws. Of het ook gelijk had over het eindoordeel — dat is een vraag die nog weken speelt, en het eerlijke standpunt op dit moment is dat niemand buiten Meta genoeg heeft gedraaid om het te weten. Wat al wel vaststaat, is dat een 30B Apache-2.0-agentmodel dat op een consumenten-GPU past en wordt gesteund door een volledige strategische push, een release is om je planning op af te stemmen, wat de uiteindelijke onafhankelijke scores ook zijn.

Vragen die het daadwerkelijk waard zijn om te beantwoorden

Is Muse Glimmer echt open source?

Het heeft open weights onder de permissieve Apache 2.0-licentie — iedereen kan het downloaden, aanpassen, fine-tunen en commercieel inzetten zonder Meta te betalen. De zorgvuldige formulering is "open weights" in plaats van volledig open source in de OSI-zin, omdat de trainingsdata, de gewichten van de Muse Spark-docent en sommige tooling niet zijn inbegrepen. Voor praktische doeleinden — je kunt het draaien, uitbrengen en er een product bovenop verkopen — is het dezelfde deal die Llama tot de meest ingezette open familie in AI maakte.

Verslaat Muse Glimmer daadwerkelijk Gemma4-31B en Qwen3.6-27B?

Op Meta's eigen tabel, ja op de meeste agentische en zoekbenchmarks, met de kanttekening dat Meta de vergelijking zelf heeft uitgevoerd en de opstellingen van de rivalen niet heeft afgesteld. Het eerlijke beeld is specifieker: Meta wint de rijen voor agentisch redeneren, Qwen3.6-27B wint bij hands-on computergebruik en terminalwerk plus de meeste multimodale tests, en Gemma4-31B noteert de betere veiligheidsresultaten. Op de releasedag is er helemaal geen onafhankelijke indexvermelding voor Muse Glimmer, dus behandel de 19-van-de-24-claim als door de leverancier gerapporteerd totdat iemand anders het draait.

Kan ik het op een laptop draaien?

Alleen als "laptop" er een betekent met een discrete GPU van 24 GB of 32 GB, of een high-end M-serie Mac met voldoende unified memory — een 4-bit Muse Glimmer heeft ruwweg 17–20 GB nodig plus ruimte voor de KV-cache, de perceptie-encoder en de DFlash-drafter. Dat is voor de meeste mensen een echte uitgave, en het is de verborgen kost binnen een "gratis" model. Op geïntegreerde graphics of een machine met 16 GB krijg je te maken met zware kwantisatie en trage output, in plaats van de altijd-actieve agent waar de release om is gebouwd.

Waar kan ik het krijgen — is het via een API?

De gewichten staan op Hugging Face bij meta-models/Muse-Glimmer-30B (met een GGUF-variant), en je draait het lokaal via llama.cpp, MLX, ExecuTorch, of de lokale runners die het nu integreren. Gehoste API-toegang is ook live, sinds 9 augustus, via platforms van derden tegen een vermelde $0,35 per miljoen invoertokens en $1,50 per miljoen uitvoertokens — dus je hoeft geen 24GB-GPU meer te bezitten om het aan te roepen. Meta zelf host nog steeds geen openbare API voor Glimmer, en het staat ook nog niet op OrcaRouter. Wanneer het in onze catalogus verschijnt, zal dezelfde sleutel die de rest van de catalogus bereikt ook dit bereiken; tot die tijd zijn de twee eerlijke paden lokale inferentie of een gehost platform van derden.

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

Neem contact op

Word lid van de community

DiscordEmailXGitHubYouTube