
Muse Glimmer Når 230 Tokens/s på en Enda RTX 5090: SGLang Day-0-stöd Är den Verkliga Lanseringshistorien
- z-aiNYZ.ai: GLM 5.32026-08-1860Intelligens75Kodning
- obsidianNYQwen3.8 27B2026-08-1552Intelligens68Kodning
- qwenNYQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNYDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligens69Kodning
- grokNYSpaceXAI: Grok 4.62026-08-1261Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligens77Kodning
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligens77Kodning
- grokxAI: Grok 4.52026-07-0856Intelligens72Kodning
Tvåhundratrettio tokens per sekund är en hög siffra för vilken modell som helst. För Muse Glimmer — Metas 30B-dense-release med öppna vikter från Meta Superintelligence Labs, som släpptes den 10 augusti 2026 under Apache 2.0 — är det siffran som skiljer en modell som "kör på mitt grafikkort" från en som "servar en riktig agent". SGLang tillkännagav dag-0-stöd för Muse Glimmer samma dag som vikterna publicerades, och dess publicerade mätning på ett enda GeForce RTX 5090 är 236,4 tokens per sekund per användare vid batch 1, med NVFP4-kvantisering och Metas DFlash-drafter för spekulativ avkodning båda på.
Den där siffran står för det mesta av berättandet i den här releasen, men det är värt att stanna upp inför resten, eftersom det intressanta inte är rubrikhastigheten. Det intressanta är att modellen också fungerar direkt ur lådan på en RTX PRO 6000, på en NVIDIA DGX Spark och på Apple silicon via MLX — och att SGLang kallar arbetet för ett samarbete med Meta Superintelligence Labs snarare än en eftertanke från communityn. Det här är den första frontier-nära Meta-modellen på länge som är designad kring serving-stacken, inte bara kring vikterna.
Vad "day-0 support" faktiskt innebär här
Day-0-stöd i SGLang v0.5.17 innebär att modellen inte skruvades på i efterhand: körtidsarbetet hamnade i samma utgivningsfönster som vikterna, med en specialbyggd sökväg för den hårdvara Meta faktiskt riktar in sig på. SGLang:s SM120-backend täcker Blackwell-sortimentet för stationära datorer och arbetsstationer — RTX 5090, RTX PRO 6000 och DGX Spark kör alla samma optimerade sökväg — medan Apple Silicon får en inbyggd MLX-backend istället för en långsam port.
Stapeln som SGLang och Meta finjusterat för är specifik. Modellen körs som en {{1}}18GB NVFP4{{/1}}-kontrollpunkt tillsammans med en {{2}}5GB BF16 DFlash{{/2}}-dräktare, vilket är den spekulativa avkodningsmodellen som Meta tränade för {{3}}Muse Glimmer{{/3}}. Den kombinationen ryms i ett {{4}}32GB{{/4}}-kort med marginal, och hela den blandade kvantiseringsvägen NVFP4-plus-MXFP8 landar på cirka {{5}}19.5GB{{/5}} i minnet. På SGLang-sidan nämner versionsnoterna tre tillförlitlighetsmekanismer som en del av samma berättelse: {{6}}DFlash{{/6}} spekulativ avkodning, {{7}}RadixAttention{{/7}} för prefixcache och {{8}}interruptible CUDA-grafer{{/8}}.
Siffran, och vad den är och inte är
SGLang:s publicerade RTX 5090-siffror, alla med NVFP4 och SM120-banan, bryts ner så här:
• Enanvändaravkodning (batch 1) — 63,9 tokens/s standard, 236,4 tokens/s med DFlash spekulativ avkodning. Den 3,7x förbättringen är den interaktiva siffran, den som avgör om en lokal agent känns som ett samtal eller som en kö.
• Samlad utdata (batch 8) — 501 tokens/s standard, 1 452 tokens/s med DFlash. Detta är genomströmningstalet för en lokal server som betjänar flera förfrågningar samtidigt.
• För jämförelse, en GGUF q4_k_m på samma GPU — den väg de flesta kommer att använda med llama.cpp-liknande körtider — når 72,6 tokens/s standard och 140,7 tokens/s med DFlash. NVFP4-vägen är markant före.
Dessa är SGLangs och Metas publicerade siffror från lanseringsdagen, inte oberoende reproduktioner – den ärliga etiketten är leverantörs- och ramverksrapporterat, och communityverifiering kommer att landa under de kommande veckorna. Men mönstret över de två stackar som meddelade siffror är konsekvent. I llama.cpp rapporterade Meta 74,9 till 233,4 tokens/s på ett RTX 5090 med DFlash, en 3,1x ökning; M5 Max går från 26,6 till 50,2; M4 Max från 23,7 till 37,8. Två olika körtider, två olika mätstilar, samma härad: en 30B-modell som avkodar med över 200 tokens per sekund på en enda konsument-GPU, och DFlash ungefär tredubblar genomströmningen på varje Nvidia-installation som har publicerat siffror.
Varför "servar" spelar större roll än "springer"
Metas hårdvarublogg gör ett skarpare påstående än skrivbordssiffrorna. För NVIDIA Blackwell Ultra — datacenter-generationen, inte skrivbordskortet — citerar bloggen över 20 000 tokens per sekund per GPU vid BF16/NVF4, med både SGLang och vLLM namngivna som stödda open source-stackar. Det är en helt annan liga, och det är tecknet på vad Meta faktiskt bygger: samma vikter är tänkta att köras överallt, från en laptop till ett GPU-serverrack, och servingramverken behandlades som förstklassiga från dag ett, inte som portar som skulle skrivas senare.
Tillförlitlighetsdelen av historien är lika viktig som hastigheten. En lokal agent som dör mitt i en uppgift för att serving-lagret hackade är inte meningsfullt bättre än en molnagent som blev rate-limited. Mekanismerna i day-0-stacken – spekulativ avkodning som kan avbrytas, prefixcachning som håller långa agentkontexter billiga att återuppta, och en drafter som är anpassad till basmodellen – är precis de delar som gör ständigt påslagna lokala agenter överlevnadsdugliga. Detta är den "hastighet och tillförlitlighet" som lanseringen har pekat på, och det är en verklig teknisk position, inte ett marknadsföringsuttryck.

Vad du faktiskt kan göra med det
Muse Glimmer är en tät multimodal modell med 30 miljarder parametrar — text- och bildinmatning genom en frusen perceptions-encoder, textutmatning — tränad på fler än 100 språk, med ett kontextfönster på 131 072 token och en kunskapsgräns den 4 januari 2026. Dess uppdrag är det oglamorösa agentarbetet: funktionsanrop, verktygsanvändning, schema- och filhantering, LLM-som-domare-utvärdering, och flerstegsuppgifter med felåterställning — när ett verktygsanrop misslyckas är modellen tränad att diagnostisera och försöka igen snarare än att stanna. Den exponerar resonemangsinsatsnivåer (låg till xhigh) som du anger i systemprompten, vilket är hur du avväger latens mot djup på samma vikter.
Siffran 230 tokens per sekund är vad som gör allt detta användbart på en enda maskin. Under ungefär 50 tokens/s känns en interaktiv agent som en fjärrfelsökningssession; vid 200-plus känns det som ett lokalt verktyg. Det är hela argumentet för modellen i en enda siffra, och det är anledningen till att hårdvarulistan — RTX 5090, RTX PRO 6000, DGX Spark, MLX Macs — läses som en shoppingguide för den lokala agent-eran snarare än en kompatibilitetsfotnot.
Vad det kostar
Muse Glimmer i sig är gratis – Apache 2.0-vikter på Hugging Face på meta-models/Muse-Glimmer-30B, med GGUF-kvantiseringar redan publicerade för llama.cpp-liknande runtime-miljöer och ingen publik Meta-API. Den verkliga kostnaden är hårdvaran under: en 18GB NVFP4-checkpoint plus den 5GB stora draftern innebär att du vill ha ett 24GB- eller 32GB-kort, eller en högpresterande Mac av M-serien. Om du redan äger det är marginalkostnaden för en ständigt påslagen lokal agent el. Om du inte gör det är GPU:n den stora kostnadsposten, och det är det ärliga sättet att jämföra en "gratis modell" med en värdbaserad API.
När du gör den jämförelsen, prissätt båda sidor rättvist. På OrcaRouter är priset du ser för någon av de över 200 värdbaserade modellerna leverantörens listpris, förmedlat med 0 % påslag, så en prissänkning från leverantören slår igenom här samma dag – vilket håller lokalt-mot-värdbaserat-kalkylen ärlig. Muse Glimmer finns inte på OrcaRouter idag, eftersom ingen inferensleverantör erbjuder den ännu; den levereras som en nedladdning. I samma stund som en leverantör börjar erbjuda den, kommer samma nyckel som når resten av katalogen att nå den, och automatisk redundans är mekanismen som gör det säkert att rikta produktionstrafik mot en helt ny, leverantörsrapporterad modell innan den har en oberoende meritlista.

Den större historien bakom hastigheten
Läs dag-0-arbetet med SGLang som en signal, och releasen slutar vara en enda modell. Muse Glimmer är en destillerad version av Metas proprietära flaggskeppsmodell Muse Spark 1.2, och Meta har sagt att lärarmodellens vikter kommer "inom de kommande veckorna." En lokal 30B-agent med en optimerad serveringsstack, en lärarmodell som är på väg att bli öppen och en communityfond på 1 miljard dollar som tillkännagavs i samband med det — det är inte en punktrelease. Det är den tunna änden av ett open-weight-sortiment som är riktat rakt mot marknaden för lokala agenter, och att ramverksstödet finns tillgängligt från dag ett är det som visar att Meta har för avsikt att människor faktiskt ska köra den, inte bara ladda ner den.
Förbehållet att ha i åtanke: varje hastighets- och benchmarksiffra som hittills kopplats till denna lansering är leverantörs- eller ramverksrapporterad. Genomströmningssiffrorna är konsekventa över två oberoende stackar, vilket är betryggande, men oberoende benchmarktester, en Artificial Analysis-post och reproduktioner i praktiken är vad som kommer att bekräfta historien om 230 tokens per sekund — och de brukar landa inom några veckor efter en lansering som denna.
Vad du ska hålla koll på, i ungefärlig hastighetsordning: Muse Spark 1.2-släppet med öppna vikter (den strategiska tolkningen av ”Meta är tillbaka” beror på det); de första oberoende genomströmningsreproduktionerna på icke-Nvidia-maskinvara, där MLX-vägen är den att hålla koll på; och den första inferensleverantören som sätter upp en Glimmer-endpoint — vilket är ögonblicket då argumenten ”gratis lokal modell” och ”hosted API” slutar vara hypotetiska och blir ett val du kan göra med ett tangenttryck.

