Karta tytułowa hero: „Muse Glimmer — 230 tokenów/s na pojedynczym RTX 5090 — SGLang Day-0", z chipami statystycznymi pokazującymi 30B gęstych otwartych wag, Apache 2.0 i wsparcie SGLang day-0.
Guides & Insights

Muse Glimmer osiąga 230 tokenów/s na pojedynczym RTX 5090: wsparcie Day-0 dla SGLang to prawdziwa historia premiery

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Dwieście trzydzieści tokenów na sekundę to szybki wynik dla każdego modelu. Dla Muse Glimmer — gęstego wydania Meta z 30 miliardami parametrów i otwartymi wagami od Meta Superintelligence Labs, które ukazało się 10 sierpnia 2026 roku na licencji Apache 2.0 — to liczba oddzielająca model, który „działa na moim GPU", od takiego, który „obsługuje prawdziwego agenta". SGLang ogłosiło wsparcie dla Muse Glimmer od dnia premiery, tego samego dnia, w którym opublikowano wagi, a jego opublikowany pomiar na pojedynczym GeForce RTX 5090 wynosi 236,4 tokenów na sekundę na użytkownika przy batchu 1, przy włączonej kwantyzacji NVFP4 i drafterze spekulatywnego dekodowania DFlash od Meta.

Ta jedna liczba niesie większość przekazu tej wersji, ale warto zatrzymać się nad resztą, bo sedno nie tkwi w prędkości z nagłówka. Sedno tkwi w tym, że model działa też od ręki na RTX PRO 6000, na NVIDIA DGX Spark i na Apple silicon przez MLX — a także w tym, że SGLang określa tę pracę mianem współpracy z Meta Superintelligence Labs, a nie społecznościowego dodatku. To pierwszy od dawna model Meta z pogranicza czołówki, zaprojektowany pod stos serwujący, a nie tylko pod wagi.

Co właściwie oznacza tutaj "day-0 support"

Wsparcie Day-0 w SGLang v0.5.17 oznacza, że model nie został doczepiony po fakcie: prace nad środowiskiem wykonawczym trafiły do tego samego okna wydawniczego co wagi, ze specjalnie zaprojektowaną ścieżką dla sprzętu, na który Meta faktycznie celuje. Backend SM120 w SGLang obejmuje linię Blackwell dla komputerów stacjonarnych i stacji roboczych — RTX 5090, RTX PRO 6000 i DGX Spark korzystają z tej samej zoptymalizowanej ścieżki — natomiast Apple silicon otrzymuje natywny backend MLX zamiast wolnego portu.

Stos, do którego dostrojono SGLang i Meta, jest specyficzny. Model działa jako punkt kontrolny NVFP4 o rozmiarze 18 GB w parze z 5 GB dokeratorem BF16 DFlash, który jest modelem towarzyszącym do spekulatywnego dekodowania, wytrenowanym przez Meta dla Muse Glimmer. To połączenie mieści się na karcie 32 GB z zapasem, a cała ścieżka mieszanej kwantyzacji NVFP4-plus-MXFP8 zajmuje około 19,5 GB pamięci rezydentnej. Po stronie SGLang notatki o wydaniu wymieniają trzy mechanizmy niezawodności jako część tej samej historii: spekulatywne dekodowanie DFlash, RadixAttention do buforowania prefiksów oraz przerywalne grafy CUDA.

Liczba oraz to, czym jest, a czym nie jest.

Opublikowane przez SGLang wyniki dla RTX 5090, wszystkie z NVFP4 i ścieżką SM120, przedstawiają się następująco:

• Dekodowanie dla pojedynczego użytkownika (batch 1) — standardowo 63,9 tokenów/s, 236,4 tokenów/s z dekodowaniem spekulatywnym DFlash. Ten 3,7-krotny wzrost to liczba interaktywna, ta, która decyduje, czy lokalny agent przypomina rozmowę, czy kolejkę.

• Łączna wydajność (partia 8) — 501 tokenów/s standardowo, 1 452 tokenów/s z DFlash. To jest liczba przepustowości dla lokalnego serwera obsługującego kilka żądań jednocześnie.

• Dla porównania, GGUF q4_k_m na tym samym GPU — ścieżka, z której większość osób będzie korzystać w środowiskach uruchomieniowych w stylu llama.cpp — osiąga 72,6 tokens/s standardowo i 140,7 tokens/s z DFlash. Ścieżka NVFP4 jest znacząco szybsza.

To są dane opublikowane przez SGLang i Meta z dnia premiery, nie niezależne reprodukcje — uczciwa etykieta to: raportowane przez dostawcę i framework, a weryfikacja społeczności pojawi się w nadchodzących tygodniach. Ale wzorzec w obu stosach technologicznych, które opublikowały liczby, jest spójny. W llama.cpp Meta podała od 74,9 do 233,4 tokenów/s na RTX 5090 z DFlash, czyli 3,1-krotny wzrost; M5 Max: od 26,6 do 50,2; M4 Max: od 23,7 do 37,8. Dwa różne środowiska uruchomieniowe, dwa różne style pomiarów, ten sam rząd wielkości: model 30B dekodujący z szybkością ponad 200 tokenów na sekundę na pojedynczym konsumenckim GPU, a DFlash mniej więcej potraja przepustowość na każdym zestawieniu Nvidia, które opublikowało liczby.

Dlaczego "serves" ma większe znaczenie niż "runs"

Blog sprzętowy Meta formułuje śmielsze twierdzenie niż liczby dla komputerów stacjonarnych. W przypadku NVIDIA Blackwell Ultra — generacji dla centrów danych, nie karty do komputerów stacjonarnych — blog podaje ponad 20 000 tokenów na sekundę na GPU przy BF16/NVF4, wymieniając SGLang i vLLM jako wspierane stacki open-source. To zupełnie inna liga i to jest sygnał tego, co Meta faktycznie buduje: te same wagi mają działać wszędzie — od laptopa po rack z serwerami GPU — a frameworki serwujące były traktowane jako pierwszorzędne od pierwszego dnia, a nie jako porty, które trzeba będzie napisać później.

Niezawodność jest drugą połową tej historii i liczy się tak samo jak szybkość. Lokalny agent, który pada w trakcie zadania, bo warstwa serwująca się zacięła, nie jest znacząco lepszy od chmurowego agenta, który natrafił na limit żądań. Mechanizmy w stosie day-0 — przerywalne dekodowanie spekulatywne, buforowanie prefiksów sprawiające, że ponowne wejście w długie konteksty agentów jest tanie, oraz drafter dostrojony do modelu bazowego — to dokładnie te elementy, dzięki którym stale działające lokalne agenty mogą przetrwać. To właśnie ta „szybkość i niezawodność”, na którą wskazuje premiera, i jest to realne stanowisko inżynieryjne, a nie frazes marketingowy.

A single-model speed board for Muse Glimmer: batch-1 decode 63.9 to 236.4 tok/s with DFlash, batch-8 output 501 to 1,452 tok/s, GGUF q4_k_m 72.6 to 140.7 tok/s, 128K context window, 18GB checkpoint plus 5GB drafter, runs on RTX 5090, RTX PRO 6000, DGX Spark and Mac. Footer: SGLang/NVIDIA-reported, launch day.

Co właściwie możesz z tym zrobić

Muse Glimmer to gęsty, multimodalny model 30B — przetwarza tekst i obrazy przez zamrożony enkoder percepcji, generuje tekst — trenowany na ponad 100 językach, z oknem kontekstowym 131,072 tokenów i granicą wiedzy na 4 stycznia 2026. Jego zadaniem jest niepozorna praca agenta: wywoływanie funkcji, używanie narzędzi, zarządzanie harmonogramem i plikami, ocena LLM-jako-sędzia oraz zadania wieloetapowe z odzyskiwaniem po błędach — gdy wywołanie narzędzia zawiedzie, model jest szkolony, aby diagnozować problem i ponawiać próbę, zamiast się zatrzymywać. Udostępnia poziomy wysiłku rozumowania (od low do xhigh), które ustawiasz w promptcie systemowym — to właśnie w ten sposób wymieniasz opóźnienie na głębię przy tych samych wagach.

Wartość 230 tokenów na sekundę sprawia, że wszystko to działa na jednej maszynie. Poniżej mniej więcej 50 tokenów/s interaktywny agent przypomina zdalną sesję debugowania; przy 200 i więcej – lokalne narzędzie. To cały argument za tym modelem w jednej liczbie i powód, dla którego lista sprzętu — RTX 5090, RTX PRO 6000, DGX Spark, MLX Macs — brzmi jak przewodnik zakupowy dla ery lokalnych agentów, a nie przypis o kompatybilności.

Ile to kosztuje

Sam Muse Glimmer jest darmowy — wagi na licencji Apache 2.0 na Hugging Face pod adresem meta-models/Muse-Glimmer-30B, z opublikowanymi już kwantyzacjami GGUF dla środowisk typu llama.cpp i bez publicznego API Meta. Prawdziwy koszt to sprzęt pod spodem: checkpoint NVFP4 o wielkości 18 GB plus 5 GB na drafter oznacza, że potrzebujesz karty graficznej z 24 GB lub 32 GB pamięci albo wysokiej klasy Maca z serii M. Jeśli już to masz, koszt krańcowy zawsze włączonego lokalnego agenta to prąd. Jeśli nie, to karta GPU jest pozycją w budżecie i to jest uczciwy sposób porównania „darmowego modelu” z hostowanym API.

Kiedy już dokonasz tego porównania, wyceń obie strony sprawiedliwie. W OrcaRouter cena, którą widzisz dla któregokolwiek z ponad 200 hostowanych modeli, to cena katalogowa dostawcy przekazana z 0% marżą, więc obniżka ceny dostawcy jest tu widoczna tego samego dnia — co sprawia, że arytmetyka porównania rozwiązania lokalnego z hostowanym pozostaje uczciwa. Sam Muse Glimmer nie jest dziś dostępny na OrcaRouter, ponieważ żaden dostawca inferencji jeszcze go nie udostępnia; jest dystrybuowany jako plik do pobrania. W momencie, gdy dostawca zacznie go udostępniać, ten sam klucz, który dociera do reszty katalogu, dotrze również do niego, a automatyczne przełączanie awaryjne to mechanizm, który sprawia, że bezpieczne jest skierowanie ruchu produkcyjnego na zupełnie nowy model zgłoszony przez dostawcę, zanim będzie miał on niezależną historię działania.

Screenshot of the NVIDIA Developer blog 'Run Local AI Agentic Workflows with Meta's Muse Glimmer', describing the 30B open-weight dense model with a 120K+ context window and quoting 20K tokens/sec on a single GPU for always-on local agents.

Większa historia kryjąca się za prędkością

Potraktuj {{1}}prace nad SGLang w dniu zero{{/1}} jako {{2}}sygnał{{/2}}, a wydanie przestaje być pojedynczym modelem. {{3}}Muse Glimmer to destylowana wersja autorskiego flagowego modelu Meta, Muse Spark 1.2{{/3}}, a Meta zapowiedziała, że wagi modelu nauczycielskiego pojawią się {{4}}„w nadchodzących tygodniach.”{{/4}} {{5}}Lokalny agent 30B z dostrojoną warstwą serwującą{{/5}}, {{6}}model nauczycielski, który wkrótce ma zostać otwarty{{/6}}, {{7}}i ogłoszony przy tej okazji fundusz społecznościowy o wartości miliarda dolarów{{/7}} — {{8}}to nie jest wydanie punktowe.{{/8}} {{9}}To dopiero początek linii modeli o otwartych wagach, wycelowanej bezpośrednio w rynek lokalnych agentów{{/9}}, a {{10}}wsparcie w frameworkach dostępne od pierwszego dnia{{/10}} to element, który pokazuje, że Meta naprawdę chce, aby ludzie go uruchamiali, a nie tylko pobierali.

Zastrzeżenie, które należy mieć na uwadze: wszystkie liczby dotyczące szybkości i benchmarków związane z tą premierą pochodzą dotychczas od dostawców lub frameworków. Wyniki przepustowości są spójne w dwóch niezależnych środowiskach, co jest uspokajające, ale to niezależne testy benchmarkowe, wpis w Artificial Analysis i reprodukcje w rzeczywistych warunkach potwierdzą historię 230 tokenów na sekundę — a te zwykle pojawiają się w ciągu kilku tygodni po takiej premierze.

Na co warto zwrócić uwagę, w przybliżonej kolejności pod względem szybkości: premiera otwartych wag modelu Muse Spark 1.2 (od tego zależy strategiczna interpretacja hasła «Meta wróciła»); pierwsze niezależne reprodukcje pomiarów przepustowości na sprzęcie spoza Nvidii, gdzie ścieżka MLX jest tą, którą warto śledzić; oraz pierwszy dostawca inferencji, który uruchomi endpoint Glimmer — co jest momentem, w którym argumenty o «darmowym modelu lokalnym» i «hostowanym API» przestają być hipotetyczne, a stają się wyborem, którego możesz dokonać jednym naciśnięciem klawisza.

Screenshot of the Hugging Face model card for meta-models/Muse-Glimmer-30B, showing the Apache 2.0 license, 30B parameter size, Meta Superintelligence Lab authorship, and the model's purpose-built local-agentic description.
© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube