Plansza tytułowa Muse Glimmer: model agentowy Meta o otwartych wagach (30B) dla lokalnych GPU, z plakietkami: Apache 2.0, mieści się na GPU 24–32 GB, destylowany z Muse Spark 1.2.
Guides & Insights

Muse Glimmer: model agentowy Meta o otwartych wagach 30B twierdzi, że bije Gemma4-31B i Qwen3.6-27B

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Jeden post na X rankiem 10 sierpnia 2026 r. ujął to dosadniej niż jakikolwiek komunikat prasowy: „Święta meta wróciła”. Premiera, na którą ten post reagował — Muse Glimmer, pierwszy model Meta o otwartych wagach od czasu Llama 4 — ukazała się tego samego dnia, a samo ogłoszenie Meta jest niemal tak samo agresywne jak tweet. Tabela benchmarków modelu o 30 miliardach parametrów twierdzi, że pokonuje on Gemmę4-31B od Google w 19 z 24 wierszy i Qwena3.6-27B od Alibaby w 14 z 24, na czele z agentowym benchmarkiem MCP-Atlas, gdzie Meta raportuje 75,5 wobec 54,2 i 62,5 odpowiednio.

Zanim „smoked” stanie się faktem w twojej głowie, zwróć uwagę, kto wyprodukował te liczby. Każdy wynik w tabeli Meta został uzyskany przez samo Meta, w starciu z konkurencyjnymi modelami, których konfiguracji Meta nie dostroiła — co sama przyznała. Muse Glimmer nie ma jeszcze wpisu na Artificial Analysis, niezależnym rankingu, który faktycznie śledzi tę dokładną klasę rozmiarów — gdzie Qwen3.6-27B obecnie utrzymuje Intelligence Index na poziomie 46, a Gemma4-31B plasuje się na 39. Mamy więc do czynienia z dwiema historiami naraz: z naprawdę znaczącym wydaniem modelu open-weight od Meta oraz z twierdzeniem benchmarkowym, którego weryfikacja zajmie tygodnie. Ten artykuł trzyma je osobno.

Czym tak naprawdę jest Muse Glimmer

Muse Glimmer to gęsty model multimodalny o 30B parametrów — z wejściem tekstowym i obrazowym przez dedykowany enkoder percepcji — wytrenowany na ponad 100 językach i wydany na permisywnej licencji Apache 2.0. Jego wagi są dostępne na Hugging Face pod adresem meta-models/Muse-Glimmer-30B. To zdystylowana wersja większego, autorskiego flagowca Meta, Muse Spark 1.2, a receptura treningowa o tym świadczy: destylacja logitów od nauczyciela w pre-treningu, mid-trening na danych o dłuższym kontekście, obfitujących w agentów, a następnie nadzorowane dostrajanie połączone z destylacją on-policy i uczeniem przez wzmacnianie.

Opis produktu jest równie konkretny, co technologia. Meta zbudowała Glimmera z myślą o „zawsze aktywnych lokalnych przepływach pracy agentów" — agencie, który mieszka na Twojej maszynie, potrafi wywoływać narzędzia, realizować wieloetapowe plany, odzyskiwać sprawność po nieudanym wywołaniu narzędzia zamiast się zatrzymywać oraz zwiększać lub zmniejszać poziom wysiłku rozumowania. Przewidziane zadania to te nieefektowne: lokalne kodowanie, wywoływanie funkcji, zarządzanie harmonogramem, organizacja plików, ocena LLM-jako-sędzia. Jest zgodny z frameworkami orkiestracji agentów, takimi jak OpenClaw, i to właśnie w ten sposób wiele osób będzie go faktycznie uruchamiać.

Historia sprzętu to druga połowa tej opowieści. Przy pełnej precyzji model 30B potrzebuje ponad 55 GB pamięci; kwantyzacja Meta na ~4 bity zmniejsza to do około 17–20 GB, co mieści się na konsumenckiej karcie 24 GB lub 32 GB (punktem odniesienia jest RTX 5090) oraz w wysokiej klasy Macach z pamięcią zunifikowaną. Drafter do dekodowania spekulacyjnego — mały model towarzyszący, który Meta nazywa DFlash — przyspiesza generowanie: Meta podaje około 3.1x na RTX 5090 (z 74.9 do 233 tokenów/sek w llama.cpp), 1.8x na M5 Max i 1.5x na M4 Max, gdzie pamięć zunifikowana jest już mniej ograniczona przepustowością.

Dlaczego to wydanie ma znaczenie wykraczające poza kartę specyfikacji

Tweet w prawidłowy sposób uchwycił kształt tej sytuacji. Od czasu wypuszczenia Llama 4 wiosną 2025 roku Meta zamilkła w kwestii otwartych wag, wycofując się na linię własnościowych modeli granicznych w ramach Meta Superintelligence Labs, pod kierownictwem dyrektora ds. AI Alexandr Wanga. Muse Glimmer to publiczny powrót do strategii otwartych wag, która uczyniła Llamę najczęściej pobieraną rodziną modeli w AI – a jego premiera została opakowana w najsilniejszy dotąd sygnał intencji: Zuckerberg opublikował 14-stronicowy esej „The Future is for Everyone” (Przyszłość należy do wszystkich), towarzyszący premierze, argumentując, że prawdziwym ryzykiem AI jest skoncentrowana kontrola, a otwarte wagi to sposób, w jaki Ameryka pozostaje konkurencyjna wobec chińskich laboratoriów rozwijających otwarte modele. Wezwał też do złagodzenia amerykańskich regulacji dotyczących open-source’owej AI, a Meta ogłosiła utworzenie funduszu „Future is for Everyone Fund” o wartości 1 miliarda dolarów. Meta zapowiedziała również, że „w nadchodzących tygodniach” udostępni wagi znacznie większego modelu Muse Spark 1.2.

Ten kontekst zmienia sposób, w jaki należy czytać tabelę benchmarków. To nie jest ciekawostka z laboratorium badawczego wydana po cichu; to deklaracja strategiczna z dołączonym modelem. Glimmer zajmuje pozycję „taniego lokalnego agenta” w ofercie Meta, celowo podważając argument, że poważna praca agentowa wymaga chmurowego API. To, czy faktycznie to zapewnia, to dokładnie sedno kwestii weryfikacji.

Three-way scoreboard comparing Muse Glimmer, Gemma4-31B and Qwen3.6-27B: MCP-Atlas 75.5/54.2/62.5, DeepSearch QA 74.6/61.7/71.1, GAIA2 43.3/36.4/40.0, SWE-Bench Pro 51.2/36.9/50.2, TerminalBench 2.1 51.7/--/60.7, and AA Intelligence Index --/39/46. Footer: rows 1-5 vendor-reported by Meta; AA Index per Artificial Analysis (no Muse Glimmer entry yet).

Twierdzenie o „wędzeniu”, wiersz po wierszu

Tabela Meta porównuje Muse Glimmer z Gemma4-31B i Qwen3.6-27B w 24 wierszach benchmarków. Tam, gdzie deklaruje największe przewagi, wzorzec jest spójny: ogólne rozumowanie agentowe i wyszukiwanie.

• MCP-Atlas (agentowe użycie narzędzi) — Muse Glimmer 75.5, Gemma4-31B 54.2, Qwen3.6-27B 62.5. To jest wiersz nagłówkowy i największa rozbieżność w zestawie.

• DeepSearch QA — 74.6 w porównaniu z 61.7 i 71.1.

• GAIA2 (asystent ogólnego przeznaczenia) — 43.3 wobec 36.4 i 40.0.

• WildClawBench (zestaw agentowy) — 47.6 wobec 37.6 i 43.2.

• SWE-Bench Pro — 51,2 wobec 36,9 i 50,2. Zwróć uwagę na trzecią liczbę: 50,2 to własny pomiar Meta dla Qwen3.6-27B, podczas gdy opublikowana przez Alibabę wartość to 53,5. Ten sam model, dwa różne wyniki w zależności od tego, kto go testował.

• AIME 2026 — 94.7, IFBench 77.0 oraz AA-LCR 80.0 wobec 68.3 Ge​mmy.

To jest mocny wiersz. Ale tabela nie jest kompletnym zwycięstwem, a wiersze, w których Muse Glimmer przegrywa, są równie pouczające jak te, w których wygrywa. Qwen3.6-27B utrzymuje pozycję lidera w praktycznym korzystaniu z komputera i pracy wymagającej terminala: SWE-Bench Verified 77,2 wobec 76,0 Glimmera, OSWorld-Verified 75,6 wobec 65,9 oraz TerminalBench 2.1 60,7 wobec 51,7, a także stałą przewagę w testach multimodalnych, takich jak ScreenSpot Pro, OmniDocBench i MMMU-Pro. Gemma4-31B z kolei ma lepszy bilans bezpieczeństwa w dwóch wskaźnikach raportowanych przez Meta — najniższy wskaźnik naruszeń w CI Memories i najniższy wskaźnik skuteczności ataków w Siren AgentDojo — oraz minimalnie wygrywa w wąskich testach rozumowania (GPQA Diamond, Humanity's Last Exam).

Czytając dosłownie, twierdzenie Meta, że „pokonuje pozostałe dwa w większości benchmarków agentowych”, w jego własnej tabeli jest mniej więcej prawdziwe. Sednem sprawy są zastrzeżenia. Meta samodzielnie uruchomiła każdy wiersz i przyznała, że jej konfiguracje testowe dla konkurencyjnych modeli nie były dostrojone tak, jak jej własna. Nie jest to zarzut oszustwa — niedostrojone konfiguracje rywali to rutynowy, wręcz oczekiwany grzech w tej branży — ale to właśnie dlatego tabele tworzone przez dostawców wymagają niezależnego potwierdzenia. Opisana powyżej rozbieżność Q​wen SWE-Bench Pro to cały problem w miniaturze.

Co mówi niezależna tablica wyników

Artificial Analysis nie ma jeszcze na liście Muse Glimmer — model ma zaledwie kilka dni, a indeks AA opiera się na własnych testach, które wymagają czasu. AA śledzi jednak obu rywali, co daje zmierzony obraz konkurencji, do której według nowicjusza dołącza. Według aktualnego indeksu Qwen3.6-27B osiąga wskaźnik inteligencji 46 i jest opisywany przez AA jako najbardziej inteligentny model o otwartych wagach poniżej 150 miliardów parametrów; Gemma4-31B plasuje się na poziomie 39. To niezależne liczby, a nie deklaracje producentów.

Niezależny obraz pokazuje również kosztowny szczegół, który ukrywają nagłówkowe liczby. Dane wydajnościowe AA pokazują, że Qwen3.6-27B generuje około 54,6 tokena/sek w porównaniu z 34,8 dla Gemma4-31B, przy czym czas do pierwszego tokena Ge​mmy jest krótszy — ale Q​wen używa około 3,7 razy więcej tokenów wyjściowych do przetworzenia pełnego indeksu, co czyni go około 21 razy droższym w ocenie end-to-end. Modele wymagające dużej liczby tokenów są w realnym świecie droższe, nawet gdy ich wyniki w benchmarkach są lepsze, a to jest czynnik decyzyjny, którego żadna tabela dostawcy nie ujawni z własnej woli.

Zatem prawdziwy stan rzeczy w chwili pisania tego tekstu jest następujący: silny wynik raportowany przez dostawcę, brak jakiegokolwiek niezależnego wyniku dla Muse Glimmer, oraz konkurencyjne pole, które jest mierzone niezależnie i podzielone według zadań. „Rozgromił Gemmę i Qwena” to twierdzenie w dobrej wierze; nie jest jeszcze zweryfikowanym rezultatem. Markerami weryfikacji, na które należy zwracać uwagę, są wpis w indeksie AA, LMArena Elo oraz reprodukcje przez społeczność — wszystkie zazwyczaj pojawiają się w ciągu kilku tygodni od premiery takiej jak ta.

Screenshot of Artificial Analysis' Small Open Source Models comparison page, showing the 4B-40B open-weight class with Openness and Intelligence index columns and the header noting that Qwen3.6-27B and Qwen3.5-27B are the highest-intelligence small open-source models.

Ile to faktycznie kosztuje

Muse Glimmer jest darmowy — na licencji Apache 2.0, bez opłat za token, bez płatności na rzecz Meta. Kosztem jest sprzęt, na którym go uruchamiasz. Model 30B w precyzji 4-bitowej wymaga około 17–20 GB pamięci rezydentnej oraz miejsca na pamięć podręczną KV, enkoder percepcji i model pomocniczy DFlash, dlatego własne zalecenia Meta to karta graficzna 24 GB lub 32 GB albo wysokiej klasy Mac. Jeśli posiadasz taki sprzęt, koszt krańcowy uruchomienia stale działającego agenta lokalnego to w zasadzie energia elektryczna. Jeśli nie — karta GPU 24 GB lub Mac z maksymalną konfiguracją z serii M to realna pozycja w budżecie. A od 9 sierpnia istnieje trzecia opcja: wynajem. Pierwsze oferty hostowanego API, dostępne od tego dnia, wyceniają Muse Glimmer na 0,35 USD za milion tokenów wejściowych i 1,50 USD za milion tokenów wyjściowych przy oknie kontekstowym 131K. To stawka rynkowa podana przez dostawcę, a nie cena Meta, ale jest to kwota, którą faktycznie możesz zapłacić dziś, jeśli wolisz nie kupować sprzętu.

To porównanie warto przeprowadzić starannie, ponieważ „otwarte wagi, zerowa cena” spotyka się z „hostowanym API, ceną za token” na bardzo różnych zasadach. Gdy policzysz liczby, wyceń obie strony uczciwie. Po naszej stronie w OrcaRouter cena, którą widzisz dla każdego z ponad 200 hostowanych modeli, to cena listowa dostawcy przekazywana dalej z 0% marżą, więc obniżka ceny od dostawcy jest tu widoczna tego samego dnia, a nie po ponownym przeliczeniu marży — co czyni porównanie lokalnych i hostowanych modeli prostym. Sam Muse Glimmer nie jest jeszcze jednym z tych ponad 200 modeli, więc ten mechanizm przekazywania ceny nie ma dziś do niego zastosowania. Ale sedno tkwi w dyscyplinie: sposób na wycenę niezweryfikowanego modelu o otwartych wagach to twój własny ruch, a nie tabela dostawcy, a routing DSL istnieje po to, by przeprowadzić dokładnie to porównanie, gdy model znajdzie się za API, które możesz wywołać.

Jak faktycznie użyłbyś tego w tym tygodniu

Ponieważ model jest udostępniany jako otwarte wagi, „dostęp” nie oznacza rejestracji — to pobranie. Podstawowe repozytorium to meta-models/Muse-Glimmer-30B na Hugging Face, z już opublikowanym wariantem GGUF i wariantami kwantyzacji pojawiającymi się od stron trzecich. Wsparcie w dniu premiery obejmowało llama.cpp, MLX i ExecuTorch, a integracje z Ollama, LM Studio, vLLM i SGLang pojawiły się w ciągu kilku dni po wydaniu, natomiast prace nad optymalizacją sprzętową wymieniono dla AMD, Arm, Dell, Intel i Nvidia. Praktyczna ścieżka dla większości osób to: pobierz GGUF, załaduj go w llama.cpp lub lokalnym runnerze, wskaż mu szkielet agenta. Meta nie udostępnia publicznego API dla samego Glimmera, a ścieżka lokalna jest tą, wokół której zbudowano model — ale ścieżka hostowana nie jest już hipotetyczna: platformy stron trzecich zaczęły go udostępniać 9 sierpnia, więc zarówno „pobierz i uruchom”, jak i „wywołaj API” są teraz dostępnymi opcjami.

Jedna szczera uwaga dotycząca nas bezpośrednio: Muse Glimmer wciąż nie jest dostępny przez OrcaRouter. Routujemy hostowane API i od tej aktualizacji model nie trafił jeszcze do naszego katalogu — 0% narzutu i jeden klucz do wszystkiego dotyczą ponad 200 modeli, które routujemy, a ten nie jest jeszcze jednym z nich. Gdy to nastąpi, ten sam klucz, który dociera do reszty katalogu, dociera i do niego bez nowej umowy, a automatyczne przełączanie awaryjne jest mechanizmem, który sprawia, że bezpieczne jest skierowanie prawdziwego ruchu na zupełnie nowy model zgłoszony przez dostawcę, zanim zyska on niezależną historię działania. Z tego samego powodu istnieje DSL routingu: nieudowodniony model powinien zapracować na produkcyjną ścieżkę na Twoich danych, a nie na własnym komunikacie prasowym.

Poniższy zrzut ekranu to karta Hugging Face w takiej formie, w jakiej widniała w dniu premiery — jej linia „not deployed by any inference provider" odnosi się do autorskiej usługi inferencji pierwszego producenta Hugging Face, która jest czymś odrębnym od wykazów hostowanych interfejsów API stron trzecich, które zostały opublikowane 9 sierpnia.

Screenshot of the Hugging Face model card for meta-models/Muse-Glimmer-30B, showing the Apache 2.0 license, 30B parameter size, Meta Superintelligence Lab authorship, and the line that the model is not deployed by any inference provider.

Co obejrzeć

{{1}}Trzy rzeczy rozstrzygną tę historię, w przybliżonej kolejności szybkości. Po pierwsze, obiecane wydanie Muse Spark 1.2 z otwartymi wagami — jeśli nauczyciel pojawi się w „nadchodzących tygodniach", Glimmer przestaje być jednorazowym wydarzeniem i staje się cienkim końcem pełnej linii otwartych wag, co jest prawdziwym strategicznym odczytaniem tego, że „Meta wróciła".{{/1}} {{2}}Po drugie, niezależny pomiar: wpis w indeksie Artificial Analysis, pozycja na LMArena i społecznościowe reprodukcje pokażą, czy twierdzenie o wyniku 19 z 24 przetrwa kontakt z kimś, kto nie jest Metą.{{/2}} {{3}}Po trzecie, fala hostingu — ta już się zaczęła. Dostawcy zaczęli udostępniać Glimmer 9 sierpnia, więc pytanie o wersję lokalną kontra hostowaną to teraz realny wybór, którego można dokonać za pomocą jednego klucza API; pozostaje obserwować, jak szeroko rozprzestrzeni się hosting i co stanie się z ceną za token, gdy minie nowość pierwszego tygodnia po premierze.{{/3}}

Tweet miał rację co do wiadomości. Czy miał rację co do werdyktu — to pytanie, na które odpowiedź poznamy za wiele tygodni, a uczciwe stanowisko w tej chwili jest takie, że nikt poza Metą nie przeprowadził wystarczającej liczby testów, by to wiedzieć. To, co już jest pewne, to fakt, że model agentowy 30B na licencji Apache-2.0, który mieści się na konsumenckim GPU i jest wspierany przez pełne działania strategiczne, to wydanie, wokół którego warto planować, niezależnie od tego, jakie będą jego niezależne wyniki.

Pytania, na które naprawdę warto odpowiedzieć

Czy Muse Glimmer jest naprawdę open source?

To model o otwartych wagach na liberalnej licencji Apache 2.0 — każdy może go pobrać, modyfikować, dostrajać i wdrażać komercyjnie bez płacenia Meta. Celowe jest sformułowanie „open weights”, a nie w pełni otwarte źródła w rozumieniu OSI, ponieważ dane treningowe, wagi nauczyciela Muse Spark i część narzędzi nie są dołączone. Dla praktycznych celów — możesz go uruchomić, dostarczać i sprzedawać produkt zbudowany na jego bazie — to ten sam układ, który uczynił Llamę najszerzej wdrażaną otwartą rodziną modeli w AI.

Czy Muse Glimmer naprawdę pokonuje Gemma4-31B i Qwen3.6-27B?

{{1}}Na własnym zestawieniu Meta{{/1}}, {{2}}tak, w większości benchmarków agentowych i wyszukiwania{{/2}}, {{3}}z zastrzeżeniem, że Meta sama przeprowadziła porównanie i nie dostroiła konfiguracji rywali{{/3}}. {{4}}Rzetelny obraz jest bardziej konkretny: Meta wygrywa w wierszach rozumowania agentowego{{/4}}, {{5}}Qwen3.6-27B wygrywa w praktycznej obsłudze komputera i pracy w terminalu oraz w większości testów multimodalnych{{/5}}, {{6}}a Gemma4-31B notuje lepszy bilans bezpieczeństwa{{/6}}. {{7}}Na dzień premiery nie ma żadnego niezależnego wpisu w indeksie dla Muse Glimmer{{/7}}, {{8}}więc traktuj twierdzenie o wyniku 19 na 24 jako deklarację producenta, dopóki ktoś inny nie przeprowadzi tych testów{{/8}}.

Czy mogę to uruchomić na laptopie?

Tylko jeśli „laptop” oznacza model z dedykowanym GPU o pojemności 24–32 GB albo wysokiej klasy Maca z układami z serii M i wystarczającą pamięcią unifikowaną — 4-bitowy Muse Glimmer potrzebuje mniej więcej 17–20 GB plus zapasu na pamięć podręczną KV, enkoder percepcji i DFlash drafter. To realny wydatek dla większości ludzi i ukryty koszt „darmowego” modelu. Na zintegrowanej grafice lub maszynie z 16 GB spotkasz się z mocną kwantyzacją i wolnym generowaniem, a nie z zawsze aktywnym agentem, wokół którego zbudowano to wydanie.

Skąd to wziąć — czy jest dostępne przez API?

Wagi są na Hugging Face pod adresem meta-models/Muse-Glimmer-30B (z wariantem GGUF), a można je uruchamiać lokalnie przez llama.cpp, MLX, ExecuTorch lub lokalne narzędzia, które już je integrują. Dostęp do hostowanego API jest również aktywny od 9 sierpnia za pośrednictwem platform zewnętrznych w cenie 0,35 USD za milion tokenów wejściowych i 1,50 USD za milion tokenów wyjściowych — więc nie musisz już posiadać karty GPU z 24 GB, aby z niego korzystać. Sama Meta nadal nie udostępnia publicznego API dla Glimmer i nie ma go też jeszcze w OrcaRouter. Gdy pojawi się w naszym katalogu, ten sam klucz, który obsługuje resztę katalogu, będzie go obsługiwał; do tego czasu dwie uczciwe ścieżki to inferencja lokalna lub platforma zewnętrzna.

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

Skontaktuj się z nami

Dołącz do społeczności

DiscordEmailXGitHubYouTube