Wygenerowana karta główna zatytułowana „Step 5 Preview vs Muse Glimmer – API i laptop”. Lewa karta „Step 5 Preview” zawiera: AA Index 44 wobec mediany w klasie wynoszącej 26, StepFun, ogłoszony 20 września 2026, około 600 mld łącznie / 27 mld aktywnych parametrów, kontekst 1 mln tokenów, 1,00 USD za wejście / 2,70 USD za wyjście za 1 mln tokenów, działa na serwerach dostawcy. Prawa karta „Muse Glimmer” zawiera: AA Index 17, Meta Superintelligence Labs, wydany 10 sierpnia 2026, 30 mld parametrów w 4 bitach poniżej 20 GB, kontekst 131 tys. tokenów rozszerzalny do 262 tys., Apache 2.0, działa offline na własnym GPU. Stopka brzmi: „Wartości indeksu według Artificial Analysis; specyfikacje Muse Glimmer według Meta.”
Guides & Insights

Step 5 Preview vs Muse Glimmer: Frontier API i model laptopa

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Na liście rankingowej, Step 5 Preview i Muse Glimmer nie są blisko siebie: 44 przeciw 17 w Artificial Analysis Intelligence Index — różnica dwudziestu siedmiu punktów w skali, w której obecny lider plasuje się w wysokich pięćdziesiątkach — której nie zniweluje żadne dostrajanie. W kwestii, na którą zespół faktycznie musi odpowiedzieć — gdzie uruchamiane są moje tokeny — są bezpośrednimi konkurentami. Step 5 Preview to flagowy model StepFun, ogłoszony 20 września 2026 r., około 600 miliardów parametrów całkowitych, z czego 27 miliardów aktywnych, kontekst 1 mln tokenów, w cenie 1,00 USD za milion tokenów wejściowych i 2,70 USD za milion tokenów wyjściowych, osiągalny wyłącznie przez sieć. Muse Glimmer to 30-miliardowy model agentowy z otwartymi wagami należący do Meta Superintelligence Labs, wydany 10 sierpnia 2026 r. na licencji Apache 2.0, dostarczany w wersji skwantyzowanej do 4 bitów, dzięki czemu mieści się w mniej niż 20 GB pamięci i działa na pojedynczym GPU klasy konsumenckiej przy odłączonej sieci. Właściwy sposób czytania tego zestawienia to nie „który jest mądrzejszy”. To „które z dwóch ograniczeń — możliwości czy perymetr — jest tym, którego nie może przesunąć twoje obciążenie”.

To porównanie jest również użyteczną korektą pewnego nawyku, jaki ten rynek nabrał: traktowania zagregowanego wyniku indeksu jako całej wartości modelu. Dwudziestosiedmiopunktowa różnica jest realna i nie jest jedyną liczbą w pliku. W zakresie wyszukiwania w długim kontekście ten sam niezależny panel stawia Muse Glimmer w granicach pół punktu od modeli z otwartymi wagami należących do znacznie większej klasy wagowej, a własne benchmarki agentowe Meta są przyzwoite jak na model działający na laptopie. Tymczasem najczęściej wskazywaną słabością Step 5 Preview nie jest wcale zdolność, lecz gadatliwość, a model pozostaje zamknięty, dopóki 15 października nie pojawią się jego obiecane wagi.

Dwa modele, dwa całkowicie różne obiekty

Step 5 Preview to system typu mixture-of-experts udostępniany z infrastruktury StepFun: około 600 mld parametrów łącznie, 27 mld aktywnych na token, wejście tekstowe i obrazowe, okno kontekstu o długości 1 mln tokenów oraz niezależny wynik Intelligence Index wynoszący 44 wobec mediany 26 dla porównywalnych modeli. Jego generowanie odbywa się z szybkością 87 tokenów na sekundę wobec średniej 78 w pomiarze tego samego rankingu, a w całym zestawie zadań indeksu model wygenerował około 160 mln tokenów wyjściowych, podczas gdy model medianowy emituje około 82 mln — czyli mniej więcej dwukrotnie więcej tekstu na jednostkę pracy, rozliczane po 2,70 USD za milion. Wagi BF16 obiecano na 15 października 2026 r. i nie ma ich jeszcze w repozytorium, więc dziś model istnieje dla Ciebie wyłącznie jako API.

Muse Glimmer jest przeciwieństwem. To model o 30 mld parametrów wytrenowany metodą destylacji logitów z większego nauczyciela Muse Spark od Meta, a następnie dostrojony na danych agentowych o długim kontekście i wzmocniony pod kątem korzystania z narzędzi. Meta dostarcza go skwantyzowanego do 4 bitów, co zmniejsza zapotrzebowanie na pamięć z ponad 55 GB przy pełnej precyzji do poniżej 20 GB — mieszcząc się w ramach 24 GB lub 32 GB VRAM — i został przetestowany przez Meta na Nvidia RTX 5090 oraz na układach Apple M4 Max i M5 Max. Przyjmuje dane wejściowe tekstowe i obrazowe w ponad stu językach, obsługuje kontekst 131 072 tokenów rozszerzalny do 262 144 i został zaprojektowany tak, aby przyjąć cel, podzielić go na kroki, wywoływać narzędzia i ponawiać nieudane wywołanie zamiast się zatrzymywać. Jest objęty licencją Apache 2.0 i działa w trybie offline.

• Niezależny wynik — Step 5 Preview: 44 wobec mediany 26 w swojej klasie vs Muse Glimmer: 17 w tym samym indeksie w swojej wysokiej konfiguracji.

• Skala — Step 5 Preview: około 600 mld łącznie, 27 mld aktywnych według StepFun vs Muse Glimmer: 30 mld łącznie, skwantyzowany do 4 bitów poniżej 20 GB.

• Okno kontekstowe — Step 5 Preview: 1 mln tokenów vs Muse Glimmer: 131 072 z możliwością rozszerzenia do 262 144, według Meta.

• Cena — Step 5 Preview: $1.00 za wejście / $2.70 za wyjście za milion tokenów, cena publikowana kontra Muse Glimmer: brak opłaty za token; GPU zapewniasz we własnym zakresie.

• Gdzie działa — Step 5 Preview: serwery dostawcy, przez HTTP vs Muse Glimmer: własny sprzęt, offline.

• Licencja — Step 5 Preview: zamknięta wersja zapoznawcza, wagi obiecane na 15 października 2026 vs Muse Glimmer: Apache 2.0, dostępne do pobrania teraz.

• Wyszukiwanie w długim kontekście — Muse Glimmer uzyskuje wynik 80,0 w ewaluacji rozumowania długokontekstowego tablicy index board, w granicach pół punktu od modeli o kilkukrotnie wyższej cenie i wystarczająco blisko wyniku Step 5 Preview, że różnica nie ma znaczenia decyzyjnego w zadaniach typu znajdź fakt.

Dwadzieścia siedem punktów, a czego nie mierzą

Model 30B poddany destylacji, aby działać w 20 GB pamięci, przegra z flagowym modelem 600B w indeksie ogólnej inteligencji, a same materiały Meta nie twierdzą inaczej — jedno z ich ujęć wprost mówi, że Glimmer nie został zaprojektowany, by dorównać surowej mocy rozumowania modeli chmurowych pełnej skali. Zatem wynik 17 nie jest oceną inżynierii; to oczekiwany rezultat przyjęcia innego celu. Właściwe pytanie brzmi: które z twoich zadań ta luka faktycznie obejmuje.

Odczyt dla długiego kontekstu to miejsce, w którym te dwa modele są najbliżej siebie i w którym intuicja przestaje się sprawdzać. Muse Glimmer uzyskuje 80,0 w ocenie rozumowania na długim kontekście tego rankingu — wynik, który byłby niczym szczególnym w przypadku modelu czołowego, a jest niezwykły w przypadku modelu działającego na konsumenckiej karcie graficznej. Jeśli Twoje obciążenie obejmuje wyszukiwanie, streszczanie lub ekstrakcję z długich dokumentów, lokalny model na tym poziomie nie jest oczywiście niewłaściwym narzędziem, a fakt, że żądanie nigdy nie opuszcza Twojej maszyny, jest cechą, której nie kupisz od API za żadną cenę.

Jest jeszcze część tego porównania, której dane liczbowe Meta nie pokazują. Recenzowane naukowo badanie orkiestracji wieloagentowej przetestowało Muse-Glimmer-30B w kontrolowanych warunkach — to samo zadanie, ten sam harness, ci sami konsultanci — i wykazało, że model nie odzyskał żadnego z kandydatów wygenerowanych przez większe modele frontier, ponosząc porażkę we wszystkich trzech próbach w każdym wariancie. To pojedyncze badanie jednej konfiguracji i właśnie taki rodzaj dowodu strona modelu nigdy nie ujawnia. W przypadku potoków agentowych, w których słabszy orkiestrator musi odzyskać działanie po awarii silniejszego modelu, jest to wynik najbardziej istotny dla decyzji w tym tekście i warto go przeczytać przed jakimikolwiek benchmarkami Meta raportowanymi przez dostawcę.

Dla kompletności: te benchmarki są własne Meta i nie zostały odtworzone: 76,0% w SWE-Bench Verified, 51,2% w SWE-Bench Pro, 51,7% w TerminalBench 2.1, 65,9% w OSWorld-Verified, 83,5% w GPQA Diamond, 22% w Humanity's Last Exam i 75,5 w MCP-Atlas. Są mierzone względem modeli w tej samej klasie rozmiarowej i opisują zdolnego lokalnego agenta, a nie czołowego rozumującego.

Generated two-column scoreboard card titled 'Step 5 Preview vs Muse Glimmer - the scoreboard'. The left column gives Step 5 Preview an independent index of 44, the vendor's servers as the runtime, closed preview weights, $1.00 / $2.70 per 1M tokens, about 160M output tokens against an 82M median, and wins on capability ceiling, 1M context and image input. The right column gives Muse Glimmer an independent index of 17, your own GPU offline as the runtime, Apache 2.0 weights, no per-token charge, a long-context retrieval score of 80.0 within half a point of much larger models, and wins on privacy perimeter, zero marginal cost and portability. A footer reads 'Index and long-context figures per Artificial Analysis; Muse Glimmer specifications per Meta, vendor-reported.'

Gdzie faktycznie przebiega granica

Zaleta strukturalna Step 5 Preview polega na tym, że wykonuje pracę, której nie możesz wykonać. Kontekst 1M tokenów, wejście obrazowe, zmierzony wynik zbliżony do czołówki i 93 tokeny wyjściowe na sekundę bez konieczności kupowania sprzętu: przy tworzeniu szkiców, planowaniu, przeglądzie kodu w dużym repozytorium albo w dowolnym zadaniu, w którym to sufit możliwości modelu jest wąskim gardłem, API wygrywa, a te dwadzieścia siedem punktów to cały argument. Koszt z tym związany jest przeciwieństwem tego w Muse Glimmer: prompty opuszczają twoje granice, cena nalicza się ponownie przy każdym tokenie, a rozwlekłość modelu sprawia, że zadania z długimi wyjściami są droższe, niż sugeruje stawka $2.70.

Screenshot of the Artificial Analysis model page for Muse Glimmer in its high configuration, headed 'Muse Glimmer (High) Intelligence, Performance & Price Analysis', showing Meta as the creator, an open-weights release date of August 2026, an Intelligence Index of 17, and a 131k-token context window with text and image input.

Zaletą Muse Glimmer jest to, że wykonuje pracę, która nie może opuścić swojego środowiska. Jeśli dane podlegają regulacjom, jeśli budżet opóźnienia wynosi kilka milisekund, jeśli maszyna jest offline albo jeśli koszt krańcowy milionowego żądania musi być zerowy, to żadne API nie jest kandydatem — ani to, ani żadne inne. Ceną za to są możliwości: wybierasz 17, tam gdzie istnieje 44, a w orkiestracji agentowej możesz wybierać koordynatora, który nie potrafi sobie poradzić z błędami silniejszego modelu.

Dla większości zespołów odpowiedź nie jest wyborem, lecz podziałem, a ten podział potrzebuje miejsca, w którym może funkcjonować. OrcaRouter kieruje ruchem do ponad 200 modeli za jednym kluczem API i jednym rachunkiem, przy 0% marży i cenie katalogowej dostawcy przekazywanej bez zmian, a do tego automatyczne przełączanie awaryjne i DSL routingu do kierowania ruchu według zadania, kosztu lub opóźnienia. Ani Step 5 Preview, ani Muse Glimmer nie znajdują się w tym katalogu — flagowy model StepFun nie jest przez nas routowany, a Glimmer to lokalne pobranie — więc oferowana wartość nie polega na dostępie do któregokolwiek z tych modeli. To zestaw, względem którego chciałbyś je porównać, dostępny za jednym kluczem już dziś, tak aby decyzję lokalnie kontra zdalnie rozstrzygał twój własny rozkład zadań, a nie strona tego dostawcy, którą przeczytałeś jako ostatnią.

Screenshot of the OrcaRouter models page at www.orcarouter.ai/models, showing 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters, and a credits panel.

Jak podjąć decyzję

Wybierz Step 5 Preview, gdy ograniczeniem jest pułap możliwości. Jeśli Twoje zadania są otwarte, multimodalne, długokontekstowe lub agentowe w tym sensie, że potrzebują sprawnego planisty, model API jest jedynym z tych dwóch, który je wykona, a jego cena jest jak na swoją klasę na tyle niska, że pilotaż to pozycja w budżecie, a nie projekt. Zaplanuj budżet na gadatliwość, licz się z tym, że data udostępnienia wag — 15 października — się przesunie, a obciążenia, które nie mogą opuścić budynku, trzymaj poza tym.

Wybierz Muse Glimmer, gdy to obwód jest ograniczeniem. Jeśli Twoich danych nie można wysyłać, jeśli musisz uruchamiać go w samolocie albo w fabryce, lub jeśli Twoje wolumeny sprawiają, że cennik za token jest absurdalny, model 30B na licencji Apache-2.0, który mieści się w 20 GB, jest praktycznym wyborem, a jego wynik wyszukiwania przy długim kontekście jest wystarczająco dobry, aby luka w możliwościach nie ujawniła się w każdym rodzaju obciążenia. Przetestuj go w orkiestracji, zanim zaufasz mu w tym obszarze, ponieważ właśnie tam niezależne dowody są najsłabsze.

Jeśli oba ograniczenia obowiązują jednocześnie, uruchom oba: lokalnie dla danych, które nie mogą się przenosić, API dla zadań wymagających większego modelu, a decyzję o routingu uczyń zmianą konfiguracji, a nie migracją. Porównanie, które ma znaczenie, to nie 44 kontra 17. Chodzi o to, które z twoich żądań mogą pozwolić sobie na opuszczenie maszyny, a na to pytanie może odpowiedzieć tylko twój własny ruch.