Karta tytułowa dla 'Muse Spark 1.2 vs GLM-5.2 — zamknięty koder vs otwarty generalista', z Muse Spark 1.2 przedstawionym pod ikoną ZAMKNIĘTEJ kłódki i GLM-5.2 pod ikoną OTWARTEGO pudełka.
Guides & Insights

Muse Spark 1.2 kontra GLM 5.2: Zamknięty koder kontra otwarty generalista

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Dwa modele o kontekście 1 000 000 tokenów, wycenione z różnicą piętnastu centów na milion tokenów, oba przeznaczone do intensywnej pracy agentów w kodowaniu — a poza tym nie mają prawie nic wspólnego. Muse Spark 1.2, który Meta wypuściła 5 sierpnia 2026 r. wraz z współtrenowanym agentem terminalowym o nazwie Muse Code, ma zamknięte wagi, jest tańszy w przeliczeniu na token, osiąga 57 punktów w aktualnym indeksie Artificial Analysis Intelligence Index i nie potrafi odpowiedzieć bez wcześniejszego rozumowania. GLM 5.2, flagowy model Z.ai o otwartych wagach z połowy czerwca, jest na licencji MIT, można go samodzielnie hostować, jest około pięć razy szybszy do pierwszego tokena i wciąż przenosi przez nasz gateway cztery i pół razy więcej rzeczywistego ruchu — 213 milionów tokenów w ostatnich siedmiu dniach wobec 46 milionów modelu Muse Spark 1.2. Model z wyższą punktacją i niższą ceną za token to ten z mniejszym ruchem. To otwarty model jest tym, do którego ludzie faktycznie kierują ruch.

Uczciwa wersja tego faktu jest tematem tego artykułu. Punktacja i ceny decydują mniej niż to, jak model pasuje do twojego potoku, a te dwa czynniki są przeciwstawne na każdej osi, która decyduje o dopasowaniu. Tam, gdzie istnieją niezależne dane, pochodzą one z Artificial Analysis; tam, gdzie pochodzą z Meta lub Z.ai, są oznaczone jako raportowane przez dostawcę; dane o opóźnieniach i ruchu są własną siedmiodniową telemetrią produkcyjną OrcaRoutera.

Kontrast specyfikacji, jeden wymiar na raz

Cena — Muse Spark 1.2: 1,25 USD za wejście / 4,25 USD za wyjście za milion tokenów, 0,15 USD przy trafieniu w cache; GLM 5.2: 1,40 USD za wejście / 4,40 USD za wyjście, 0,26 USD przy cache. Meta jest tańsza w każdym wierszu.

Kontekst — oba 1,048,576 tokenów. Maksymalne wyjście: Meta dokumentuje limit 131,072 tokenów dla Muse Spark 1.2; GLM 5.2 deklaruje 128,000.

Rozumowanie — rozumowanie jest obowiązkowe w Muse Spark 1.2 na pięciu poziomach wysiłku (od minimalnego do xhigh, domyślnie średni); GLM 5.2 działa w trybie hybrydowego rozumowania sterowanego parametrem reasoning_effort na poziomie wysokim lub maksymalnym, z głębokim rozumowaniem domyślnie włączonym.

Wejścia — Muse Spark 1.2 reklamuje wejście tekstu, obrazu, wideo, audio i PDF; GLM 5.2 to tekst na wejściu, tekst na wyjściu.

Wagi — Muse Spark 1.2 jest zamknięty, bez repozytorium i bez ścieżki self-hostingu; GLM 5.2 udostępnia otwarte wagi na licencji MIT — model Mixture-of-Experts z 753B parametrami, z około 40B aktywnymi na token.

Wiek — Muse Spark 1.2 ma trzy dni, gdy to piszę; GLM 5.2 jest w produkcji od 13 czerwca, z ośmioma tygodniami doświadczenia w terenie i całym ekosystemem hostów i narzędzi zbudowanych wokół niego.

Luka indeksu wynosi cztery punkty. Pułapka wersji jest realna.

Aktualny Intelligence Index (v4.1.1) serwisu Artificial Analysis przyznaje Muse Spark 1.2 wynik 57, co daje mu 12. miejsce wśród 185 modeli, a GLM 5.2 — 53, co jest najwyższym wynikiem wśród modeli o otwartych wagach, ale o cztery punkty mniej niż Muse Spark 1.2. Większość publikacji wciąż podaje wynik 54 dla Muse Spark 1.2, bo taki wynik raportowała ewaluacja z dnia premiery; przeliczenie w wersji v4.1.1 dodało mu 2,7 punktu, co stanowiło największy wzrost spośród wszystkich modeli w tej aktualizacji. Jeśli gdziekolwiek zobaczysz zestawienie „54 vs 51” lub „54 vs 53”, sprawdź, do której wersji indeksu odnosi się każda z liczb, zanim uznasz różnicę za rzeczywistą.

Warto powiedzieć, co czteropunktowa przewaga oznacza, a czego nie oznacza. Oznacza, że w zbiorczym zestawieniu dziewięciu benchmarków zamknięty model Meta wyprzedza otwarty model Z.ai przy porównywalnym nakładzie. Nie oznacza, że Muse Spark 1.2 pokonuje GLM 5.2 we wszystkim, ponieważ oba modele osiągają swoje wyniki różnymi drogami. GLM 5.2 to wartość odstająca w matematyce i rozumowaniu — AIME 2026 na poziomie 99,2 — ale jest notorycznie rozwlekły, a jego słabym punktem jest zaawansowana praca na dużych repozytoriach kodu. Muse Spark 1.2 to całkowite przeciwieństwo: mocny w kodowaniu w terminalu oraz w zadaniach wieloplikowych, a przy tym znacznie tańszy w ocenie na zadanie, ponieważ podczas myślenia spala znacznie mniej tokenów.

A two-column scoreboard for Muse Spark 1.2 and GLM-5.2. AA Index (v4.1.1): 57 vs 53. Terminal-Bench 2.1: 80.1 vs 77.9. DeepSWE 1.1: 59.3 (Meta) vs 46.2. Weights: closed vs MIT open. Price in/out: $1.25/$4.25 vs $1.40/$4.40. p50 TTFT: 8.13 s vs 1.55 s.

Gdzie benchmarki faktycznie się różnią

W Terminal-Bench 2.1 oba modele są bliżej siebie, niż sugerowałaby różnica w indeksie, a źródło pomiaru ma większe znaczenie niż zwykle. W tym samym harnessie Artificial Analysis Muse Spark 1.2 uzyskuje 80.1, a GLM 5.2 – 77.9. Meta twierdzi, że Muse Spark 1.2 osiąga 82.9 we własnym harnessie; najlepszy opublikowany wynik Z.ai dla GLM 5.2 to 82.7, dzięki czemu model ten jako pierwszy z otwartymi wagami przekroczył 80 w tym benchmarku. Ten sam benchmark, cztery różne wyniki — dobór harnessu przesuwa te wartości o kilka punktów w obie strony, więc każdą pojedynczą liczbę z Terminal-Bench traktuj jak zakres.

Rozbieżność, na którą warto zwrócić uwagę, to DeepSWE 1.1, benchmark kładący nacisk na głębokie, wieloplikowe rozumowanie na skalę repozytorium w długiej pętli agenta. Meta podaje 59.3 dla Muse Spark 1.2 — to dane producenta, których żadna strona trzecia jeszcze nie odtworzyła. Opublikowany wynik DeepSWE dla GLM 5.2 to 46.2, a jego poprzednik GLM-5.1 osiągał 18.0, więc to wymiar, w którym Z.ai poprawiło się najbardziej i nadal pozostaje w tyle. Jeśli Twoje zadanie to „spójna zmiana pięćdziesięciu plików”, ta luka jest całym sednem; jeśli Twoje zadanie to polecenia terminala i szkieletowanie, ledwo ma znaczenie.

Jeszcze jedno odkrycie, które wywraca do góry nogami oczywistą narrację. Niezależny pakiet Vals AI, który uruchamia zadania agentów w poszczególnych domenach, plasuje Muse Spark 1.2 na piątym miejscu w klasyfikacji ogólnej z wynikiem 71,88% — i na pierwszym miejscu w Finance Agent, na pierwszym w TaxEval oraz na pierwszym w benchmarku Harvey's Legal Agent, odpowiednio w porównaniu z 44, 136 i 31 modelami — podczas gdy Terminal-Bench 2.1 jest dopiero czternastą najlepszą domeną spośród pięćdziesięciu. Meta sprzedawała ten model jako model do kodowania, a niezależny ewaluator wykazał, że jest on najmocniejszy w agentach do dokumentów finansowych, podatkowych i prawnych. Jeśli Twój zespół pisze umowy lub uzgadnia księgi rachunkowe, to najważniejsza liczba w tym artykule.

Kwestia otwartych wag to prawdziwe rozwidlenie.

Wszystko powyższe dotyczy zdolności. Decyzja dotyczy głównie własności, a te dwie kwestie nie mogłyby być bardziej od siebie różne.

GLM 5.2 to otwarte wagi na licencji MIT. To zmienia negocjacje, nie tylko rachunek: możesz hostować go samodzielnie, jeśli obciążenie jest wrażliwe lub wolumen jest wysoki; możesz przenosić go między dostawcami bez ponownej integracji, ponieważ wagi są twoje; a każdy host, który go routuje, musi konkurować ceną i latencją, dlatego linia otwartych wag z czasem tanieje. 753B MoE to nie model na laptopa — większość zespołów nadal będzie go wynajmować, a nie uruchamiać — ale opcja odejścia lub uruchomienia tych samych wag we własnym zakresie po stałym koszcie stanowi dolną granicę tego, co ktokolwiek może ci naliczyć.

Muse Spark 1.2 kupuje przeciwny pakiet. Wagi modelu są zamknięte, a jedyną ścieżką first-party jest Model API Meta, które teraz również obsługujemy. W zamian otrzymujesz współtrenowany produkt: Muse Code, agent terminalowy, który został dostarczony z modelem, był dostrajany na trajektoriach harnessu otrzymanych metodą próbkowania z odrzucaniem i uruchamia trwałe, odporne na restarty podagenty na środowisku uruchomieniowym z w pełni odtwarzalnym dziennikiem zdarzeń, z wbudowanymi /plan, /grill i /goal umiejętnościami. To jest naprawdę coś innego niż „dobry model, który sam podłączasz do własnego harnessu” — to agent, który działa od razu. Kompromis polega na tym, że działa tylko na warunkach Meta, w narzędziu Meta, na macOS lub Linux, bez klienta Windows, bez MCP i na razie bez wtyczek IDE.

Screenshot of the Meta AI Research announcement 'Introducing Muse Code and Muse Spark 1.2', dated August 5 2026.

Cena za token, cena za zadanie

W przeliczeniu na token, Muse Spark 1.2 jest tańszy zarówno pod względem wejścia, jak i wyjścia, i pozostaje tańszy w przeliczeniu na zadanie, ponieważ jest również modelem mniej rozwlekłym. Firma Artificial Analysis zmierzyła, że GLM 5.2 spala 141 milionów tokenów wyjściowych, z czego 95% to tokeny rozumowania, tylko po to, aby uruchomić Intelligence Index podczas premiery — to najbardziej rozwlekły model w czołówce. Muse Spark 1.2 spalił 95 milionów w tym samym ćwiczeniu przy stawce 0,40 USD za zadanie. Więcej tokenów przy wyższej stawce sprawia, że koszt GLM 5.2 na zadanie rośnie w sposób, którego cena katalogowa nie ujawnia, i właśnie tak należy porównywać modele rozumowania: wyceniać wykonane zadanie, a nie stawkę za milion tokenów.

Istnieje trzecia cena, którą ma tylko jeden z tych modeli. Muse Spark 1.2 oferuje poziom dla współtwórców w cenie 0,10 USD za wejście / 0,20 USD za wyjście — o rząd wielkości taniej niż poziom standardowy i o podobny margines taniej niż cena katalogowa GLM 5.2. Ceną wstępu jest zgoda, by Meta trenowała przyszłe modele na Twoim ruchu, oraz limit 60 żądań na minutę, który wyklucza produkcyjny fan-out. Traktuj to jak przegląd prawny z dołączonym rabatem, a nie tańszy SKU; dla zespołu, który spełnia warunki i mieści się w limicie, porównanie cen przestaje być wyrównane.

Opóźnienie: te dwa modele odwracają się.

{{1}}Jeśli luka w indeksie przemawia na korzyść Meta, to profil opóźnień jest obszarem, w którym GLM 5.2 zdecydowanie wygrywa pod względem odczuć.{{/1}} W ciągu ostatnich siedmiu dni rzeczywistego ruchu na OrcaRouter, Muse Spark 1.2 wykazuje p50 czasu do pierwszego tokena wynoszące 8.13 sekundy i p95 na poziomie 10.00 sekundy, a następnie osiąga błyskawiczne 576 tokenów wyjściowych na sekundę przy zerowym wskaźniku błędów. GLM 5.2 wykazuje p50 wynoszące 1.55 sekundy — ponad pięciokrotnie szybciej do pierwszego tokena — ale sączy się z prędkością 78.5 tokenów wyjściowych na sekundę przy wskaźniku błędów 0.16%. W laboratorium przy maksymalnym wysiłku przepaść się pogłębia: Artificial Analysis zmierzyło czas do pierwszego tokena Muse Spark 1.2 na 26 sekund przy ustawieniu xhigh, jego najdroższym ustawieniu rozumowania.

Tak więc jeden model każe ci czekać, a potem działa szybko; drugi zaczyna natychmiast i nie spieszy się. W przypadku wszystkiego, co obserwuje człowiek — odpowiedzi czatu, interaktywnej sesji terminala — GLM 5.2 sprawdza się lepiej i dlatego dominuje w ruchu interaktywnym przez naszą bramę. W przypadku długiego generowania, dużego patchu czy szkicu dokumentu, Muse Spark 1.2 skończy pierwszy, gdy już wystartuje, ponieważ jego tempo generowania jest siedmiokrotnie wyższe niż GLM 5.2. Zmierz niewłaściwą liczbę, a wybierzesz niewłaściwy model z niewłaściwego powodu.

Próbowanie obu bez drugiej umowy.

Oba modele znajdują się w katalogu OrcaRouter po cenach listowych dostawcy — Muse Spark 1.2 za 1,25 USD i 4,25 USD, GLM 5.2 za 1,40 USD i 4,40 USD — ponieważ OrcaRouter przekazuje stawki dostawcy z zerową marżą. To sprawia, że ceny w sekcjach cenowych są cenami z faktury, a nie z metki, a przełączanie między nimi to zmiana jednej linii w ciągu modelu względem tego samego klucza, a nie nowa integracja. Jeśli dostawca obniży cenę, obniżka trafia na naszą stronę tego samego dnia.

Warstwa routingu naprawdę pokazuje tu swoją wartość, właśnie dlatego, że oba modele się uzupełniają. Słabością Muse Spark 1.2 jest wolny pierwszy token i wysoki koszt przy skalowaniu; słabością GLM 5.2 jest rozwlekłość i rozumowanie w głębokich repozytoriach. Reguła routingu, która wysyła przebieg planowania do Muse Spark 1.2, a równoległy fan-out workerów do GLM 5.2 — lub przełącza się awaryjnie na GLM 5.2, gdy endpoint Muse Code jest wolny — nie kosztuje nic dodatkowego do zbudowania, ponieważ oba są dostępne za jednym endpointem. A dla modelu, który ma trzy dni, automatyczny failover to sposób na wypróbowanie go bez stawiania na niego ścieżki produkcyjnej.

Screenshot of the OrcaRouter model page for GLM-5.2 (z-ai/glm-5.2), showing $1.40 per million input tokens, a 1M-token context window, 128K max output and an OpenAI-compatible endpoint.

Kto powinien wybrać, które

Wybierz Muse Spark 1.2 gdy jednostką pracy jest duży, spójny artefakt i ktoś może poczekać kilka sekund na jego uruchomienie: refaktoryzacje wielu plików, generowanie całego repozytorium, długie pętle agentowe oraz — według Vals AI — praca nad dokumentami finansowymi, podatkowymi i prawnymi. Prowadzenie w DeepSWE, wysoka szybkość generowania i poziom dla kontrybutorów wskazują na to samo. Akceptujesz zamknięte wagi, narzędzia Meta i wolniejszy pierwszy token, a wyniki Meta 82.9 i 59.3 powinieneś traktować jako deklaracje, a nie fakty.

Wybierz GLM 5.2, gdy własność i odczucie liczą się bardziej niż wynik zbiorczy: otwarte wagi, które możesz hostować samodzielnie lub przenosić, szybki pierwszy token do pracy interaktywnej, ekosystem narzędzi i oprzyrządowania, który już z nim współpracuje, oraz najsilniejsze dostępne ogólne możliwości wśród modeli o otwartych wagach. Zaakceptuj gadatliwość, wynik 46.2 DeepSWE i cenę katalogową wyższą za token, nawet przed uwzględnieniem różnicy w liczbie tokenów.

Większość zespołów odkryje, że szczera odpowiedź brzmi: żaden z nich osobno. Ten otwarty to koń roboczy, przez który kierujesz większość ruchu; ten zamknięty to specjalista, którego używasz do głębokich zadań i wrażliwych dokumentów. Cztery punkty różnicy w złożonym indeksie, cały świat różnicy w tym, kto kontroluje wagi — oto jest wybór, i jest o wiele jaśniejszy niż wyniki.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube