Wygenerowana karta tytułowa hero z napisem „GPT-6 Luna vs GLM-5.3”, z podtytułem „Osiem punktów indeksu za dziesięciokrotny koszt na zadanie, a wagi wciąż nie zostały opublikowane.”, z chipami pokazującymi Luna przy $0.10/$0.50 za 1 mln z indeksem 37, GLM-5.3 przy $1.40/$4.40 za 1 mln z indeksem 45, oraz kosztem na zadanie indeksu $0.07 wobec $0.68, z logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

GPT-6 Luna vs GLM-5.3: Model o otwartych wagach, którego wciąż nie możesz pobrać

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

GLM-5.3 to lepszy model. Osiąga 45 punktów w Artificial Analysis Intelligence Index przy maksymalnym wysiłku, w porównaniu z GPT-6 Luna, który ma 37, dorównuje Mythos 5 w wybranych ewaluacjach dotyczących cyberbezpieczeństwa według Z.ai i jest wiodącym modelem z otwartymi wagami na kilku złożonych rankingach. Jest też obecnie API, które wynajmujesz, a nie modelem, który posiadasz: Z.ai opóźniło udostępnienie wag o około dwa tygodnie z powodu obaw o cyberbezpieczeństwo, a pobranie, które ma być sednem flagowego modelu z otwartymi wagami, wciąż nie jest dostępne.

Ta zwłoka to sedno tego starcia i zmienia arytmetykę w sposób, który umyka tabelom cen. GPT-6 Luna zadebiutował 22 września 2026 r. w cenie 0,10 USD za milion tokenów wejściowych i 0,50 USD za milion tokenów wyjściowych, ogólnodostępny, bez haczyków. GLM-5.3 zadebiutował 18 sierpnia 2026 r. w cenie 1,40 USD i 4,40 USD — czternaście razy wyższej od stawki Luna za tokeny wejściowe i prawie dziewięć razy wyższej od jej stawki za tokeny wyjściowe — z wstrzymanym udostępnieniem wag. Nie jest to więc porównanie otwartego z zamkniętym. To zamknięty model, który możesz dziś wywołać za jedną dziesiątą kosztu, w porównaniu z otwartym modelem, który możesz dziś jedynie wywołać, wycenionym tak, jakbyś kupował coś, czego jeszcze nie możesz mieć.

Dwa modele, miesiąc różnicy, dwie bardzo różne oferty

GPT-6 Luna to najmniejszy model w generacji GPT-6 OpenAI, udostępniony obok GPT-6 Sol w cenie $2.00/$10.00 i poniżej flagowego GPT-6 Astra w cenie $10.00/$50.00. Ma okno kontekstowe o rozmiarze 1 050 000 tokenów, limit wyjścia wynoszący 128 000 tokenów, wejście tekstowe i obrazowe oraz drabinkę rozumowania obejmującą poziomy od none przez low, medium, high, xhigh aż po max — przy czym domyślnie ustawiony jest medium. OpenAI nazywa go najbardziej wydajnym modelem w rodzinie do skoncentrowanej pracy o dużym wolumenie, a cennik to potwierdza: wejście z pamięci podręcznej w cenie $0.01 za milion to jedna dziesiąta i tak już niskiej stawki za wejście bez pamięci podręcznej.

GLM-5.3 to obecny flagowy model Z.ai do złożonej inżynierii oprogramowania i długoterminowej pracy agentowej, wydany 18 sierpnia 2026 r. Działa w trybie tekst na wejściu, tekst na wyjściu, ma okno kontekstowe o pojemności 1 mln tokenów z limitem 128 000 tokenów na wyjściu i zawsze rozumuje — nie istnieje tryb bez rozumowania. Z.ai opisuje około 50% poprawę doświadczenia z kodowaniem w porównaniu z GLM-5.2 i pozycjonuje go do kodowania w skali repozytorium oraz autonomicznej wieloetapowej inżynierii. Wagi, gdy się pojawią, będą główną atrakcją; dziś tym, co działa, jest API.

Co faktycznie mówią dwie karty stawek

Jedna linia na wymiar, obie strony w każdym:

• Wejście za 1 mln — GPT-6 Luna $0.10 vs GLM-5.3 $1.40

• Wyjście za 1 mln — GPT-6 Luna 0,50 USD a GLM-5.3 4,40 USD

• Dane wejściowe z pamięci podręcznej — GPT-6 Luna 0,01 USD za 1 mln vs GLM-5.3 0,26 USD za 1 mln, 81% zniżki w stosunku do własnej stawki za dane wejściowe

• AA Intelligence Index — GPT-6 Luna 37 przy maksymalnym wysiłku vs GLM-5.3 45 przy maksymalnym wysiłku

• Wynik przy domyślnym poziomie wysiłku — GPT-6 Luna 29 przy swoim średnim ustawieniu domyślnym vs GLM-5.3 z zawsze włączonym rozumowaniem, mierzony przy maksimum

• Tokeny wyjściowe podczas przebiegu indeksu — GPT-6 Luna 150M vs GLM-5.3 210M, w porównaniu z medianą na tablicy wyników wynoszącą 140 mln

• Koszt uruchomienia indeksu — GPT-6 Luna 122,39 USD vs GLM-5.3 2 503,48 USD

• Koszt na zadanie indeksowania — GPT-6 Luna około 0,07 USD w porównaniu z GLM-5.3 około 0,68 USD

• Kontekst i wyjście — GPT-6 Luna 1 050 000 wej. / 128 000 wyj. vs GLM-5.3 1 mln wej. / 128 000 wyj.

• Klauzula długiego kontekstu — GPT-6 Luna: 2x dane wejściowe i pamięć podręczna, 1,5x dane wyjściowe powyżej 272K danych wejściowych, całe żądanie vs GLM-5.3; brak równoważnej klauzuli na opublikowanej karcie

• Przełącznik wyłączenia rozumowania — GPT-6 Luna: od braku do maksimum vs GLM-5.3: zawsze włączone, brak trybu bez rozumowania

• Wagi — GPT-6 Luna zamknięte, tylko API kontra GLM-5.3 otwarte zgodnie z zobowiązaniem, premiera opóźniona.

A generated single-panel scoreboard card headed 'Same suite, ten times the task cost' with six rows: GPT-6 Luna $0.10 in / $0.50 out per 1M with index 37 at max effort; GLM-5.3 $1.40 in / $4.40 out per 1M with index 45 at max effort; cost per completed index task about $0.07 against about $0.68; output tokens on the index run Luna 150M against GLM-5.3's 210M and a board median of 140M; reasoning configuration Luna none through max against GLM-5.3 always on with no off switch; and weights, Luna closed and API-only against GLM-5.3 open by commitment with the release delayed. Footer: 'Index and cost per task per Artificial Analysis; prices per OpenAI and Z.ai.'

Podatek od rozwlekłości to liczba, która o tym decyduje

Ośmiopunktowa luka w indeksie jest realna, a luka cenowa jest jeszcze większa — i żadna z nich nie jest liczbą, która ma największe znaczenie. Liczbą, która ma znaczenie, jest liczba tokenów wyjściowych na ukończone zadanie, ponieważ właśnie tam ośmiopunktowa przewaga w zakresie możliwości albo się zwraca, albo nie.

Przebieg indeksu Artificial Analysis to najczystsze dostępne porównanie kontrolowane: ten sam zestaw testów i ta sama infrastruktura, uruchomione na obu modelach. GLM-5.3 wygenerował 210 milionów tokenów wyjściowych, kończąc go. GPT-6 Luna wygenerował 150 milionów. Wobec mediany rankingu wynoszącej 140 milionów oba są gadatliwe — GLM-5.3 o połowę więcej niż mediana, GPT-6 Luna o około jedną dziesiątą więcej. Ale kierunek tej różnicy kumuluje się na niekorzyść modelu Z.ai pod względem ceny: emituje o 40% więcej tokenów i pobiera 8,8 razy więcej za każdy z nich.

Po zestawieniu obu tych wartości koszt ukończonego zadania indeksowego wynosi około 0,68 USD dla GLM-5.3 w porównaniu z około 0,07 USD dla GPT-6 Luna — mniej więcej dziesięciokrotna różnica, większa niż sam stosunek stawek z cennika, ponieważ droższy model jest także bardziej rozwlekły. Taki jest uczciwy kształt tego zestawienia. GLM-5.3 daje ci osiem punktów indeksowych za dziesięciokrotnie większe pieniądze na ukończone zadanie, a to, czy to dobry zakup, zależy wyłącznie od tego, czy twoje obciążenie należy do takich, w których osiem punktów stanowi różnicę między działaniem a niedziałaniem.

W wielu przypadkach ruchu produkcyjnego nie jest. Dla agenta kodującego pracującego z repozytorium na granicy możliwości modelu często jest, a żadna przewaga cenowa nie zniweluje luki w możliwościach w zadaniu, które kończy się niepowodzeniem.

Dlaczego otwarte wagi zmieniają odpowiedź i dlaczego opóźnienie zmienia ją z powrotem

Standardowy argument na rzecz flagowego modelu z otwartymi wagami głosi, że cena za token jest tymczasowa. Wynajmujesz, dopóki twój wolumen nie uzasadni zakupu, a wtedy pobierasz model i koszt krańcowy tokenu sprowadza się do prądu. Zgodnie z tym argumentem cena 1,40/4,40 USD w GLM-5.3 nie jest tak naprawdę czternastokrotnością 0,10 USD w GPT-6 Luna — to cena pomostowa w drodze do zera, a niższa stawka modelu zamkniętego to wynajem bez wyjścia.

Ta argumentacja jest słuszna, a obecnie została zawieszona. Z.ai wstrzymało udostępnienie wag na około dwa tygodnie z powodu ustaleń dotyczących cyberbezpieczeństwa, co oznacza, że droga wyjścia uzasadniająca tę premię jeszcze nie istnieje. Dopóki to nie nastąpi, GLM-5.3 pozostaje API rozliczanym za zużycie, o dziesięciokrotnie wyższym koszcie na zadanie niż model, który ustępuje mu o cztery punkty indeksu w ogólnym rankingu i o jeden punkt w rankingu kodowania — a nabywca płaci ceny za otwarte wagi za dostęp do zamkniętych wag.

Jest tu drugorzędna kwestia, którą warto nazwać. Opóźnienie nie jest skandalem; to dostawca, który poważnie traktuje ustalenie dotyczące zdolności, a model, który dobrze wykrywa luki w zabezpieczeniach, jest dokładnie tym rodzajem modelu, z którego udostępnianiem jako pliku do pobrania laboratorium powinno postępować ostrożnie. Ale oznacza to, że data wydania wag jest teraz najważniejszą datą w tym porównaniu i nie została opublikowana. Zespół wybierający między tymi dwoma modelami w horyzoncie dwunastu miesięcy wybiera między modelem, którego warunki mogą się zmienić w przyszłym miesiącu, a modelem, którego warunki nie mogą — i tylko jeden z nich jest odpowiednio wyceniony.

Powierzchnia migracji jest mała

Obydwa modele udostępniają interfejs chat completions zgodny z OpenAI, obydwa mają okno kontekstowe klasy 1M i obydwa ograniczają wyjście do 128 000 tokenów, więc przeniesienie między nimi jest bliższe zmianie konfiguracji niż przepisaniu. Różnice, które faktycznie dadzą się we znaki, mają charakter behawioralny, a nie strukturalny.

Klauzula długiego kontekstu GPT-6 Luna jest tą kosztowną: żądania powyżej 272 000 tokenów wejściowych są rozliczane według dwukrotnie wyższych stawek za dane wejściowe i pamięć podręczną oraz 1,5-krotnie wyższej stawki za dane wyjściowe za całe żądanie, więc wywołanie na 300 000 tokenów kosztuje dwa razy tyle, ile ta sama praca podzielona na dwie części. Opublikowana karta GLM-5.3 nie zawiera równoważnej klauzuli, co w przypadku naprawdę dużych pojedynczych żądań znacznie zmniejsza różnicę cen i może ją odwrócić w zadaniu zdominowanym przez generowanie odpowiedzi.

Konfiguracja rozumowania działa w odwrotnym kierunku. GLM-5.3 ma rozumowanie zawsze włączone i nie daje sposobu, by je wyłączyć, co jest twardym ograniczeniem dla wszystkiego, co jest wrażliwe na opóźnienia — klasyfikator lub router nie może go użyć. GPT-6 Luna oferuje none, low, medium, high, xhigh i max, a domyślnie jest to medium, gdzie uzyskuje 29 zamiast 37. Ten jeden parametr to różnica między tym, że GPT-6 Luna jest osiem punktów indeksu za modelem Z.ai, a tym, że jest szesnaście punktów za nim, a zespół, który migruje bez ustawienia go jawnie, używa drugiej konfiguracji, wierząc, że kupił pierwszą.

GLM-5.3 jest dostępny w OrcaRouter w cenie katalogowej Z.ai, w ramach modelu cenowego pass-through, który sprawia, że zmiana stawek dostawcy trafia po naszej stronie tego samego dnia, zamiast czekać, aż reseller wynegocjuje nowe warunki — co ma większe znaczenie niż zwykle w przypadku modelu, którego główny wynik ma się zmienić, gdy pojawią się wagi. GPT-6 Luna nie znajduje się w naszym katalogu na moment pisania tego tekstu i jest dostępny poprzez własne API OpenAI. Zespół używający obu, co jest tu racjonalnym rozwiązaniem, biorąc pod uwagę, jak bardzo te dwa modele różnią się na krańcach, używa jednego klucza do GLM-5.3 obok tego, czego już używa do OpenAI, i przenosi ruch między klasyfikatorem za pięć centów a agentem kodującym w skali repozytorium poprzez zmianę trasy, a nie wdrożenia.

A screenshot of the Artificial Analysis page for GPT-6 Luna (max), showing an Intelligence rank of 6th of 183 models, a Speed rank of 35th, a Cost rank of 20th and a Verbosity rank of 36th, input pricing of $0.10 and output of $0.50 per 1M tokens, an Intelligence Index score of 37 against a comparable-model median of 12, 150M output tokens generated during the index run, 153.9 tokens per second, and a total of $122.39 spent evaluating the model.

Połączenie

Używaj GPT-6 Luna do wszystkiego, co jest przetwarzane programowo i masowo. Klasyfikacja, ekstrakcja, routing, masowe streszczanie, wewnętrzna pętla agenta. Przy $0.10/$0.50, z wejściem z pamięci podręcznej za centa i Batch w połowie standardowej stawki, jest o rząd wielkości tańszy na ukończone zadanie niż GLM-5.3, a ośmiopunktowa różnica w indeksie nie będzie widoczna w twojej ewaluacji. Ustaw parametr effort jawnie i utrzymuj długie wywołania poniżej 272 000 tokenów.

Sięgaj po GLM-5.3, gdy zadanie jest trudne, a odpowiedź liczy się bardziej niż rachunek. Inżynieria oprogramowania w skali repozytorium, autonomiczna praca wieloetapowa, cokolwiek, gdzie osiem punktów indeksu to różnica między ukończeniem zadania a jego porażką. Gadatliwość to prawdziwy podatek, a dziesięciokrotny koszt zadania jest realny, ale model, który kończy pracę, jest tańszy niż model, który trzeba ponawiać.

I miej oko na wagi. Dzień, w którym Z.ai opublikuje możliwość pobrania GLM-5.3, to dzień, w którym zmieni się kluczowy fakt tego porównania, i jest to jedyna data na tej stronie, której nie ma jeszcze w kalendarzu.

A screenshot of the OrcaRouter model page for GLM-5.3 (z-ai/glm-5.3), showing the Tools, JSON and Reasoning badges, a 2026-08-18 catalogue date, 1M-token context with 128K maximum output, list pricing of $1.26 input and $3.96 output per 1M tokens, a p50 time to first token of 3.99s, 1807.1M tokens of traffic, and the description of GLM-5.3 as Z.ai's flagship model for complex software engineering and long-horizon agentic tasks.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie