Qwen 3.8 vs GLM-5.2: Pierwszy benchmark, w którym faktycznie się pokrywają
Guides & Insights

Qwen 3.8 vs GLM-5.2: Pierwszy benchmark, w którym faktycznie się pokrywają

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Te dwa modele są najczystszym wyrazem przeciwstawnych zakładów w chińskiej AI o otwartych wagach. Zhipu GLM-5.2 jest lekki i sprawdzony: 753B parametrów łącznie, tylko 40B aktywnych, audytowany Artificial Analysis Intelligence Index na poziomie 51, wagi do pobrania od czerwca 2026 i opublikowana cena 0,95 USD / 3,00 USD. Alibaba Qwen3.8-Max to maksymalistyczny zakład: ~2,4T parametrów, nieujawniona liczba aktywnych i — do niedawna — żadnych liczb w ogóle.

Ogólna dostępność 3 sierpnia 2026 roku dała temu pojedynkowi coś, czego nie ma żaden inny artykuł w tej serii: benchmark, w którym oba modele mają wynik. Alibaba podaje Terminal-Bench 2.1 na 86.6; Artificial Analysis ma GLM-5.2 audytowany na 82.7 w tym samym teście. Po raz pierwszy twierdzenie Qwena można zestawić z niezależnie zmierzonym wynikiem konkurenta na identycznych zasadach — z ważnym zastrzeżeniem, że tylko jeden z dwóch pochodzi od arbitra.

Uwaga dla twórców — najszybszy sposób, aby to rozstrzygnąć, to uruchomić oba na własnych promptach. OrcaRouter udostępnia 200+ modeli za jednym punktem końcowym zgodnym z OpenAI, dzięki czemu możesz zestawić Qwen 3.8 Max z GLM-5.2 w tym samym zadaniu bez integrowania dwóch SDK.

TL;DR: werdykt. Na jedynym wspólnym benchmarku Qwen twierdzi, że ma 3,9-punktową przewagę na Terminal-Bench 2.1 (86,6 vs 82,7) — prawdziwy wynik, jeśli się powtórzy, choć wynik Qwena jest deklarowany przez samego Qwena, a wynik GLM — audytowany. Pod każdym innym względem GLM-5.2 ma praktyczne przewagi: jest ~2× tańszy przy cenie $0,95 / $3,00 w porównaniu z $2 / $6 Qwena, a jego wagi są do pobrania dziś, a jego 40B aktywnych parametrów sprawia, że jest naprawdę wdrożalny, a także ma niezależny wynik indeksu 51, podczas gdy Qwen nie ma żadnego. Qwen odpowiada kontekstem 1M tokenów za stałą stawkę, natywną multimodalnością, której GLM nie ma, oraz wyższym potencjalnym pułapem. Szczupły i sprawdzony wciąż bije dużego i niezweryfikowanego w produkcji — ale dystans zmniejszył się 3 sierpnia.

Najważniejsze wnioski

Pierwszy bezpośredni wspólny benchmark w serii: Terminal-Bench 2.1 — Qwen3.8-Max 86,6 (raportowane przez Alibaba) w porównaniu z GLM-5.2 82,7 (Artificial Analysis, audytowane). Qwen prowadzi o 3,9 punktu, ale te dwie liczby nie są równie wiarygodne.

GLM-5.2 to mniej więcej połowa ceny: $0.95 / $3.00 za 1M (AA blended ~$0.90) w porównaniu z Qwen3.8-Max, którego cena to $2 / $6.

Aktywne parametry to prawdziwa historia architektury: GLM-5.2 używa 40B aktywnych parametrów z 753B łącznie. Alibaba nadal nie ujawniła liczby aktywnych parametrów Qwena, co sprawia, że koszt jego serwowania jest niemożliwy do oszacowania.

Wagi GLM można pobrać już dziś; wagi Qwen są obiecane w tym tygodniu, ale na razie bez licencji ani repozytorium.

GLM-5.2 ma audytowany indeks 51. Qwen3.8-Max pozostaje nieoceniony — chociaż jego poprzednik Qwen3.7-Max uzyskał 46, poniżej GLM.

Unikalne oferty Qwen: okno 1M tokenów rozliczane ryczałtowo, bez dopłaty za długie prompty, plus natywne wejście tekstu/obrazu/wideo oraz OmniDocBench 1.5 92.1. GLM-5.2 koncentruje się na tekście.

Uwaga o dokładności: wszystkie wskaźniki jakości Qwen3.8-Max pochodzą z raportów Alibaba i nie zostały zweryfikowane przez strony trzecie. Dane GLM-5.2 pochodzą z Artificial Analysis. Porównanie wyniku zgłoszonego przez producenta z wynikiem poddanym audytowi w tym samym benchmarku jest pouczające, ale nie rozstrzygające — harnessy dostawców różnią się od harnessów ewaluacyjnych. Cennik Qwen to stawki GA, które zastępują lipcowy rabat promocyjny dla wersji preview.

Specyfikacje i cena, obok siebie

Oto twarde dane, każda liczba przypisana do swojego źródła.

• Producent / status — Qwen3.8-Max: Alibaba; GA (3 sierpnia 2026); GLM-5.2: Zhipu; wydany w czerwcu 2026

• Architektura — Qwen3.8-Max: ~2,4 bln łącznie, rzadki MoE; GLM-5.2: 753 mld łącznie, rzadki MoE (Artificial Analysis)

• Aktywne parametry — Qwen3.8-Max: Nadal nieujawnione przez Alibaba; GLM-5.2: 40B aktywnych (Artificial Analysis)

• Okno kontekstowe — Qwen3.8-Max: 1M tokenów, stała stawka (983 616 z trybem myślenia; maks. wyjście 131 072); GLM-5.2: 1M tokenów (Artificial Analysis)

Terminal-Bench 2.1 — Qwen3.8-Max: 86.6 (deklarowane przez Alibaba); GLM-5.2: 82.7 (Artificial Analysis, audytowane)

• AA Intelligence Index — Qwen3.8-Max: Nadal bez punktacji; GLM-5.2: 51 (Artificial Analysis)

• Inne wyniki zgłaszane przez producentów — Qwen3.8-Max: GPQA Diamond 92.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (dane Alibaba); GLM-5.2: wynik zmierzony przez stronę trzecią

• Modalności — Qwen3.8-Max: Tekst, obraz, wideo na wejściu → tekst na wyjściu; GLM-5.2: skoncentrowany na tekście

• Cennik (wejście / wyjście) — Qwen3.8-Max: $2.00 / $6.00 za 1M, stała; wejście z pamięci podręcznej $0.25; GLM-5.2: $0.95 / $3.00 za 1M (AA mieszany ~$0.90)

• Otwarte wagi — Qwen3.8-Max: Obiecane w ciągu tygodnia (brak jeszcze licencji); GLM-5.2: Tak — do pobrania już dziś

Dwie rzeczy wyznaczają ramy tego porównania, a pierwsza z nich jest najbardziej użytecznym punktem danych w całej serii.

Po pierwsze, pokrywanie się w zakresie Terminal-Bench jest naprawdę pouczające. Terminal-Bench 2.1 mierzy, czy model potrafi obsługiwać prawdziwą powłokę do końca — uruchamiać polecenia, czytać wyniki, wychodzić z błędów. To najbliższy dostępny wskaźnik tego, czy model może funkcjonować jako agent kodujący, a nie „sugerujący kod”, i jest to benchmark, który obaj dostawcy wybrali do raportowania. Wynik Qwen 86,6 wobec zaudytowanych 82,7 GLM oznacza przewagę Qwen o 3,9 punktu.

To zastrzeżenie ma znaczenie, ale nie należy go przeceniać. Harnessy dostawców i harnessy ewaluacyjne różnią się pod względem scaffoldingu, polityki ponawiania prób oraz konstrukcji promptów, a te wybory mogą przesunąć wynik Terminal-Bench o więcej niż cztery punkty. Nie jest to zatem dowód na to, że Qwen jest lepszym modelem agentowym. To, co jednak ustala, to fakt, że własna deklaracja Qwen mieści się w tym samym konkurencyjnym przedziale co audytowany graniczny model o otwartych wagach, a nie w obszarze niewiarygodnym. To pozycja znacząco mocniejsza niż „bez wyniku”.

Po drugie, porównanie architektur to obszar, w którym GLM po cichu wygrywa. GLM-5.2 aktywuje 40 miliardów parametrów z 753 miliardów. Ta jedna liczba mówi wszystko o koszcie serwowania, profilu opóźnień i o tym, że dobrze wyposażony zespół faktycznie może go uruchomić. Alibaba wciąż nie opublikował liczby aktywnych parametrów Qwena — co oznacza, że mimo całego szumu wokół 2,4T, nikt spoza Alibaby nie jest w stanie oszacować, ile kosztuje serwowanie Qwen3.8-Max ani jak zachowywałby się we własnym hostingu. W porównaniu architektur typu Mixture-of-Experts to nie przypis; to najważniejsza brakująca liczba.

Szczupły i sprawdzony kontra duży i niezweryfikowany

Argumentacja GLM-5.2 opiera się na spójnym stanowisku inżynieryjnym: rób więcej mniejszym kosztem, publikuj liczby, udostępniaj wagi. Model z 40B aktywnych parametrów jest tani w serwowaniu, szybki z założenia i możliwy do wdrożenia przez zespół z poważnym, ale nie absurdalnym budżetem na GPU. Jego audytowany indeks 51 i audytowany wynik Terminal-Bench 82.7 oznaczają, że kupujący nie bierze niczego na wiarę. A przy cenie $0.95 / $3.00 to mniej więcej połowa ceny Qwena.

Przypadek Qwen3.8-Max to przeciwny zakład: zbuduj największy możliwy model i pozwól, aby możliwości uzasadniły koszt. GA sprawiło, że ten argument jest znacznie mocniejszy niż był, ponieważ w końcu są do niego przypisane liczby — GPQA Diamond 92.6 w naukach ścisłych na poziomie zaawansowanym, OSWorld-Verified 86.1 w obsłudze interfejsów graficznych, FrontierSWE 73.5 wobec 40.7 poprzednika oraz wspomniany wyżej Terminal-Bench 86.6. To wyniki na poziomie frontier, a niemal podwojenie wyniku FrontierSWE to skok generacyjny, którego trudno w całości sfałszować.

Ale wciąż pozostają dwie luki i są to te same dwie, które miały znaczenie w lipcu. Nie ma niezależnego wyniku — Artificial Analysis i LMArena pozostają bez oceny dla Qwen3.8-Max, więc każde twierdzenie o jakości pochodzi od samego Alibaba. I nie ma licencji, więc obietnica otwartych wag nie może być jeszcze oceniona komercyjnie.

Historyczny punkt odniesienia przemawia tutaj przeciwko Qwen bardziej niż w większości zestawień: poprzednik Qwen3.7-Max uzyskał 46 w indeksie AA, poniżej 51 punktów GLM-5.2. Ukryte twierdzenie Alibaby nie jest jedynie takie, że Qwen3.8-Max jest dobry, ale że w ciągu jednej generacji przeskoczył z poziomu poniżej GLM do poziomu wyraźnie powyżej niego. Poprawa w FrontierSWE dodaje temu wiarygodności. Niezależny wynik rozstrzygnąłby tę kwestię.

Koszt w praktyce: gdzie ląduje 2×

Weź agentowy potok kodowania: 180 000 tokenów kontekstu repozytorium, 10 000 tokenów wyniku na uruchomienie.

GLM-5.2: 0.18M × $0.95 = $0.171, plus 0.01M × $3.00 = $0.03. ≈ $0.20 za jedno uruchomienie.

Qwen3.8-Max: 0.18M × $2 = $0.36, plus 0.01M × $6 = $0.06. ≈ $0.42 za uruchomienie.

• Przy 3 000 uruchomień/dzień: GLM ≈ $603/dzień; Qwen ≈ $1 260/dzień — różnica około $20 000 miesięcznie.

• Przy buforowanym wejściu Qwen w cenie $0.25/1M na stabilnym repozytorium, koszt jego uruchomienia spada do ≈ $0.11, co faktycznie jest niższe niż koszt niezbuforowanego GLM.

Ta ostatnia linia jest najbardziej praktycznie przydatną rzeczą w tym porównaniu. Cena katalogowa Qwen jest dwukrotnie wyższa niż GLM, ale wskaźnik trafień w cache wynoszący 0,25 USD za 1M jest na tyle agresywny, że dobrze skonfigurowany potok z cache może odwrócić ranking. Jeśli Twój agent przy każdej iteracji ponownie czyta w większości niezmieniony kontekst — co dotyczy większości agentów kodujących — Qwen może być w praktyce tańszą opcją, mimo gorszego cennika. Zespoły, które nie skonfigurują cache'owania, zapłacą podwójnie za nic.

Oba modele rozliczają tokeny myślenia jako wynik, więc konfiguracje wymagające intensywnego rozumowania kosztują więcej niż te szacunki po obu stronach.

Możliwość wdrażania: oś, którą posiada GLM

Oba to chińskie modele MoE o otwartych wagach z deklarowanym kontekstem 1M tokenów, co czyni wdrażalność najostrzejszą praktyczną różnicą.

Wagi GLM-5.2 można pobierać od czerwca, a przy 40B aktywnych parametrów to realistyczny cel do samodzielnego hostowania — kwantyzowalny, serwowalny na rozsądnej liczbie GPU i już wykorzystywany przez społeczność.

Wagi Qwen3.8-Max mają się pojawić w tym tygodniu, ale flagowiec nie jest realistycznym celem dla nikogo: około 1,2 TB przy kwantyzacji 4-bitowej wobec około 141 GB na H200 oznacza osiem lub więcej akceleratorów z najwyższej półki, a nieujawniona liczba aktywnych parametrów sprawia, że wynikowa przepustowość jest niemożliwa do przewidzenia. Do tego dochodzi brak licencji, więc samodzielne hostowanie flagowca na razie nie wchodzi w grę.

Jednocześnie ogłoszony Qwen3.8-27B to prawdziwa odpowiedź AliBaby na tej osi. Również udostępniany jako open-weights i podobno działający na około 17GB VRAM — pojedyncza karta z wyższej półki, znacznie poniżej zapotrzebowania GLM-5.2 — konkuruje bezpośrednio pod względem wdrażalności. Jeśli interesuje Cię uruchamianie któregoś z tych modeli we własnym zakresie, porównanie Qwen 27B z GLM-5.2 będzie tym, które naprawdę się liczy, i będzie to znacznie bardziej wyrównany pojedynek niż 2.4T kontra 753B.

FAQ

Czy Qwen 3.8 jest lepszy od GLM-5.2?

W jedynym wspólnym benchmarku Qwen deklaruje przewagę — Terminal-Bench 2.1: 86,6 wobec audytowanych 82,7 GLM. Jednak wynik Qwen jest raportowany samodzielnie, a GLM został zmierzony przez Artificial Analysis, a różnice w środowisku testowym mogą przekraczać cztery punkty. GLM-5.2 ma również audytowany indeks 51, podczas gdy Qwen nie ma żadnego niezależnego wyniku. GLM jest bezpieczniejszym wyborem; Qwen ma wyższy, niezweryfikowany sufit.

Jak wypadają na Terminal-Bench 2.1?

Qwen3.8-Max podaje wynik 86,6; Artificial Analysis zmierzyło GLM-5.2 na 82,7. To nominalna przewaga Qwena o 3,9 punktu i pierwsze nakładanie się ich wyników na tym samym benchmarku. Należy to traktować jako dowód, że Qwen jest konkurencyjny w tym paśmie, a nie jako dowód, że jest na prowadzeniu, ponieważ tylko wynik GLM uzyskano niezależnie.

Które jest tańsze?

GLM-5.2 w cenniku — 0,95 USD / 3,00 USD za 1M (AA blended ~0,90 USD) w porównaniu z 2 USD / 6 USD Qwena, czyli mniej więcej połowa. Ale wejście z pamięci podręcznej Qwena po 0,25 USD za 1M jest na tyle agresywne, że potok w dużym stopniu korzystający z pamięci podręcznej może okazać się tańszy na Qwenie niż na GLM bez pamięci podręcznej.

Ile aktywnych parametrów wykorzystuje Qwen 3.8 Max?

Alibaba nigdy nie opublikował tej liczby, nawet w momencie ogólnej dostępności. To liczba, która determinuje koszt obsługi i opóźnienia w modelu Mixture-of-Experts, więc jej brak to realna luka. GLM-5.2, w przeciwieństwie do tego, jest udokumentowany jako 40B aktywnych parametrów z 753B łącznych.

Które mogę faktycznie hostować samodzielnie?

GLM-5.2 dziś — wagi są już dostępne, a 40B aktywnych czyni go praktycznym. Wagi Qwen3.8-Max są obiecane w ciągu tygodnia, ale flagowiec potrzebuje ośmiu lub więcej GPU klasy H200 przy ~1,2 TB w 4-bitach, a licencja nie została jeszcze opublikowana. Ogłoszony równocześnie Qwen3.8-27B, podobno ~17 GB VRAM, jest opcją do wdrożenia i bliższym odpowiednikiem niszy GLM.

Czy Qwen 3.8 Max opuścił już wersję preview?

Tak, 3 sierpnia 2026 r., z opublikowaną kartą taryfową i punktem końcowym zgodnym z OpenAI i DashScope. Lipcowa kampania kredytów Qoder z 90% zniżką nie opisuje już sposobu ich sprzedaży.

Co oferuje Qwen, czego nie oferuje GLM-5.2?

Rodzima multimodalność — obsługa obrazów i wideo, z deklarowanym wynikiem 92.1 w OmniDocBench za parsowanie dokumentów — oraz kontekst 1M tokenów rozliczany według stałej stawki bez dopłat za długie prompty. GLM-5.2 jest nastawiony na tekst, więc w przypadku potoków do dokumentów, zrzutów ekranu czy wideo Qwen nie tyle z nim konkuruje, ile robi coś innego.

Konkluzja

Qwen 3.8 vs GLM-5.2to starcie, w którym ogólna dostępność wniosła najwięcej prawdziwie nowych informacji. Po raz pierwszy Qwen ma wynik w benchmarku, który przeprowadził również niezależny ewaluator, i plasuje się wyżej niż GLM: Terminal-Bench 2.1 86,6 wobec 82,7. To przesuwa Qwen z „bez wyniku" do „wiarygodnie konkurencyjnego na zmierzonym gruncie", co jest realnym postępem, nawet biorąc pod uwagę zastrzeżenie o samodzielnie raportowanych wynikach.

Ale GLM-5.2 utrzymuje praktyczną koronę, i to dzięki niepozornym atutom: połowie ceny, audytowanemu indeksowi 51, 40B aktywnym parametrom, które czynią jego ekonomikę przewidywalną, a wdrożenie osiągalnym, oraz wagom, które można pobrać już teraz. Odpowiedzi Qwena — płaski kontekst miliona tokenów, natywna multimodalność i wyższy sufit — są znaczące, ale warunkowe, a jego dwie lipcowe luki są niezmienne: brak niezależnego wyniku i brak licencji. Obserwuj trzy rzeczy: pierwszy niezależny wynik Intelligence Index dla Qwen3.8-Max, to, czy ewaluator odtworzy wynik 86.6 w Terminal-Bench, oraz wydanie Qwen3.8-27B, gdzie te dwie filozofie naprawdę się zderzą. Do tego czasu GLM-5.2 jest tym, co wdrażasz, a Qwen3.8-Max tym, co oceniasz — z włączonym buforowaniem.

Porównane w tym artykule4

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie