Wygenerowana karta hero zatytułowana „NV-Reason-CT vs GLM-5.2" z podtytułem „Jedna z nich jest przestarzała i nie jest to ta, o której myślisz". Dwie zwrócone do siebie karty są rozdzielone parą niebieskich strzałek: lewa karta ma etykietę „NV-Reason-CT" z ikoną skanowania ciała i opisem „wydana we wrześniu 2026 – aktualna – tylko TK klatki piersiowej i jamy brzusznej"; prawa karta ma etykietę „GLM-5.2" z ikoną chipu i opisem „wydana w czerwcu 2026 – zastąpiona przez GLM-5.3 – przestarzała w Artificial Analysis". Logo OrcaRouter jest nałożone w prawym dolnym rogu.
Guides & Insights

NV-Reason-CT vs GLM-5.2: Jeden z nich jest przestarzały, i to nie ten, o którym myślisz

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Starszy model w tym porównaniu to ten, który jest wycofywany. GLM-5.2 został wydany 16 czerwca 2026 r.; NV-Reason-CT ma aktywność w repozytorium datowaną na okres od 2 do 25 września 2026 r. Można by oczekiwać, że ten wrześniowy będzie niepewną wielkością, a czerwcowy — ustalonym wyborem. Jest odwrotnie na osi, która ma znaczenie dla potoku przetwarzania tekstu: GLM-5.2 został zastąpiony przez GLM-5.3, który ukazał się 18 sierpnia 2026 r., a teraz nosi znacznik wycofania na niezależnym rankingu, w którym publikowane są jego wyniki. NV-Reason-CT, cokolwiek jeszcze pozostaje w nim nierozstrzygnięte, jest bieżącym wydaniem jedynej rzeczy, którą robi.

Zatem pierwszym użytecznym zdaniem w tym artykule jest to, które czytelnik najmniej prawdopodobnie już zna: jeśli dziś zaczynasz projekt tekstowy i z nawyku sięgasz po GLM-5.2, zatrzymaj się i najpierw spójrz na GLM-5.3. Kosztuje 1,26 USD za milion tokenów wejściowych i 3,96 USD za milion tokenów wyjściowych w porównaniu z 1,40 USD i 4,40 USD w przypadku GLM-5.2 — jest zarówno nowszy, jak i tańszy — a jego niezależny wskaźnik inteligencji wynosi 44,8 wobec 33,7, co jest krokiem w górę na tej samej skali, a nie krokiem w bok. To odrębna decyzja od wszystkiego, co ma związek z CT, i zasługuje na to, by podjąć ją osobno.

Dwa modele i dwa różne rodzaje nieaktualności

Istnieje prawdziwa różnica między modelem, który jest stary, a modelem, który został zastąpiony, i to zestawienie czyni ją konkretną.

• Co robi — NV-Reason-CT odczytuje objętość tomografii komputerowej klatki piersiowej lub jamy brzusznej i generuje uporządkowane wyniki według regionów anatomicznych; GLM-5.2 to wyłącznie tekstowy model językowy do rozumowania, kodu i pracy z długimi dokumentami

• Opublikowano — artefakty NV-Reason-CT pochodzą z okresu od 2 do 25 września 2026 r.; GLM-5.2 – 16 czerwca 2026 r., a GLM-5.3 pojawił się 18 sierpnia 2026 r.

• Status generacji — NV-Reason-CT to wersja 0.1, pierwsze wydanie, nieogłoszone; GLM-5.2 to poprzednia generacja linii produktowej będącej w sprzedaży

• Niezależna pozycja — nie istnieją niezależne pomiary NV-Reason-CT; GLM-5.2 uzyskuje wynik 33.7 w Artificial Analysis Intelligence Index, z oznaczeniem wycofania, w porównaniu z GLM-5.3 na poziomie 44.8

• Licencja i dostęp — wagi OpenMDW-1.1, które pobierasz; w porównaniu z modelem o otwartych wagach udostępnianym po 1,40 USD i 4,40 USD za milion tokenów, z odczytami z pamięci podręcznej po 0,26 USD

• Kontekst — 13 824 tokeny wizualne na wolumen bez okna czatu; w porównaniu z 1 000 000 tokenów wejściowych i 128 000 wyjściowych

• Deklarowane zastosowanie — wyłącznie do celów badawczych i edukacyjnych, nie jest wyrobem medycznym; przeciw wdrożeniom ogólnego przeznaczenia

Słowo „deprecated” odgrywa tu precyzyjną rolę i nie warto go nadinterpretować. Znacznik deprecacji na tabeli liderów oznacza, że ewaluator przestał uznawać model za aktualny, zwykle dlatego, że jego miejsce zajął następca. Nie oznacza to, że wagi zostały wycofane, API wyłączone albo że model przestał działać. Zespoły, których potoki są dostrojone pod GLM-5.2, nie mają kłopotów. Oznacza natomiast, że jego wyniki to migawka sprzed pojawienia się GLM-5.3 i że mieszanie ich z aktualnymi liczbami innych modeli to porównywanie czerwcowego pomiaru z wrześniową stawką.

Liczby, które ma każda ze stron, i ile są warte

Rejestr GLM-5.2 jest wyjątkowo bogato wypełniony, a pochodzi z dwóch źródeł, które w pouczający sposób się ze sobą nie zgadzają.

Według własnych raportów Z.ai model osiąga 99,12 w τ²-Bench, 62,1 w SWE-bench Pro, 54,7 w Humanity's Last Exam z narzędziami i najlepszy raportowany wynik 82,7 w Terminal-Bench 2.1. Po stronie niezależnej Artificial Analysis mierzy ten sam model na 77,9 w Terminal-Bench 2.1, 33,7 w swoim Intelligence Index, 89,5 w GPQA Diamond i 41,1 w Humanity's Last Exam. Istnieją też inne dane dostawcy — 99,2 w AIME 2026, 92,5 w HMMT February 2026, 91 w IMOAnswerBench, 74,4 w FrontierSWE, 63,7 w ProgramBench, 76,8 w MCP-Atlas — i wszystkie pochodzą od Z.ai.

Dwie rzeczy na tej liście zasługują na wymienienie. Po pierwsze, różnica 4,8 punktu w Terminal-Bench 2.1 między najlepszym raportowanym przez dostawcę wynikiem 82,7 a niezależnym 77,9 nie jest sprzecznością. Najlepsze raportowane przez dostawców wyniki to zazwyczaj najlepszy rezultat spośród kilku środowisk testowych, a własny wynik Terminus-2 firmy Z.ai dla tego samego benchmarku to 81 — niezależny pomiar mieści się w zakresie podanym przez samego dostawcę. Po drugie, rozbieżność w Humanity's Last Exam jest większa: 41,1 niezależnie wobec 40,5 bez narzędzi i 54,7 z nimi według dostawcy, co oznacza, że nagłówkowe 54,7 to wynik wspomagany narzędziami, a 41,1 to wynik bez narzędzi. Cytowanie 54,7 obok wyniku innego modelu uzyskanego bez narzędzi byłoby prawdziwym błędem.

Bilans NV-Reason-CT nie ma takiej dwuźródłowej struktury i właśnie w tym jest słabszy. Jego wyniki w CT-RATE — 0,614 F1 i 0,871 AUROC dla osiemnastu etykiet, przy stałym jednolitym progu oraz bezpośrednim prompcie typu tak/nie i bez głowicy klasyfikacyjnej ani dostosowania do konkretnego zadania — są wynikami samej NVIDIA. Modele, z którymi jest porównywany w tej pracy (VoxelFM 0,581, Pillar-0 0,544, ClinFusion-8B 0,442, CT-CLIP 0,398, Merlin 0,358, MedGemma 1.5 0,303), to wyłącznie modele obrazowe. Nic nie zostało niezależnie odtworzone, a model można pobierać od tygodni. Podaje również makro-F1 wyliczony na podstawie raportów na poziomie 0,592 oraz wstępne badanie z ekspertami radiologami, wiążące wspomagany przegląd z 50-procentowym skróceniem średniego raportowanego czasu interpretacji, co sami autorzy wskazują jako poważny problem małej próby.

Zatem porównanie proweniencji nie przemawia na korzyść nowszego modelu i właśnie nad tym warto się zatrzymać. GLM-5.2 to starszy, zastąpiony model, a jego liczby są bardziej godne zaufania niż liczby NV-Reason-CT, ponieważ ktoś spoza firmy uruchomił środowisko testowe. Bycie aktualnym to nie to samo co bycie zweryfikowanym.

A generated scoreboard titled 'Provenance, not recency, decides what to trust' with two columns. The left column, headed 'NV-Reason-CT', lists five rows: CT-RATE F1 0.614 and AUROC 0.871; provenance, the authors paper only; independent checks, none; model status, version 0.1, unannounced, current; licence, OpenMDW-1.1, research and education only. The right column, headed 'GLM-5.2', lists five rows: AA Intelligence 33.7, GPQA Diamond 89.5; provenance, vendor and Artificial Analysis; independent checks, yes, with a 4.8-point vendor-versus-independent gap on Terminal-Bench 2.1; model status, superseded by GLM-5.3 and deprecated by the evaluator; licence, open weights at $1.40 and $4.40 per million. A footer reads 'The superseded model is the better-verified one. Recency is not the same as evidence.'

Dlaczego deprecacja ma większe znaczenie, niż się wydaje

To porównanie ma na celu zapobieżenie konkretnej awarii, która w ogóle nie dotyczy CT.

Zespół budujący pipeline tekstu klinicznego szuka modelu o otwartych wagach do uruchomienia na własnym sprzęcie, ponieważ dane są wrażliwe. Znajdują GLM-5.2, który ma licencję MIT, 743 miliardy parametrów, z czego około 40 miliardów aktywnych, spełnia wymagania i ma dobrze udokumentowane wyniki benchmarków. Dostrajają swoje rozwiązanie pod niego. Sześć miesięcy później odkrywają, że obecna generacja to GLM-5.3, że ma kontekst 1M z limitem wyjścia 128K, że jest tańsza przy $1.26 i $3.96 oraz że decyzja, którą — jak sądzili — podejmowali — na którym modelu o otwartych wagach się ustandaryzować — była w rzeczywistości decyzją o tym, którą generację wybrać, i podjęli ją przez przypadek.

To kosztowny błąd, który można odkryć za późno, a można go uniknąć dzięki jednemu sprawdzeniu. Konkretna wskazówka:

• Sprawdź, czy model, który chcesz przyjąć jako standard, jest aktualnej generacji — znacznik wycofania na liście rankingowej to najszybszy sygnał, a lista modeli samego dostawcy jest źródłem autorytatywnym

• Nie mieszaj czerwcowego zestawienia z wrześniowymi liczbami — wskaźnik 33,7 modelu GLM-5.2 został zmierzony, zanim GLM-5.3 w ogóle istniał, a zestawienie go ze wskaźnikiem obecnego modelu porównuje dwa różne momenty w zmieniającej się dziedzinie

• Uważaj na nazwę — pozycja „GLM-5.3 Prime" to poziom serwowania oferujący te same wagi za mniej więcej dwukrotność ceny katalogowej, a nie osobny model. Zanim zapłacisz więcej, sprawdź, jakie wagi stoją za danym SKU

• Niższą stawkę z cennika traktuj jako pytanie, a nie odpowiedź — to, że GLM-5.3 jest tańszy od swojego poprzednika, jest nietypowe i warto zweryfikować to na własnym obciążeniu, zamiast zakładać

Nic z tego nie czyni GLM-5.2 złym wyborem. Model o 743 mld parametrów na licencji MIT, w cenie 1,40 i 4,40 USD, względem którego zespół już dostroił swoje rozwiązania, jest całkowicie rozsądną rzeczą do dalszego utrzymywania, a model ze środka generacji o ugruntowanej historii bywa dokładnie tym, czego potrzebuje regulowany przepływ pracy. Chodzi o to, że powinien to być wybór dokonany świadomie, a nie domyślne ustawienie odziedziczone z listy, która była aktualna w lipcu.

Pułapka w porównywaniu modelu tekstowego z modelem CT

Powód, dla którego to zestawienie w ogóle wygląda wiarygodnie, jest taki, że oba są modelami z otwartymi wagami wydanymi w 2026 roku, a czytelnik przeglądający katalog widzi dwie porównywalne pozycje. Nie są porównywalne, a to niedopasowanie ma określony kształt.

GLM-5.2 obsługuje 1 000 000 tokenów. Pojedyncza objętość CT w NV-Reason-CT kosztuje 13 824 tokenów wizualnych. Zgodnie z tą arytmetyką GLM-5.2 mógłby pomieścić siedemdziesiąt badań CT i wciąż mieć zapas, co nasuwa wniosek, że wystarczająco długokontekstowy model tekstowy czyni model obrazowania zbędnym. Ten wniosek nie wynika, a przyczyną jest interfejs, a nie budżet.

Te 13 824 tokeny nie są podsumowaniem. To 384-milimetrowy sześcian poddany resamplingowi do 2 mm izotropowo, pocięty na 8 x 8 x 8 fragmentów na siatce 24 x 24 x 24, przekazany do backbone'u językowego bez przestrzennego downsamplingu i bez warstwy scalającej — dlatego aktywna ścieżka to 4,35 mld parametrów z 4,69 mld całkowitych, i dlatego moc obliczeniowa jest zużywana na utrzymanie rozdzielczości, a nie na jej kompresowanie. GLM-5.2 jest wyłącznie tekstowy. Nie ma w ogóle ścieżki wizyjnej, więc pytanie, jak poradziłby sobie ze skanem, nie pojawia się; odpowiedź brzmi: nie można mu go przekazać w żadnej formie. Dwie karty modeli opisują sześciusetkrotną różnicę w budżecie tokenów, która nie ma nic wspólnego z porównaniem, ponieważ jeden z nich nie ma możliwości odebrania danych wejściowych.

Odwrotna pomyłka jest równie możliwa. NV-Reason-CT obsługuje klatkę piersiową i jamę brzuszną, przyjmuje plik NIfTI, a nie prompt, nie korzysta z narzędzi, a jego karta modelu ogranicza go do zastosowań badawczych i edukacyjnych oraz stwierdza, że nie jest wyrobem medycznym, a wyniki mogą być nieprawidłowe. Nie potrafi znormalizować korpusu raportów, napisać środowiska ewaluacyjnego ani wnioskować na podstawie dokumentu z wytycznymi. Model obrazowy o 4,7 mld parametrów nie zastępuje modelu tekstowego o 743 mld parametrów, podobnie jak odwrotnie.

A generated scoreboard titled 'Two open-weight models, two different jobs' listing six paired rows. Row one: what it reads, one-channel NIfTI volumes in Hounsfield units against text only. Row two: context, 13,824 visual tokens per volume against 1,000,000 tokens in and 128,000 out. Row three: parameters, 4.69B total and 4.35B active against 743B total and about 40B active. Row four: generation status, version 0.1 current, unannounced against superseded by GLM-5.3. Row five: price, self-hosted with no rate card against $1.40 and $4.40 per million, or $1.26 and $3.96 for the successor. Row six: stated use, research and education, not a medical device against general purpose. A footer reads 'GLM-5.2 figures per the provider and Artificial Analysis; NV-Reason-CT figures per the authors paper.'

Umieszczanie połowy tekstu na jednym klawiszu

Jeśli pytanie brzmi, na którym modelu tekstowym realizować pracę pipeline'u, odpowiedź dziś to prawdopodobnie GLM-5.3, a nie GLM-5.2 — a oba są w naszym katalogu pod jednym kluczem. z-ai/glm-5.2 jest udostępniany według stawki z listy dostawcy Z.ai, bez marży, a obok niego GLM-5.3, w ramach jednego API obejmującego ponad 200 modeli. Utrzymanie dostępności obu ma większe znaczenie niż zwykle w okresie zmiany generacji: możesz zmierzyć następcę na własnym korpusie, zanim podejmiesz decyzję, a w tym czasie zachować dotychczasowy model jako rozwiązanie awaryjne i przełączyć się bez drugiej umowy czy zmiany w kodzie.

Stawka przekazywana bez narzutu zasługuje na jedno zdanie z tego samego powodu, dla którego ma znaczenie w każdym modelu, którego dostawca zmienia ceny. Bez pośredniej warstwy narzutu zmiana stawek dostawcy trafia na naszą stronę tego samego dnia. Automatyczne przełączanie awaryjne obejmuje przypadek, gdy dostawca traci wydajność w trakcie przetwarzania partii, co przy długim zadaniu ekstrakcji jest awarią, która faktycznie kosztuje całą noc, a DSL routingu pozwala kierować pojedyncze żądania do modelu, który powinien je obsłużyć, zamiast kierować wszystko do jednego punktu końcowego.

NV-Reason-CT nie znajduje się na naszej platformie, podobnie jak żaden model NVIDIA. Warto powiedzieć to wprost, zamiast pozostawiać domysłom: część CT tej architektury to pobrane wagi na własnym sprzęcie, objęte licencją, która na to pozwala, oraz kartą modelu, która zabrania użycia klinicznego. Nie hostujemy go i nie zamierzamy napisać zdania, które sugerowałoby inaczej.

Kolejność, w jakiej należy podejmować te decyzje

Właściwa kolejność dla builda klinicznego to nie ta, którą sugeruje porównanie.

Zacznij od kwestii generowania tekstu i zacznij od sprawdzenia, która generacja jest aktualna — GLM-5.3, a nie GLM-5.2, pod względem ceny i zmierzonych możliwości, chyba że masz powód, by pozostać przy obecnej. Następnie zmierz opóźnienie modelu CT na jedno badanie na własnym sprzęcie, ponieważ ta liczba nie została opublikowana i determinuje resztę budżetu. Potem zaprojektuj potok tak, aby obie połowy były niezależnie wymienialne, ponieważ jedna jest w cyklu życia zbliżonym do wersji zapoznawczej, a druga jest w wersji 0.1.

Jedyne, czego nie należy robić, to traktować je jako wybór. Zastąpiony model tekstowy 743B i aktualny model CT 4.69B nie mają ze sobą wspólnego zadania. Porównanie ma sens tylko ze względu na to, co ujawnia: że za nowszym artefaktem stoją słabsze dowody, że starszy po cichu wypadł z generacji oraz że oba te fakty są niewidoczne dla każdego, kto czyta wiersz katalogu, w którym wymienia się je obok siebie tak, jakby były alternatywami.

A screenshot of the OrcaRouter model page for GLM 5.2, showing the identifier z-ai/glm-5.2 with a Featured badge and tags for Tools, JSON and Reasoning, the description of it as Z.ai's flagship model for long-horizon tasks with a 1M-token context window and up to 128K output tokens, a side panel listing a 1M-token context window and 128K maximum output with text input and text output, and a stat strip reading $1.40 per million input tokens, $4.40 per million output tokens, and a p50 time to first token under five seconds.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie