
NV-Reason-CT vs GLM-5.2: En av dessa är utfasad, och det är inte den du tror
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 97 tok/s
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 182 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
Den äldre modellen i den här jämförelsen är den som fasas ut. GLM-5.2 släpptes den 16 juni 2026; NV-Reason-CT har aktivitet i kodförrådet daterad mellan 2 och 25 september 2026. Man skulle förvänta sig att septembermodellen är den osäkra faktorn och junimodellen det etablerade valet. Det motsatta gäller på den axel som spelar roll för en textpipeline: GLM-5.2 har ersatts av GLM-5.3, som släpptes den 18 augusti 2026, och den har nu en utfasningsmarkering på den oberoende resultattavlan där dess siffror publiceras. NV-Reason-CT, vad som än annars är oklart med den, är den aktuella utgåvan av det enda den gör.
Så den första användbara meningen i den här artikeln är den som en läsare minst sannolikt redan har: om du startar ett textbygge idag och av gammal vana sträcker dig efter GLM-5.2, stanna upp och titta på GLM-5.3 först. Det kostar $1.26 per miljon indatatoken och $3.96 per miljon utdatatoken mot GLM-5.2:s $1.40 och $4.40 — det är både nyare och billigare — och dess oberoende intelligensindex är 44.8 mot 33.7, vilket är ett steg upp på samma skala snarare än ett steg i sidled. Det är ett separat beslut från allt som har med CT att göra, och det förtjänar att fattas separat.
De två modellerna, och de två olika typerna av gammalt
Det finns en verklig skillnad mellan en modell som är gammal och en modell som är ersatt; denna kombination gör den konkret.
• Vad den gör — NV-Reason-CT läser en CT-volym av bröstkorgen eller buken och avger strukturerade fynd per anatomisk region; GLM-5.2 är en textbaserad språkmodell för resonemang, kod och arbete med långa dokument
• Släppt — NV-Reason-CT:s artefakter är daterade från 2 till 25 september 2026; GLM-5.2 den 16 juni 2026, med GLM-5.3 som följde den 18 augusti 2026
• Generationsstatus — NV-Reason-CT är version 0.1, en första utgåva, ej annonserad; GLM-5.2 är föregående generation av en produktlinje som redan levereras
• Oberoende ställning — inga oberoende mätningar av NV-Reason-CT finns; GLM-5.2 mäts till 33,7 på Artificial Analysis Intelligence Index, med en utfasningsmarkör, mot GLM-5.3 på 44,8
• Licens och åtkomst — OpenMDW-1.1-vikter som du laddar ner; jämfört med en modell med öppna vikter som serveras för $1,40 och $4,40 per miljon tokens med cachade läsningar för $0,26
• Kontext — 13 824 visuella tokens per volym utan chattfönster; mot 1 000 000 tokens in och 128 000 ut
• Angiven användning — endast forskning och utbildning, inte en medicinteknisk produkt; mot allmän driftsättning
Ordet "deprecated" gör ett precist arbete här och det är värt att inte övertolka. En deprecation-markering på en resultattavla betyder att utvärderaren har slutat behandla modellen som aktuell, vanligtvis eftersom en efterträdare har tagit dess plats. Det betyder inte att vikterna har dragits tillbaka, att API:et har stängts av eller att modellen har slutat fungera. Team med pipelines som är trimmade mot GLM-5.2 är inte i knipa. Vad det innebär är att dess siffror är en ögonblicksbild från innan GLM-5.3 existerade, och att blanda dem med aktuella siffror för andra modeller är att jämföra en junimätning med ett septemberfält.
Siffrorna varje sida har, och vad de är värda
GLM-5.2:s resultat är ovanligt välfyllt och det kommer från två källor som går isär på ett lärorikt sätt.
Enligt Z.ai:s egen rapportering får modellen 99,12 på τ²-Bench, 62,1 på SWE-bench Pro, 54,7 på Humanity's Last Exam med verktyg och ett bäst rapporterat resultat på 82,7 på Terminal-Bench 2.1. På oberoende håll mäter Artificial Analysis samma modell till 77,9 på Terminal-Bench 2.1, 33,7 på sitt Intelligence Index, 89,5 på GPQA Diamond och 41,1 på Humanity's Last Exam. Det finns andra leverantörssiffror – 99,2 på AIME 2026, 92,5 på HMMT February 2026, 91 på IMOAnswerBench, 74,4 på FrontierSWE, 63,7 på ProgramBench, 76,8 på MCP-Atlas – och de är alla Z.ai:s.
Två saker i den listan förtjänar att nämnas. För det första är spridningen på 4,8 punkter i Terminal-Bench 2.1 mellan leverantörens högst rapporterade 82,7 och det oberoende resultatet 77,9 ingen motsägelse. Leverantörens högst rapporterade siffror är vanligtvis de bästa resultaten från flera testramverk, och Z.ai:s eget Terminus-2-resultat för samma benchmark är 81 – det oberoende resultatet ligger inom leverantörens eget intervall. För det andra är skillnaden för Humanity's Last Exam större: 41,1 oberoende mot en leverantörssiffra på 40,5 utan verktyg och 54,7 med dem, vilket innebär att rubriksiffran 54,7 är ett verktygsassisterat resultat och att 41,1 är den utan verktyg. Att citera 54,7 bredvid en annan modells poäng utan verktyg skulle vara ett verkligt fel.
NV-Reason-CT:s resultat har ingen sådan tvåkällsstruktur, och det är just där den är svagare. Dess CT-RATE-resultat — 0,614 F1 och 0,871 AUROC över arton etiketter, med en fast enhetlig tröskel och en direkt ja/nej-prompt och inget klassificeringshuvud eller uppgiftsspecifik anpassning — är NVIDIAs egna. Modellerna som den jämförs med i den artikeln (VoxelFM 0,581, Pillar-0 0,544, ClinFusion-8B 0,442, CT-CLIP 0,398, Merlin 0,358, MedGemma 1.5 0,303) är alla bildmodeller. Ingenting har reproducerats oberoende, och modellen har varit nedladdningsbar i veckor. Den rapporterar också en rapporthärledd macro-F1 på 0,592 och en preliminär expertradiologstudie som kopplar assisterad granskning till en 50 % minskning av genomsnittlig rapporterad tolkningstid, vilket författarna själva flaggar som allvarligt litet urval.
Så proveniensjämförelsen gynnar inte den nyare modellen, och det här är poängen som är värd att stanna upp vid. GLM-5.2 är den äldre, ersatta modellen, och dess siffror är mer tillförlitliga än NV-Reason-CT:s, eftersom någon utanför företaget körde testramverket. Att vara aktuell är inte samma sak som att vara verifierad.

Varför utfasningen spelar större roll än vad det låter
Det finns ett specifikt fel som denna jämförelse är utformad för att förhindra, och det handlar inte alls om CT.
Ett team som bygger en pipeline för klinisk text letar efter en modell med öppna vikter att köra på sin egen hårdvara, eftersom data är känslig. De hittar GLM-5.2, som är MIT-licensierad med 743 miljarder parametrar och ungefär 40 miljarder aktiva, passar deras behov och har en väldokumenterad benchmarkhistorik. De finjusterar mot den. Sex månader senare upptäcker de att den aktuella generationen är GLM-5.3, att den har 1M-kontext med ett utdatatak på 128K, att den är billigare till $1,26 och $3,96, och att beslutet de trodde att de fattade – vilken modell med öppna vikter de skulle standardisera på – egentligen var ett beslut om vilken generation, och de fattade det av misstag.
Det är en dyr olycka att upptäcka sent, och den går att undvika med en enda uppslagning. Den konkreta vägledningen:
• Kontrollera om modellen du är på väg att standardisera på är den aktuella generationen — en utfasningsmarkör på en resultattavla är den snabbaste signalen, och leverantörens egen modellista är den auktoritativa
• Blanda inte en ögonblicksbild från juni med siffror från september — GLM-5.2:s index på 33,7 mättes innan GLM-5.3 existerade, och att ställa det bredvid indexet för en aktuell modell jämför två olika ögonblick i ett fält i rörelse
• Akta dig för namnet — en "GLM-5.3 Prime"-listning är en serveringsnivå som levererar samma vikter till ungefär dubbla listpriset, inte en separat modell. Kontrollera vikterna bakom varje SKU innan du betalar ett premiumpris för den
• Betrakta ett lägre annonserat pris som en fråga, inte ett svar — att GLM-5.3 är billigare än sin föregångare är ovanligt och värt att verifiera mot din egen arbetsbelastning i stället för att anta
Inget av det gör GLM-5.2 till ett dåligt val. En MIT-licensierad 743B-modell för 1,40 och 4,40 dollar som ett team redan har finjusterat mot är en helt rimlig sak att fortsätta köra, och en mellangenerationsmodell med en etablerad historik är ibland precis vad ett reglerat arbetsflöde vill ha. Poängen är att det borde vara ett val, fattat med avsikt, snarare än ett standardval som ärvts från en lista som var aktuell i juli.
Fällan i att jämföra en textmodell med en CT-modell
Anledningen till att den här parkopplingen alls verkar rimlig är att båda är modeller med öppna vikter som släpptes 2026, och en läsare som skannar en katalog ser två jämförbara radposter. De är inte jämförbara, och missmatchningen har en specifik form.
GLM-5.2 rymmer 1 000 000 tokens. En enskild CT-volym för NV-Reason-CT kostar 13 824 visuella tokens. Enligt den matematiken skulle GLM-5.2 kunna rymma sjuttio CT-studier och ändå ha utrymme kvar, vilket inbjuder till slutsatsen att en textmodell med tillräckligt lång kontext gör bildmodellen överflödig. Slutsatsen följer inte, och orsaken är gränssnittet snarare än budgeten.
Dessa 13 824 tokens är inte en sammanfattning. De är en 384-millimeterskub omsamplad till 2 mm isotrop, uppdelad i 8 x 8 x 8-patchar på ett 24 x 24 x 24-rutnät, överlämnad till en språk-backbone utan spatial nedsampling och utan sammanslagningslager — vilket är varför den aktiva vägen är 4,35B parametrar av totalt 4,69B, och varför beräkningskraften läggs på att behålla upplösning i stället för att komprimera bort den. GLM-5.2 är endast för text. Den har ingen visionsväg alls, så frågan om hur den skulle hantera en skanning uppstår inte; svaret är att den inte kan ges en sådan i någon form. De två modellkorten beskriver en sexhundrafaldig skillnad i tokenbudget som inte har något med jämförelsen att göra, eftersom en av dem inte har något sätt att ta emot indata.
Det omvända misstaget är precis lika möjligt. NV-Reason-CT stöder bröstkorg och buk, tar en NIfTI-fil i stället för en prompt, har ingen verktygsanvändning, och dess modellkort begränsar den till forskning och utbildning samt anger att den inte är en medicinteknisk produkt och att utdata kan vara felaktiga. Den kan inte normalisera en rapportkorpus, skriva ett utvärderingsramverk eller resonera kring ett riktlinjedokument. En bildmodell på 4,7B ersätter inte en textmodell på 743B, lika lite som det omvända.

Att lägga texthalvan på en tangent
Om frågan är vilken textmodell som pipeline-arbetet ska köras på är svaret i dag troligen GLM-5.3 snarare än GLM-5.2 – och båda finns i vår katalog under en och samma nyckel. z-ai/glm-5.2 serveras till Z.ai:s leverantörslistpris utan påslag, och GLM-5.3 vid sidan av den, i ett och samma API som täcker fler än 200 modeller. Att hålla båda tillgängliga är viktigare än vanligt under ett generationsskifte: du kan mäta efterträdaren på din egen korpus innan du bestämmer dig, behålla den sittande modellen som reserv medan du gör det och byta utan ett andra avtal eller en kodändring.
Vidarefaktureringsgraden förtjänar en mening av samma skäl som den spelar roll på varje modell vars leverantör ändrar sina priser. Utan något påslagslager emellan landar en ändring i leverantörens pris hos oss samma dag. Automatisk redundansväxling täcker en leverantör som försämras mitt i en batch, vilket för ett långt extraheringsjobb är det fel som faktiskt kostar en natt, och routnings-DSL:en låter dig skicka enskilda förfrågningar till den modell som bör hantera dem i stället för att rikta allt mot en enda slutpunkt.
NV-Reason-CT finns inte på vår plattform, och det gör ingen NVIDIA-modell heller. Det är värt att säga rakt ut i stället för att låta det vara underförstått: CT-sidan av den här arkitekturen är nedladdade vikter på din egen hårdvara, under en licens som tillåter det och ett modellkort som förbjuder klinisk användning. Vi hostar den inte och vi kommer inte att skriva en mening som antyder något annat.
Ordningen i vilken dessa beslut ska fattas
Den rätta sekvensen för en klinisk build är inte den som jämförelsen antyder.
Börja med frågan om textgenerering, och börja den genom att kontrollera vilken generation som är aktuell — GLM-5.3 snarare än GLM-5.2, vad gäller pris och uppmätt förmåga, såvida du inte har en anledning att stanna kvar. Mät sedan CT-modellens latens per studie på din egen hårdvara, eftersom den siffran är opublicerad och styr resten av budgeten. Utforma sedan pipelinen så att de två halvorna kan ersättas oberoende av varandra, eftersom den ena har en förhandsversionsnära livscykel och den andra är på version 0.1.
Det enda man inte ska göra är att behandla de två som ett val. En ersatt 743B-textmodell och en aktuell 4.69B CT-modell har inte någon uppgift gemensam. Jämförelsen är bara värd att göra för vad den avslöjar: att den nyare artefakten har svagare belägg bakom sig, att den äldre tyst har fallit ur generationen, och att båda fakta är osynliga för den som läser en katalograd som listar dem sida vid sida som om de vore alternativ.

Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
