Qwen 3.8 versus GLM-5.2: De eerste benchmark waarin ze daadwerkelijk overlappen
Guides & Insights

Qwen 3.8 versus GLM-5.2: De eerste benchmark waarin ze daadwerkelijk overlappen

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Deze twee modellen zijn de duidelijkste uitdrukking van tegenovergestelde inzetten in Chinese open-weight AI. Zhipu's GLM-5.2 is slank en bewezen: 753B totale parameters met slechts 40B actief, een gecontroleerde Artificial Analysis Intelligence Index van 51, gewichten downloadbaar sinds juni 2026, en een gepubliceerde prijs van $0,95 / $3,00. Alibaba's Qwen3.8-Max is de maximalistische inzet: ~2,4T parameters, een niet bekendgemaakt aantal actieve parameters, en — tot voor kort — helemaal geen cijfers.

Algemene beschikbaarheid op 3 augustus 2026 gaf deze onderlinge vergelijking iets wat geen enkel ander artikel in deze serie heeft: een benchmark waar beide modellen een score op hebben. Alibaba rapporteert Terminal-Bench 2.1 op 86,6; Artificial Analysis geeft GLM-5.2 een geauditeerde score van 82,7 op dezelfde test. Voor het eerst kan de claim van Qwen naast een onafhankelijk gemeten cijfer van een concurrent op identieke basis worden geplaatst — met de belangrijke kanttekening dat slechts één van de twee door een scheidsrechter is geproduceerd.

Een opmerking voor bouwers — de snelste manier om dit uit te zoeken is om beide te draaien op je eigen prompts. OrcaRouter plaatst 200+ modellen achter één OpenAI-compatibel endpoint, zodat je Qwen 3.8 Max tegen GLM-5.2 kunt laten opnemen voor dezelfde taak zonder twee SDK's te hoeven aansluiten.

TL;DR-oordeel. Op de enige gedeelde benchmark claimt Qwen een voorsprong van 3,9 punten op Terminal-Bench 2.1 (86,6 tegen 82,7) — een reëel resultaat als het zich herhaalt, hoewel Qwen's cijfer zelfgerapporteerd is en dat van GLM gecontroleerd. Overal elders heeft GLM-5.2 de praktische voordelen: het is ~2× goedkoper voor $0,95 / $3,00 tegenover Qwen's $2 / $6, de gewichten zijn vandaag downloadbaar, de 40B actieve parameters maken het werkelijk inzetbaar, en het heeft een onafhankelijke indexscore van 51 waar Qwen er geen heeft. Qwen antwoordt met een 1M-token flat-rate context, native multimodaliteit die GLM mist, en een hoger potentieel plafond. Slank en bewezen verslaat nog steeds groot en ongeverifieerd in productie — maar de kloof werd op 3 augustus kleiner.

Belangrijkste conclusies

Eerste directe benchmark-overlap in de serie: Terminal-Bench 2.1 — Qwen3.8-Max 86,6 (door Alibaba gerapporteerd) tegen GLM-5.2 82,7 (Artificial Analysis, gecontroleerd). Qwen leidt met 3,9 punten, maar de twee cijfers zijn niet even betrouwbaar.

GLM-5.2 is ongeveer half zo duur: $0.95 / $3.00 per 1M (AA blended ~$0.90) versus die van Qwen3.8-Max $2 / $6.

Actieve parameters zijn het echte architectuurverhaal: GLM-5.2 draait met 40B actieve parameters van 753B in totaal. Alibaba heeft nog steeds niet bekendgemaakt hoeveel actieve parameters Qwen heeft, waardoor de servicekosten niet te modelleren zijn.

De gewichten van GLM zijn vandaag al downloadbaar; die van Qwen worden binnen de week beloofd, nog zonder licentie of repository.

GLM-5.2 heeft een gecontroleerde index van 51. Qwen3.8-Max blijft ongewaardeerd — hoewel zijn voorganger Qwen3.7-Max 46 scoorde, onder GLM.

Qwen's unieke aanbod: een 1M-tokenvenster met een vast tarief, zonder toeslag voor lange prompts, plus native tekst-/beeld-/video-invoer en OmniDocBench 1.5 92.1. GLM-5.2 is tekstgericht.

Nauwkeurigheidsnotitie: alle kwaliteitscijfers van Qwen3.8-Max zijn door Alibaba gerapporteerd en niet door derden geverifieerd. GLM-5.2-cijfers zijn afkomstig van Artificial Analysis. Het vergelijken van een zelfgerapporteerde score met een gecontroleerde score op dezelfde benchmark is informatief maar niet doorslaggevend — de testomgevingen van leveranciers en evaluatoren verschillen. Qwen-prijzen komen uit de GA-prijskaart en vervangen de previewkorting van juli.

De specificaties en prijs, naast elkaar

Hier zijn de harde gegevens, elk cijfer met vermelding van de bron.

• Maker / status — Qwen3.8-Max: Alibaba; GA (3 augustus 2026); GLM-5.2: Zhipu; uitgebracht in juni 2026

• Architectuur — Qwen3.8-Max: ~2,4T totaal, sparse MoE; GLM-5.2: 753B totaal, sparse MoE (Artificial Analysis)

• Actieve parameters — Qwen3.8-Max: Nog niet bekendgemaakt door Alibaba; GLM-5.2: 40B actief (Artificial Analysis)

• Contextvenster — Qwen3.8-Max: 1M tokens, vast tarief (983.616 met denken; maximale output 131.072); GLM-5.2: 1M tokens (Artificial Analysis)

Terminal-Bench 2.1 — Qwen3.8-Max: 86.6 (door Alibaba gerapporteerd); GLM-5.2: 82.7 (Artificial Analysis, gecontroleerd)

• AA Intelligence Index — Qwen3.8-Max: Nog niet gescoord; GLM-5.2: 51 (Artificial Analysis)

• Andere door leveranciers gerapporteerde scores — Qwen3.8-Max: GPQA Diamond 92.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (door Alibaba gerapporteerd); GLM-5.2: de score is door derden gemeten

• Modaliteiten — Qwen3.8-Max: Tekst, afbeelding, video in → tekst uit; GLM-5.2: Tekstgericht

• Prijzen (in / uit) — Qwen3.8-Max: $2.00 / $6.00 per 1M, vast; gecachte invoer $0.25; GLM-5.2: $0.95 / $3.00 per 1M (AA gemengd ~$0.90)

• Open gewichten — Qwen3.8-Max: Beloofd binnen de week (nog geen licentie); GLM-5.2: Ja — vandaag downloadbaar

Twee dingen vormen het kader voor deze vergelijking, en het eerste is het meest bruikbare datapunt in de hele reeks.

Ten eerste, de overlap met Terminal-Bench is werkelijk informatief. Terminal-Bench 2.1 meet of een model een echte shell volledig kan bedienen — commando's uitvoeren, output lezen, herstellen van fouten. Het is de dichtstbijzijnde beschikbare benadering voor "kan dit functioneren als een code-agent in plaats van een code-suggestietool", en het is de benchmark die beide leveranciers kozen om te rapporteren. De 86,6 van Qwen tegenover de gecontroleerde 82,7 van GLM is een voorsprong van 3,9 punten in het voordeel van Qwen.

De kanttekening is belangrijk, maar moet niet worden overdreven. Vendor-harnesses en evaluator-harnesses verschillen in scaffolding, retry-beleid en promptconstructie, en die keuzes kunnen een Terminal-Bench-score met meer dan vier punten doen verschuiven. Dit is dus geen bewijs dat Qwen het betere agentische model is. Wat het wel vaststelt, is dat de zelfgerapporteerde claim van Qwen in dezelfde competitieve band terechtkomt als een geauditeerd open-weight frontiermodel, in plaats van in ongeloofwaardig gebied. Dat is een wezenlijk sterkere positie dan "niet gescoord".

Ten tweede, de architectuurvergelijking is waar GLM stilletjes wint. GLM-5.2 activeert 40B parameters van de 753B. Dat ene getal vertelt je de servingkosten, het latentieprofiel, en dat een goed uitgerust team het daadwerkelijk kan draaien. Alibaba heeft nog steeds niet gepubliceerd wat de actieve telling van Qwen is — wat betekent dat, hoeveel het kopcijfer van 2.4T ook zegt, niemand buiten Alibaba kan inschatten wat Qwen3.8-Max kost om te serveren of hoe het zich zou gedragen bij self-hosting. In een Mixture-of-Experts-vergelijking is dat geen voetnoot; het is het belangrijkste ontbrekende getal.

Slank en bewezen versus groot en ongeverifieerd

De propositie van GLM-5.2 is gebaseerd op een samenhangende technische visie: meer doen met minder, de cijfers publiceren, de gewichten uitbrengen. Een 40B-actief model is goedkoop om te draaien, snel dankzij de constructie en inzetbaar door een team met een serieus maar niet absurd GPU-budget. De gecontroleerde index van 51 en de gecontroleerde Terminal-Bench van 82.7 betekenen dat een koper niets op goed vertrouwen hoeft aan te nemen. En tegen $0.95 / $3.00 is het ruwweg de helft van de prijs van Qwen.

Het betoog van Qwen3.8-Max is de tegenovergestelde weddenschap: bouw het grootste model dat je kunt en laat de capaciteiten de kosten rechtvaardigen. GA maakte dat betoog veel sterker dan het was, omdat er eindelijk cijfers aan verbonden zijn — GPQA Diamond 92.6 op graduate-niveau wetenschap, OSWorld-Verified 86.1 op GUI-bediening, FrontierSWE 73.5 tegenover de 40.7 van een voorganger, en de hierboven besproken Terminal-Bench 86.6. Dat zijn cijfers van frontier-formaat, en de bijna verdubbeling op FrontierSWE is het soort generatiesprong dat moeilijk volledig te faken is.

Maar er blijven twee hiaten bestaan, en het zijn dezelfde twee die in juli van belang waren. Er is geen onafhankelijke score — Artificial Analysis en LMArena blijven ongescoord op Qwen3.8-Max, dus elke kwaliteitsclaim is van Alibaba zelf. En er is geen licentie, dus de belofte van open gewichten kan nog niet commercieel worden geëvalueerd.

Het historische ankerpunt pleit hier sterker tegen Qwen dan in de meeste vergelijkingen: de voorganger Qwen3.7-Max scoorde 46 op de AA-index, onder de 51 van GLM-5.2. Alibaba's impliciete bewering is dus niet alleen dat Qwen3.8-Max goed is, maar dat het in één generatie een sprong maakte van onder GLM naar ruim daarboven. De FrontierSWE-verbetering geeft dat enige geloofwaardigheid. Een onafhankelijke score zou uitsluitsel geven.

Kosten in de praktijk: waar 2× op uitkomt

Neem een agentische codeerpijplijn: 180.000 tokens aan repositorycontext, 10.000 tokens aan output per run.

GLM-5.2: 0.18M × $0.95 = $0.171, plus 0.01M × $3.00 = $0.03. ≈ $0.20 per run.

Qwen3.8-Max: 0,18M × $2 = $0,36, plus 0,01M × $6 = $0,06. ≈ $0,42 per uitvoering.

• Bij 3.000 runs/dag: GLM ≈ $603/dag; Qwen ≈ $1.260/dag — ruwweg $20.000/maand verschil.

• Met Qwen's gecachte invoer tegen $0,25/1M op een stabiele repo, daalt zijn run naar ≈ $0,11, wat GLM's niet-gecachte kosten eigenlijk onderbiedt.

Die laatste regel is het meest praktisch bruikbare in deze vergelijking. Qwen's opgegeven prijs is het dubbele van die van GLM, maar de cache-hit-prijs van $0,25 per 1M is agressief genoeg dat een goed gecachte pipeline de rangorde kan omdraaien. Als je agent bij elke beurt een grotendeels ongewijzigde context opnieuw leest — wat voor de meeste codeagenten geldt — kan Qwen in de praktijk de goedkopere optie zijn, ondanks de slechtere tariefkaart. Teams die caching niet configureren, betalen dubbel voor niets.

Beide modellen rekenen denktokens als output, dus configuraties met veel redenering kosten meer dan deze schattingen aan beide kanten.

Implementeerbaarheid: de as die GLM bezit

Beide zijn Chinese open-weight MoE-modellen die een context van 1M tokens claimen, wat inzetbaarheid tot het scherpste praktische onderscheid maakt.

De gewichten van GLM-5.2 zijn sinds juni downloadbaar, en met 40B actieve parameters is het een realistisch self-hosting-doel — kwantiseerbaar, draaibaar op een redelijk aantal GPU's, en al door de community gebruikt.

De gewichten van Qwen3.8-Max worden nog deze week toegezegd, maar het vlaggenschip is voor niemand een realistisch doel: grofweg 1,2 TB bij 4-bit tegenover ongeveer 141 GB per H200 betekent acht of meer top-end accelerators, en het niet bekendgemaakte aantal actieve parameters maakt de resulterende doorvoer onmogelijk te voorspellen. Voeg de ontbrekende licentie toe en het zelf hosten van het vlaggenschip is voorlopig geen plan.

De gelijktijdig aangekondigde Qwen3.8-27B is Alibaba's echte antwoord op deze as. Ook met open-weights en naar verluidt draaiend in ongeveer 17GB VRAM — een enkele high-end kaart, ver onder de voetafdruk van GLM-5.2 — concurreert het direct op inzetbaarheid. Als je interesse in beide modellen is om ze zelf te draaien, is de vergelijking tussen Qwen 27B en GLM-5.2 degene die er echt toe doet, en het is een veel gelijkwaardiger strijd dan 2.4T versus 753B.

Veelgestelde vragen

Is Qwen 3.8 beter dan GLM-5.2?

Op de enige benchmark die ze delen, claimt Qwen een voorsprong — Terminal-Bench 2.1 86,6 tegenover GLM's gecontroleerde 82,7. Maar Qwen's cijfer is zelfgerapporteerd en GLM's is gemeten door Artificial Analysis, en harnessverschillen kunnen een verschil van meer dan vier punten opleveren. GLM-5.2 heeft ook een gecontroleerde index van 51, terwijl Qwen helemaal geen onafhankelijke score heeft. GLM is de veiligere keuze; Qwen heeft het hogere ongeverifieerde plafond.

Hoe verhouden ze zich op Terminal-Bench 2.1?

Qwen3.8-Max rapporteert 86,6; Artificial Analysis mat GLM-5.2 op 82,7. Dat is een nominale voorsprong van 3,9 punten voor Qwen en de eerste overlap op dezelfde benchmark tussen de twee. Lees het als bewijs dat Qwen concurrerend is in die band, niet als bewijs dat het voorligt, aangezien alleen het getal van GLM onafhankelijk is geproduceerd.

Welke is goedkoper?

GLM-5.2 op de tariefkaart — $0,95 / $3,00 per 1M (AA gewogen ~$0,90) versus Qwen's $2 / $6, ongeveer de helft. Maar Qwen's gecachte invoer voor $0,25 per 1M is agressief genoeg dat een zwaar gecachte pipeline uiteindelijk goedkoper kan uitvallen op Qwen dan op GLM zonder cache.

Hoeveel actieve parameters gebruikt Qwen 3.8 Max?

Alibaba heeft het cijfer nooit gepubliceerd, zelfs niet bij algemene beschikbaarheid. Dat is het getal dat de servingkosten en latentie in een Mixture-of-Experts-model bepaalt, dus de afwezigheid ervan is een reële lacune. GLM-5.2 is daarentegen gedocumenteerd met 40B actief uit 753B totaal.

Welke kan ik daadwerkelijk self-hosten?

GLM-5.2 vandaag — de gewichten zijn uit en 40B actief maakt het hanteerbaar. De gewichten van Qwen3.8-Max worden binnen de week beloofd, maar het vlaggenschip heeft acht of meer H200-klasse GPU's nodig met ~1.2TB in 4-bit, en er is nog geen licentie gepubliceerd. De gelijktijdig aangekondigde Qwen3.8-27B, naar verluidt ~17GB VRAM, is de inzetbare Qwen-optie en een betere match voor GLM's niche.

Is Qwen 3.8 Max uit preview gegaan?

Ja, op 3 augustus 2026, met een gepubliceerde tariefkaart en een endpoint dat compatibel is met OpenAI en DashScope. De campagne van juli voor Qoder-credits met 90% korting beschrijft niet langer hoe het wordt verkocht.

Wat biedt Qwen dat GLM-5.2 niet biedt?

Native multimodaliteit — beeld- en video-invoer, met een zelfgerapporteerde OmniDocBench 92.1 voor documentparsing — en een 1M-tokencontext die tegen een vast tarief wordt gefactureerd, zonder toeslag voor lange prompts. GLM-5.2 is tekstgericht, dus voor document-, schermafbeelding- of videopijplijnen concurreert Qwen daar niet zozeer mee, maar doet het iets anders.

Kortom

Qwen 3.8 vs GLM-5.2 is de confrontatie waarbij algemene beschikbaarheid de meest werkelijk nieuwe informatie opleverde. Voor het eerst heeft Qwen een score op een benchmark die een onafhankelijke evaluator ook heeft uitgevoerd, en die ligt boven GLM: Terminal-Bench 2.1 86.6 tegen 82.7. Dat verplaatst Qwen van "niet gescoord" naar "plausibel concurrerend op gemeten terrein", wat echte vooruitgang is, zelfs rekening houdend met het voorbehoud van zelfrapportage.

Maar GLM-5.2 behoudt de praktische kroon, en het doet dat op basis van weinig glamoureuze sterke punten: de halve prijs, een gecontroleerde index van 51, 40B actieve parameters die de kosten voorspelbaar en de implementatie haalbaar maken, en gewichten die je nu meteen kunt downloaden. De antwoorden van Qwen — een context van een miljoen tokens tegen een vast tarief, native multimodaliteit en een hoger plafond — zijn betekenisvol maar voorwaardelijk, en de twee hiaten van juli zijn ongewijzigd: geen onafhankelijke score en geen licentie. Let op drie dingen: de eerste onafhankelijke Intelligence Index-score voor Qwen3.8-Max, of een evaluator die score van 86,6 op Terminal-Bench reproduceert, en de release van Qwen3.8-27B, waar deze twee filosofieën echt met elkaar zullen botsen. Tot die tijd is GLM-5.2 wat je uitrolt en Qwen3.8-Max wat je evalueert — met caching ingeschakeld.

Vergeleken in dit artikel3

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt