
Qwen 3.8 vs GLM-5.2: Det första riktmärket där de faktiskt överlappar
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
Dessa två modeller är det tydligaste uttrycket för motsatta satsningar inom kinesisk AI med öppen vikt. Zhipus GLM-5.2 är smidig och beprövad: 753B totala parametrar med endast 40B aktiva, ett granskat Artificial Analysis Intelligence Index på 51, vikter nedladdningsbara sedan juni 2026, och ett publicerat pris på $0,95 / $3,00. Alibabas Qwen3.8-Max är den maximalistiska satsningen: ~2,4T parametrar, ett ej avslöjat antal aktiva, och — tills nyligen — inga siffror alls.
Allmän tillgänglighet den 3 augusti 2026 gav denna jämförelse något som ingen annan artikel i denna serie har: ett benchmark som båda modellerna har poäng på. Alibaba rapporterar Terminal-Bench 2.1 på 86.6; Artificial Analysis har låtit granska GLM-5.2 på 82.7 på samma test. För första gången kan Qwens påstående ställas bredvid ett oberoende uppmätt konkurrentnummer på identisk grund — med det viktiga förbehållet att endast en av de två producerades av en domare.
En notis till utvecklare — det snabbaste sättet att avgöra detta är att köra båda på dina egna prompts. OrcaRouter ger dig tillgång till 200+ modeller via en OpenAI-kompatibel slutpunkt, så att du kan ställa Qwen 3.8 Max mot GLM-5.2 på samma uppgift utan att koppla in två SDK:er.
TL;DR-slutsats. På det enda gemensamma riktmärket hävdar Qwen en 3,9 poängs ledning på Terminal-Bench 2.1 (86,6 mot 82,7) — ett verkligt resultat om det upprepas, även om Qwens siffra är självrapporterad och GLM:s är granskad. På alla andra håll har GLM-5.2 de praktiska fördelarna: den är ~2× billigare till $0,95 / $3,00 mot Qwens $2 / $6, dess vikter är nedladdningsbara idag, dess 40B aktiva parametrar gör den verkligen driftsättningsbar, och den har ett oberoende indexresultat på 51 där Qwen inte har något. Qwen svarar med en 1M-token-kontext till fast pris, inbyggd multimodalitet som GLM saknar, och ett högre potentiellt tak. Det smala och beprövade slår fortfarande det stora och overifierade för produktion — men gapet minskade den 3 augusti.
Viktiga slutsatser
• Första direkta benchmarköverlappningen i serien: Terminal-Bench 2.1 — Qwen3.8-Max 86.6 (rapporterat av Alibaba) mot GLM-5.2 82.7 (Artificial Analysis, granskad). Qwen leder med 3,9 poäng, men de två siffrorna är inte lika tillförlitliga.
• GLM-5.2 är ungefär hälften så dyr: $0.95 / $3.00 per 1M (AA-blandat ~$0.90) jämfört med Qwen3.8-Max:s $2 / $6.
• Aktiva parametrar är den verkliga arkitekturberättelsen: GLM-5.2 kör 40B aktiva av totalt 753B. Alibaba har fortfarande inte avslöjat Qwens aktiva antal, vilket gör dess serveringskostnad omodellerbar.
• GLM:s vikter är nedladdningsbara idag; Qwen:s utlovas inom veckan, utan licens eller repository ännu.
• GLM-5.2 har ett granskat index på 51. Qwen3.8-Max är fortfarande inte poängsatt — även om dess föregångare Qwen3.7-Max fick 46, under GLM.
• Qwens unika erbjudanden: ett fönster på 1M tokens till fast pris utan tilläggsavgift för långa prompts, plus inbyggd text-, bild- och videoinmatning och OmniDocBench 1.5 92.1. GLM-5.2 är textfokuserad.
Noggrannhetsnot: alla kvalitetssiffror för Qwen3.8-Max är rapporterade av Alibaba och inte verifierade av tredje part. GLM-5.2-siffrorna kommer från Artificial Analysis. Att jämföra ett självrapporterat resultat med ett granskat resultat på samma riktmärke är informativt men inte avgörande – leverantörernas testmiljöer och utvärderingsmiljöer skiljer sig åt. Qwen-prissättningen är GA-prislistan och ersätter julirabatten för förhandsversionen.
Specarna och priset, sida vid sida
Här är de hårda uppgifterna, varje siffra med angiven källa.
• Tillverkare / status — Qwen3.8-Max: Alibaba; GA (3 augusti 2026); GLM-5.2: Zhipu; släpptes i juni 2026
• Arkitektur — Qwen3.8-Max: ~2,4T totalt, sparse MoE; GLM-5.2: 753B totalt, sparse MoE (Artificial Analysis)
• Aktiva parametrar — Qwen3.8-Max: Fortfarande ej avslöjade av Alibaba; GLM-5.2: 40B aktiva (Artificial Analysis)
• Kontextfönster — Qwen3.8-Max: 1M tokens, fast pris (983 616 med tänkande; max utdata 131 072); GLM-5.2: 1M tokens (Artificial Analysis)
• Terminal-Bench 2.1 — Qwen3.8-Max: 86,6 (rapporterat av Alibaba); GLM-5.2: 82,7 (Artificial Analysis, granskad)
• AA Intelligence Index — Qwen3.8-Max: Ännu ej poängsatt; GLM-5.2: 51 (Artificial Analysis)
• Andra leverantörsrapporterade poäng — Qwen3.8-Max: GPQA Diamond 92.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (rapporterat av Alibaba); GLM-5.2: ställningen är mätt av tredje part
• Modaliteter — Qwen3.8-Max: Text, bild, video in → text ut; GLM-5.2: Textfokuserad
• Pris (in / ut) — Qwen3.8-Max: $2.00 / $6.00 per 1M, fast; cachad input $0.25; GLM-5.2: $0.95 / $3.00 per 1M (AA-blandat ~$0.90)
• Öppna vikter — Qwen3.8-Max: Utlovat inom veckan (ingen licens ännu); GLM-5.2: Ja — nedladdningsbart idag
Två saker ramar in denna jämförelse, och den första är den mest användbara datapunkten i hela serien.
För det första, är Terminal-Bench-överlappningen verkligen informativ. Terminal-Bench 2.1 mäter huruvida en modell kan använda ett riktigt skal till fullo — köra kommandon, läsa utdata, återhämta sig från fel. Det är den närmaste tillgängliga proxy för "kan detta fungera som en kodningsagent snarare än en kodförslagsgivare," och det är det riktmärke som båda leverantörerna valde att rapportera. Qwens 86,6 mot GLM:s granskade 82,7 är en ledning på 3,9 poäng till Qwens fördel.
Förbehållet är viktigt men bör inte överdrivas. Leverantörsharnessar och utvärderingsharnessar skiljer sig åt i scaffolding, återförsökspolicy och promptkonstruktion, och dessa val kan ändra ett Terminal-Bench-resultat med mer än fyra poäng. Så detta är inte ett bevis för att Qwen är den bättre agentmodellen. Vad det däremot fastställer är att Qwens självrapporterade påstående hamnar i samma konkurrenskraftiga band som en granskad frontier-modell med öppna vikter, snarare än i osannolikt territorium. Det är en betydligt starkare position än ”utan poäng”.
För det andra, arkitekturjämförelsen är där GLM tyst vinner. GLM-5.2 aktiverar 40B parametrar av 753B. Den enda siffran talar om för dig kostnaden för att servera den, dess latensprofil, och att ett välutrustat team faktiskt kan köra den. Alibaba har fortfarande inte publicerat antalet aktiva parametrar hos Qwen — vilket innebär att oavsett vad rubriken 2.4T förmedlar, kan ingen utanför Alibaba uppskatta vad Qwen3.8-Max kostar att servera eller hur den skulle bete sig självhostad. I en Mixture-of-Experts-jämförelse är det inte en fotnot; det är den viktigaste saknade siffran.

Slank och beprövad kontra stor och overifierad
GLM-5.2:s argument bygger på en sammanhållen ingenjörsposition: göra mer med mindre, publicera siffrorna, leverera vikterna. En 40B-aktiv modell är billig att servera, snabb till sin konstruktion och driftsättningsbar av ett team med en seriös men inte orimlig GPU-budget. Dess granskade index på 51 och granskade Terminal-Bench på 82,7 betyder att en köpare inte tar något på tro. Och till 0,95 / 3,00 dollar är priset ungefär hälften av Qwens.
Qwen3.8-Max:s tes är den motsatta satsningen: bygg den största modellen du kan och låt kapaciteten motivera kostnaden. GA gjorde den tesen mycket starkare än den var, eftersom det äntligen finns siffror kopplade till den — GPQA Diamond 92.6 på forskarnivå inom naturvetenskap, OSWorld-Verified 86.1 på GUI-operationer, FrontierSWE 73.5 jämfört med en föregångares 40.7, och Terminal-Bench 86.6 som diskuterats ovan. Det är siffror i frontier-klass, och att FrontierSWE-resultatet nästan fördubblades är den typ av generationshopp som är svår att fejka helt.
Men två luckor kvarstår, och det är samma två som spelade roll i juli. Det finns inget oberoende betyg — Artificial Analysis och LMArena har ännu inte poängsatts på Qwen3.8-Max, så varje kvalitetspåstående är Alibabas eget. Och det finns ingen licens, så löftet om öppna vikter kan ännu inte utvärderas kommersiellt.
Den historiska referensen talar emot Qwen här mer än i de flesta jämförelser: föregångaren Qwen3.7-Max fick 46 på AA-indexet, under GLM-5.2:s 51. Så Alibabas underförstådda påstående är inte bara att Qwen3.8-Max är bra, utan att den hoppade från att vara under GLM till att vara väl över den på en generation. Förbättringen i FrontierSWE ger det viss trovärdighet. Ett oberoende resultat skulle avgöra det.

Kostnad i praktiken: var 2× landar
Ta en agentisk kodningspipeline: 180 000 tokens av repositorykontext, 10 000 tokens av utdata per körning.
• GLM-5.2: 0.18M × $0.95 = $0.171, plus 0.01M × $3.00 = $0.03. ≈ $0.20 per körning.
• Qwen3.8-Max: 0,18M × $2 = $0,36, plus 0,01M × $6 = $0,06. ≈ $0,42 per körning.
• Vid 3,000 körningar/dag: GLM ≈ $603/dag; Qwen ≈ $1,260/dag — ungefär $20,000/månad i skillnad.
• Med Qwens cachade input till $0.25/1M på ett stabilt repo, sjunker dess körning till ≈ $0.11, vilket faktiskt understiger GLM:s ocachade kostnad.
Den sista raden är det mest praktiskt användbara i den här jämförelsen. Qwens listpris är dubbelt så högt som GLM:s, men dess pris vid cacheträff på 0,25 USD per 1M är tillräckligt aggressivt för att en välcachad pipeline kan vända på rangordningen. Om din agent läser om en i stort sett oförändrad kontext varje tur – vilket beskriver de flesta kodningsagenter – kan Qwen vara det billigare alternativet i praktiken trots den sämre prislistan. Team som inte konfigurerar cachning betalar dubbelt för ingenting.
Båda modellerna debiterar tanketokens som utdata, så resoneringstunga konfigurationer kostar mer än dessa uppskattningar på båda sidor.
Driftsättbarhet: den axel som GLM äger.
Båda är kinesiska open-weight MoE-modeller med anspråk på 1M-token kontext, vilket gör driftsättbarhet till den skarpaste praktiska klyftan.
GLM-5.2:s vikter har varit nedladdningsbara sedan juni, och med 40B aktiva är den ett realistiskt mål för självhosting — kvantiserbar, körbar på ett rimligt antal GPU:er och redan testad av communityn.
Qwen3.8-Max:s vikter utlovas inom veckan, men flaggskeppet är inte ett realistiskt mål för någon: ungefär 1,2 TB vid 4-bit jämfört med cirka 141 GB per H200 innebär åtta eller fler toppacceleratorer, och det ej offentliggjorda antalet aktiva parametrar gör det omöjligt att förutsäga den resulterande genomströmningen. Lägg till den saknade licensen och att själv hosta flaggskeppet är, för närvarande, inte en plan.
Den samtidigt tillkännagivna Qwen3.8-27B är Alibabas genuina svar på denna axel. Den släpps även med öppna vikter och rapporteras köra i cirka 17GB VRAM — ett enda high-end-kort, långt under GLM-5.2:s fotavtryck — den konkurrerar direkt när det gäller driftsättning. Om ditt intresse för endera modellen är att köra den själv, är jämförelsen mellan Qwen 27B och GLM-5.2 den som faktiskt kommer att spela roll, och det är en mycket jämnare kamp än 2.4T mot 753B.
Vanliga frågor
Är Qwen 3.8 bättre än GLM-5.2?
På det enda benchmark de har gemensamt gör Qwen anspråk på en ledning — Terminal-Bench 2.1 86,6 mot GLM:s granskade 82,7. Men Qwens siffra är självrapporterad och GLM:s mättes av Artificial Analysis, och skillnader i testmiljön kan överstiga fyra poäng. GLM-5.2 har också ett granskat index på 51 där Qwen inte har något oberoende resultat alls. GLM är det säkrare valet; Qwen har det högre overifierade taket.
Hur står de sig mot varandra på Terminal-Bench 2.1?
Qwen3.8-Max rapporterar 86,6; Artificial Analysis mätte GLM-5.2 till 82,7. Det är en nominell ledning på 3,9 poäng för Qwen och den första överlappningen mellan dem på samma riktmärke. Läs det som bevis på att Qwen är konkurrenskraftig i det segmentet snarare än bevis för att den ligger före, eftersom endast GLM:s siffra togs fram oberoende.
Vilket är billigare?
GLM-5.2 på prislistan — $0.95 / $3.00 per 1M (AA blandat ~$0.90) jämfört med Qwens $2 / $6, ungefär hälften. Men Qwens cachade input till $0.25 per 1M är tillräckligt aggressiv för att en pipeline med tung cachelagring kan bli billigare på Qwen än på GLM utan cache.
Hur många aktiva parametrar använder Qwen 3.8 Max?
Alibaba har aldrig publicerat siffran, inte ens vid allmän tillgänglighet. Det är den siffra som avgör kostnad och latens för inferens i en Mixture-of-Experts-modell, så dess frånvaro är ett verkligt gap. GLM-5.2 är däremot dokumenterad med 40B aktiva parametrar av totalt 753B.
Vilka kan jag faktiskt self-hosta?
GLM-5.2 idag — vikterna är ute och 40B aktiva gör den hanterbar. Qwen3.8-Max:s vikter utlovas inom veckan, men flaggskeppet kräver åtta eller fler H200-klassade GPU:er på ~1,2 TB i 4-bit, utan någon licens publicerad ännu. Den samtidigt tillkännagivna Qwen3.8-27B, enligt uppgift ~17 GB VRAM, är det driftsättbara Qwen-alternativet och en närmare matchning till GLM:s nisch.
Har Qwen 3.8 Max lämnat förhandsversionen?
Ja, den 3 augusti 2026, med en publicerad prislista och en OpenAI- och DashScope-kompatibel slutpunkt. Julis kampanj med 90 % rabatt på Qoder-krediter beskriver inte längre hur den säljs.
Vad erbjuder Qwen som GLM-5.2 inte gör?
Native multimodalitet — bild- och videoinmatning, med ett självrapporterat OmniDocBench 92.1 för dokumenttolkning — och ett 1M-tokenkontext som faktureras till ett fast pris utan extra avgift för långa prompts. GLM-5.2 är textfokuserad, så för dokument-, skärmbilds- eller videopipelines konkurrerar Qwen inte så mycket med den som att den gör något annat.
Slutsats
Qwen 3.8 mot GLM-5.2 är duellen där allmän tillgänglighet levererade den mest genuint nya informationen. För första gången har Qwen en poäng på ett riktmärke som en oberoende utvärderare också har kört, och den hamnar över GLM: Terminal-Bench 2.1 86.6 mot 82.7. Det flyttar Qwen från "utan poäng" till "rimligt konkurrenskraftig på uppmätt grund", vilket är verkliga framsteg även om man tar hänsyn till förbehållet om självrapportering.
Men GLM-5.2 behåller den praktiska kronan, och det gör den genom oglamorösa styrkor: halva priset, ett granskat index på 51, 40B aktiva parametrar som gör dess ekonomi förutsägbar och dess driftsättning möjlig, och vikter som du kan ladda ner just nu. Qwens svar — en kontext på en miljon token till fast pris, inbyggd multimodalitet och ett högre tak — är meningsfulla men villkorade, och dess två julibrister är oförändrade: ingen oberoende poäng och ingen licens. Håll koll på tre saker: det första oberoende Intelligence Index-resultatet för Qwen3.8-Max, huruvida en utvärderare kan återskapa den där 86,6-siffran på Terminal-Bench, och Qwen3.8-27B-släppet, vilket är där dessa två filosofier verkligen kommer att kollidera. Tills dess är GLM-5.2 det du levererar och Qwen3.8-Max det du utvärderar — med cachning aktiverad.

Jämförda i den här artikeln3
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
