
Qwen3.8-27B vs Qwen 3.8: Zelfde generatie, een GPU tegenover een rack
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen
Deze week zette Alibaba Qwen3.8-27B op de snelle inferentielijn van Cerebras — de eerste keer dat de dense 27B een werkelijk snelle gehoste optie heeft — en Artificial Analysis indexeerde eindelijk beide kanten van deze confrontatie. Qwen3.8-27B scoort 34 op de AA Intelligence Index. Qwen 3.8, oftewel het open core-model dat de meeste mensen bedoelen wanneer ze de naam zonder suffix schrijven, scoort 40. Die twee cijfers zetten een vergelijking opnieuw neer die de verslaggeving rond de lancering in augustus volledig op het woord van de leverancier moest baseren.
Het model achter "Qwen 3.8" als op zichzelf staande naam is Qwen3.8-2.4T-A95B: de 2,4 biljoen parameter grote mixture-of-experts-gewichten die Alibaba onder een aangepaste licentie publiceerde. Qwen3.8-27B is het dense lid van dezelfde generatie — ongeveer 27 miljard parameters, Apache 2.0, qua grootte voor één GPU. Ze delen de familienaam, de native contextlengte van 262K en een lanceringsvenster. Al het andere aan hen is een studie in tegenstellingen: de een kun je bezitten, de ander alleen huren. Dit is waar elk van de twee nu eigenlijk voor dient, nu beide onafhankelijke cijfers hebben.
Dezelfde generatie, tegenovergestelde vormen
Qwen3.8-27B is een dense model — 27B parameters (28B met de vision-encoder meegerekend), 64 lagen, een hybride attention-stack van 48 Gated DeltaNet lineaire attention-lagen tegenover 16 full-attentionlagen. Die hybride aanpak is de reden dat een 27B-model 262.144 tokens native context kan bevatten. Qwen3.8-2.4T-A95B is de vlaggenschiparchitectuur: 2,4T totale parameters, ongeveer 95B actief per token, 92 lagen met 512 experts per laag, en 69 van die 92 lagen op lineaire attention. Dezelfde truc, negentig keer de omvang.
• Architectuur — Qwen3.8-27B: 27B dense, elk token licht het volledige model op. Qwen3.8-2.4T-A95B: 2,4T totaal / ~95B actieve MoE.
• Context — beide 262K native; de 1M-uitbreiding van de 27B is uitsluitend via hosting beschikbaar, de 2.4T haalt gemeten ~984K.
• Invoer — Qwen3.8-27B: tekst, afbeelding en video. Qwen3.8-2.4T-A95B: alleen tekst, denkmodus vergrendeld op aan.
• Licentie — Qwen3.8-27B: Apache 2.0. Qwen3.8-2.4T-A95B: aangepaste Qwen3.8-Max-licentie.
• Gewichten — Qwen3.8-27B: 55,6 GB BF16, quantiseert naar een ~16 GB Q4-build. Qwen3.8-2.4T-A95B: ~2,4 TB BF16, een GPU-rack, geen desktop.
• Waar je ze tegenkomt — Qwen3.8-27B: zelf gehost of goedkoop gehuurd. Qwen3.8-2.4T-A95B: gehuurd, want niemand met gezond verstand bezit het rack.
Onafhankelijke cijfers, eindelijk
Elk 'August vs'-stuk over Qwen3.8-27B droeg hetzelfde voorbehoud: "nog geen onafhankelijke scores". Dat is niet langer waar. Artificial Analysis heeft beide modellen deze week gemeten, en de vorm van de data is oprecht interessant.
Op de Intelligence Index scoort Qwen3.8-2.4T-A95B 40 en staat daarmee op de 4e plaats van de 113 in zijn klasse. Qwen3.8-27B scoort 34 — waarmee het eerste staat van 140 modellen in zijn open-weights grootteklasse van 4–40B, een werkelijk sterke prestatie voor een dense 27B. Beide zijn traag volgens onafhankelijke metingen: 39,0 outputtokens per seconde voor de 27B en 38,1 voor de 2.4T, tegen een klassemediaan van rond de 90. Beide zijn verbose; de 27B genereert ongeveer 200M outputtokens over de indexruns, tegenover een klassemediaan van 68M. Geen van beide is een toonaangevend frontiermodel; beide zijn werkpaarden, en de index zegt dat de 2.4T met duidelijke marge het sterkere werkpaard is.

De prijsstelling aan de onafhankelijke kant vertelt hetzelfde verhaal in dollars. Artificial Analysis prijst de 27B op $0,50 per miljoen input en $3,00 per miljoen output voor de gehoste build van Qwen Cloud (90% cachekorting), en de 2.4T op $2,00 / $6,00 (88% cachekorting). Kosten per Intelligence Index-taak: $0,82 voor de 27B tegenover $2,16 voor de 2.4T. Het kleinere model is goedkoper om te draaien per eenheid intelligentie — en beide zijn duur in verhouding tot hun snelheidsklasse, omdat het beide redeneermodellen zijn die outputtokens verbruiken.
Al het andere — SWE-bench Pro 61,7, DeepSWE 1.1 42,2, LiveCodeBench v6 90,3 voor de 27B; de 86,6 op Terminal-Bench 2.1 en 67,7 op SWE-bench Pro van de 2.4T — blijft door de leverancier gerapporteerd, niet gereproduceerd en wordt in dit hele artikel als zodanig aangeduid. De AA-indexen hierboven vormen de onafhankelijke ondergrens onder dat alles.
Wat de beursgang van Cerebras verandert
Op 12 september 2026 kondigde het Qwen-account aan dat Qwen3.8-27B nu draait op Cerebras, met de catalogusvermelding live onder de banner "Qwen 3.8 27B is nu beschikbaar op Cerebras PayGo." Cerebras vermeldt het voor $0,99 per miljoen input en $1,49 per miljoen output op de hardware van WSE-klasse die het bedrijf zijn reputatie op het gebied van snelheid bezorgde. Dat geeft de 27B iets wat de 2.4T-core nooit heeft gehad: een snelle baan.

Dit is belangrijk omdat traag-en-verbose vanaf dag één het enige echte minpunt was voor de 27B. Op de onafhankelijke harness haalt hij 39 t/s; volgens onze eigen serving-telemetrie doet hij ~154 outputtokens per seconde met een p50 first-tokenlatentie van 4,48s — en nu concurreert een tweede provider op diezelfde as. De 2.4T daarentegen heeft helemaal geen snelle route: bij 38 t/s betaal je frontier-prijzen voor mid-pack-snelheid, en de enige manier eromheen is een gehuurde GPU-cluster waarop je zelf de open weights draait.
Drie rijstroken voor de 27B, één voor de 2.4T
Vanaf vandaag is de dense 27B op drie manieren te huur, en het prijsverschil is het lezen waard voordat je kiest:
• Self-hosted lane — Qwen3.8-27B is live op OrcaRouter voor $0,33 / $2,40 per miljoen, draait op onze eigen infrastructuur. Goedkoopste input in de markt hiervoor, ~154 tok/s output, 262K context.
• Leveranciersroute — de gehoste build van Qwen Cloud, $0,50 / $3,00 per miljoen met de 1M-tokencontext en een cachekorting van 90%.
• Snelle route — Cerebras PayGo, $0,99 / $1,49 per miljoen, gepositioneerd op snelheid in plaats van prijs.

De 2.4T open core kent geen gelijkwaardige spread. De vlaggenschip-API die dezelfde architectuur bedient — Qwen3.8-Max — kost $2,00 / $6,00 per miljoen tokens, en dat is het getal dat blijft staan, of je het nu de Max of de open core noemt. Draai in plaats daarvan de gewichten en de economie klapt om naar hardware: de 2.4T heeft ~2,4 TB aan BF16-gewichten en een multi-GPU-node nodig, een kapitaalbeslissing die niemand lichtvaardig neemt. Een GPU van 24 GB draait de Q4-build van de 27B tegen marginale kosten die naar nul afronden.
Het uitgewerkte voorbeeld dat voor de meeste teams de doorslag geeft: 100M inputtokens en 20M outputtokens per dag. Tegen het tarief van $2/$6 van de 2.4T is dat ongeveer $320 per dag, ~$117.000 per jaar. Voor de 27B tegen onze $0.33/$2.40 is het ongeveer $81 per dag — en voor de zelfgehoste kopie is het de prijs van elektriciteit. De 2.4T levert je een echte kwaliteitsvoorsprong op, AA 40 tegen 34. Of die voorsprong een maandelijkse rekening van vijf cijfers waard is, is precies de vraag die deze combinatie stelt.
Waar ze werkelijk uiteenlopen
Naast de index bepalen drie praktische verschillen welke het beste bij een gegeven workload past.
Multimodale invoer is het zuiverste filter. Qwen3.8-27B leest tekst, afbeeldingen en video — screenshots, grafieken, documenten met figuren, videoframes gaan allemaal in hetzelfde 262K-venster. Qwen3.8-2.4T-A95B is agressief uitsluitend tekst. Als je invoer iets visueels bevat, is de 2.4T gediskwalificeerd, ongeacht de hogere index.
Controle over het denken komt op de tweede plaats. De redeneermodus van de 27B kan per verzoek worden uitgeschakeld, wat van belang is voor latentiegevoelige extractie waarbij een gedachteketen pure overhead is; daarnaast wordt ook reasoning_effort beschikbaar gemaakt. De 2.4T-core kan het denken niet uitschakelen — elk antwoord begint met een think>-blok, en je betaalt voor die tokens of je ze nu wilde of niet. De flagship-API lost dit op, maar de open core niet.
Licentiëring staat op de derde plaats, en op schaal is het stilletjes van belang. Apache 2.0 op de 27B is de permissieve standaard: wijzigen, herdistribueren, commercialiseren, octrooilicentie inbegrepen. De 2.4T wordt geleverd onder een aangepaste Qwen3.8-Max-licentie — in de geest permissief, maar het zijn de voorwaarden van Alibaba, geen communitystandaard, en het is de moeite waard het bestand te lezen voordat je er een product op bouwt.
Het routeren van de beslissing
Beide kanten van deze vergelijking zijn bereikbaar via één OrcaRouter-sleutel, en dat is wat de vraag "welke moet ik kiezen" goedkoop empirisch te beantwoorden maakt. Qwen3.8-27B is live als qwen/qwen3.8-27b tegen de lijstprijs van de provider, zonder enige opslag, en de flagship-API gebouwd op dezelfde 2,4T-core is live als qwen/qwen3.8-max voor $2,00 / $6,00 per miljoen — het eigen tarief van Alibaba, rechtstreeks doorgegeven, zodat elke prijswijziging van de leverancier hier dezelfde dag live is.
Diezelfde 2,4T-architectuur als downloadbare gewichten is niet iets wat wij aanbieden — als je vandaag de open core via een API wilt, is de flagship-lane de praktische manier om die te bereiken, en qwen/qwen3.8 is voorbedraad om aan te springen op het moment dat een provider de open gewichten aanbiedt. Een routeringsregel die het visuele en latentiegevoelige verkeer naar qwen/qwen3.8-27b stuurt en de zware redeneerstaart naar qwen/qwen3.8-max, kost niets om in te stellen en zorgt automatisch voor failover tussen providers. Eén key, geen tweede contract, en de splitsing is een configuratiewijziging in plaats van een herarchitectuur — de goedkoopste manier om te testen of de extra zes indexpunten van de 2,4T je $5,67 per miljoen outputtokens waard zijn.
Wie moet welke kiezen
• Kies Qwen3.8-27B als je invoer afbeeldingen of video bevat, als je een denkmodus wilt die je kunt uitschakelen, als je een 24GB-GPU bezit of van plan bent er een aan te schaffen, of als je uitgaven per token zo groot zijn dat $0.33/$2.40 tegenover $2.00/$6.00 het hele argument vormen.
• Kies Qwen 3.8 (de 2,4T-core) als je alleen tekst gebruikt, je de sterkste onafhankelijke reasoning-score in de familie wilt (AA 40), en het tarief van $2/$6 — of de kosten van het draaien van een GPU-node — ruim binnen je budget past.
• Kies beide als je verkeer zich over de twee profielen uitstrekt: routeer via de gateway, laat de router splitsen op modaliteit en moeilijkheidsgraad, en verander van gedachten wanneer de volgende checkpoint of prijs van een van beide modellen beschikbaar komt.
Het vonnis
De naam Qwen 3.8 was altijd al twee producten die zich voordeden als één familie, en nu hebben beide onafhankelijke cijfers om over te redetwisten. Qwen3.8-2.4T-A95B is het sterkere brein, alleen tekst, duur, en onmiskenbaar rendabel tegen $2/$6. Qwen3.8-27B is de inzetbare — multimodaal, Apache 2.0, zelf te hosten, en sinds deze week heeft die eindelijk ook een snelle route. Het indexverschil is reëel: 40 tegen 34. Net zo reëel is het prijsverschil: ongeveer vijf keer de kosten per token wanneer je de 2.4T als API draait. Voor de meeste teams gaat het bij de beslissing niet om de zes indexpunten. Het gaat erom of je tokens koopt of hardware koopt — en de 27B is de enige van de twee waarmee je de hardware kunt kopen.
