
Qwen3.8-Max vs Qwen3.7-Max: twee Max-niveaus, 16 indexpunten en een promo die de prijs omkeert
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 495 tok/s
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 186 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
Vier dagen geleden vertelde de leverancier ons dat Qwen3.8-Max niet het model is dat het in augustus heeft uitgebracht. In een persbericht van 22 september 2026, afkomstig van de Apsara Conference in Hangzhou, maakte het bedrijf bekend dat zijn vlaggenschip 33 iteratieve cycli van volledig geautomatiseerde training en post-training gedurende meer dan een maand heeft doorlopen, en dat de resulterende build zijn Artificial Analysis Intelligence Index heeft verhoogd van 40 naar 45. De model-ID is nooit veranderd. Het getal erachter wel.
Dat is het belangrijkst op één specifieke plek: de vergelijking tussen Qwen3.8-Max en Qwen3.7-Max, de Max-tier die het verving. Qwen3.8-Max werd algemeen beschikbaar op 3 augustus 2026; Qwen3.7-Max verscheen in mei. Op papier lijkt dit een eenvoudige generatiekeuze — nieuwere flagship, hogere score, door. De cijfers zeggen iets ongemakkelijker. De oudere tier is drie tot vier keer sneller, ongeveer vijf keer goedkoper per voltooide taak, en identiek aan de nieuwere op pure kennisbenchmarks. De nieuwere tier is multimodaal, dramatisch beter in agentisch werk, en goedkoper op de internationale tariefkaart. Welke je zou moeten aanroepen hangt af van een vraag die de meeste vergelijkingen overslaan: of je kennis koopt of tool calls koopt.
Wat de Apsara-openbaarmaking eigenlijk beweert
De onthulling is een leveranciersverklaring, gepubliceerd door Alibaba op zijn eigen perssite, en moet als zodanig worden gelezen. Wat er staat is specifiek: gedurende meer dan een maand van volledig geautomatiseerde runs die zich uitstrekten over pijplijnontwerp, datavalidatie, iteratieve experimenten en foutdiagnose, voltooide Qwen3.8-Max 33 cycli, en autonome trainingsoptimalisatie plus post-trainingstechnieken veroorzaakten de scoreverschuiving. Alibaba beschreef ook een tweede experiment in chipontwerp, waarbij het model meer dan 60 uur aan zelfverbetering doorliep gedurende een ontwerpcyclus, meer dan 10.000 EDA-toolaanroepen deed en productieklare chipbusmodules produceerde, terwijl het chipoppervlak met 42% werd verkleind zonder dat er een prestatiecompromis werd vermeld. Dat alles is Alibaba's verslag van zijn eigen model, niet gereproduceerd door iemand buiten het bedrijf.
De scoreverandering zelf is echter geen bewering van een leverancier. De Index is van Artificial Analysis, en de 45 staat op de pagina van die derde partij voor Qwen3.8 Max (0902). De 40 waar de score vandaan kwam, staat op de pagina van dezelfde organisatie voor de build van 3 augustus, die nu als verouderd is gemarkeerd en vooruitwijst naar de huidige. De delta is dus een door de leverancier gerapporteerde oorzaak die gekoppeld is aan een onafhankelijk gescoorde uitkomst, wat een sterkere positie is dan elk van beide helften afzonderlijk. Het is op het moment van schrijven ook het meest concrete openbare bewijs dat iemand heeft dat een frontierlab de gemeten capaciteit van zijn vlaggenschip heeft gewijzigd zonder een nieuw versienummer uit te brengen.
Twee andere dingen aan de release zijn gemakkelijk te missen en beide zijn cruciaal. Ten eerste bevestigde Alibaba dat Qwen 4 in training is, waarbij de Qwen 4.5- en Qwen 5-series naar verwachting opschalen naar 5–10 biljoen parameters. Ten tweede is er een gedateerde snapshot van het vernieuwde model. Alibaba heeft de post-trained build vastgezet als qwen3.8-max-0902 op 2 september, en het is afzonderlijk routeerbaar. Die pin is het praktische antwoord op alles wat de RSI-onthulling impliceert, en we komen erop terug.
Het scorebord
Zes dimensies, beide zijden, waarbij de discipline rond bronvermelding expliciet wordt gehouden, omdat de twee kolommen niet in gelijke mate zijn geverifieerd.
• Contextvenster — Qwen3.8-Max 1.000.000 tokens vs Qwen3.7-Max 1.000.000 tokens (identiek)
• Max. uitvoer — 131.072 tokens vs. 131.072 tokens volgens de eigen modelpagina's van Alibaba (identiek; let op dat onze cataloguspagina voor Qwen3.7-Max 64.000 vermeldt, een discrepantie die we signaleren in plaats van verdoezelen)
• Invoermodaliteit — {{1}}tekst, afbeelding en video{{/1}} vs alleen tekst
• Internationale lijstprijs per 1 miljoen tokens — $2,00 in / $6,00 uit vs. $2,50 in / $7,50 uit; dezelfde tariefkaart brengt beide modellen al $1,65 / $4,951 in rekening in Beijing, Frankfurt en Virginia
• Artificial Analysis Intelligence Index — 45 vs 29
• Onafhankelijke outputsnelheid — 39,7 tokens/sec vs. 211,3 tokens/sec, gemeten ten opzichte van dezelfde vergelijkingsklasse van 211 modellen, waarbij Artificial Analysis de nieuwere tier als opvallend langzaam beoordeelt en de oudere als opvallend snel
De laatste twee rijen vormen het hele artikel. Binnen dezelfde indexfamilie ligt de nieuwere tier 16 punten voor. Op het gebied van snelheid blijft die meer dan vijf keer achter.

Waar de 16 punten vandaan komen — en waar niet
Splits je de Index op in zijn onderdelen, dan wordt de vorm van de upgrade duidelijk, en het is niet de vorm die de marketing suggereert.
Op het gebied van kennis en redeneren zijn de twee modellen feitelijk aan elkaar gewaagd. GPQA Diamond: 92.8 vs 92.3. Humanity's Last Exam: 43.1 vs 40.5. Terugvinden bij lange context: 80.33 vs 79. SciCode: 52.1 vs 49.5. Als je werklast bestaat uit het beantwoorden van vragen over een groot corpus, is de generatiesprong een afrondingsfout. Een veelvoud daarvoor betalen zou moeilijk te rechtvaardigen zijn.
Bij agentisch werk en codeerwerk wordt de kloof hard zichtbaar. Terminal-Bench 2.1: 88.76 vs 74.53. De codingindex van Artificial Analysis: 76.2 vs 66. En de grootste divergentie in de reeks is de banking-tool-use-taak, waar Qwen3.8-Max 47.84 tegenover Qwen3.7-Max' 11.75 noteert — een viervoudig verschil precies in het vermogen dat volgens de RSI-beschrijving door de geautomatiseerde cycli werd geoptimaliseerd: pijplijnontwerp, datavalidatie, iteratief experimenteren, foutdiagnose. Een model dat een maand besteedt aan het verbeteren van zijn eigen trainingsloop, is een model dat beter is geworden in loops.
Eén eerlijke kanttekening bij die afzonderlijke rijen. Beide modelpagina's vallen binnen dezelfde revisiefamilie van de Intelligence Index (v4.3 en v4.3.2), waardoor de vergelijking in de kop van 45 tegen 29 een eerlijke is. De rijen per benchmark behoren niet tot hetzelfde cohort: de cijfers op taakniveau van Qwen3.7-Max dateren uit het evaluatievenster van mei, terwijl die van Qwen3.8-Max uit de reeks van september komen. Lees de richting van de beweging, niet het derde significante cijfer.
De vraag over de prijs is twee vragen.
Op de internationale tariefkaart van Alibaba is de nieuwere Max goedkoper dan het model dat hij verving: $2.00 / $6.00 voor Qwen3.8-Max tegenover $2.50 / $7.50 voor Qwen3.7-Max, per miljoen tokens. Een verlaging van 20% in beide richtingen naarmate de generatie vordert, is ongewoon en op zichzelf al het vermelden waard. De cache-economie valt ook gunstiger uit voor de nieuwere tier — impliciete cache tegen $0.25 versus $0.50, expliciete cache-read tegen $0.17 versus $0.25.
Dat is de eerste vraag, en ze heeft een regionaal antwoord dat de meeste verslaggeving afvlakt. Alibaba rekent voor beide modellen $1,65 invoer / $4,951 uitvoer in Peking, Frankfurt en Virginia. Het verschil van 20% bestaat alleen op de internationale kaart van Singapore. Als je verkeer in de andere drie regio's terechtkomt, kosten invoer- en uitvoertokens vandaag hetzelfde voor beide Max-tiers, en valt de beslissing terug op pure capaciteit — waarna het nieuwere model op alles behalve doorvoer wint, en er valt geen rekenwerk meer te doen.
De tweede vraag is de valkuil. Qwen3.7-Max kost momenteel geen $2,50 / $7,50. Het wordt aangeboden tegen $1,25 / $3,75 — de helft van de lijstprijs, een promotietarief. Dat maakt de vorige generatie vandaag de dag met ruime marge de goedkopere optie. Het betekent ook dat de prijs die u deze week kunt meten, niet de prijs is waaraan u zich zou vastleggen. Alibaba's eigen modelpagina vermeldt ronduit dat de gepubliceerde tabel de oorspronkelijke prijzen toont "met uitzondering van tijdelijke promoties" en verwijst u voor actuele aanbiedingen naar de console. Een promotie is per definitie een tarief dat kan eindigen. Als dat gebeurt, wordt Qwen3.7-Max niet alleen duurder dan vandaag; het wordt 25% duurder dan het model dat het verslaat.
We geven het tarief van de provider door met 0% opslag, dus zowel de lijstprijs als de promotie gaan bij ons op dezelfde dag dat ze veranderen live — wat handig is voor een vergelijking en onhandig als je een budget probeert op te stellen. Bouw het model op basis van de lijstkaart en behandel het promotietarief als meevaller.

Het getal dat het kostenargument omkeert
De tokenprijs is niet wat een taak kost. Artificial Analysis publiceert een cijfer voor kosten per taak waarin cache-economie, redeneervolume en antwoordlengte zijn verrekend, en op die maatstaf keert de rangschikking volledig om: $5,41 per Intelligence Index-taak voor Qwen3.8-Max tegenover $1,15 voor Qwen3.7-Max. Een premie van 4,7×, tegenover een tokenstarief dat ofwel 20% goedkoper ofwel identiek is, afhankelijk van je regio.
Het verschil zit vooral in de breedsprakigheid. Bij dezelfde evaluatie genereerde het nieuwere model 190M uitvoertokens tegenover de 120M van het oudere model, en het redeneert uitvoerig om tot zijn antwoorden te komen. Als je per uitvoertoken betaalt voor een grootschalige, matig moeilijke werklast, is de nieuwere Max op geen van beide tariefkaarten, bij welke tokenprijs dan ook, het goedkopere model. Het is het duurdere model, en de lijstprijs per token is het verkeerde instrument om daarover te beslissen.
Snelheid, en wat ons eigen verkeer laat zien
Het doorvoerverschil is groot genoeg om architecturen te veranderen. Artificial Analysis plaatst Qwen3.8-Max op 39,7 tokens per seconde — in zijn samenvatting wordt het model opmerkelijk traag genoemd — tegenover 211,3 voor Qwen3.7-Max, dat het opmerkelijk snel noemt. Dat is het verschil tussen een model dat je achter een interactief oppervlak zet en een dat je achter een wachtrij zet — en op Qwen3.8-Max is het het eerste wat ons eigen statistiekenpaneel je laat zien.
Onze eigen playgroundtelemetrie over de zeven dagen tot 25 september vertelt een iets genuanceerder verhaal over latentie, en er hoort een kanttekening bij: dit zijn onze metingen op onze routing, geen gecontroleerde benchmark. Qwen3.8-Max liet een mediaan van 2.611 ms tot eerste reactie zien bij 54,7 tokens per seconde met een foutpercentage van 2,45%; de vastgezette 0902-build liet een mediaan van 3.360 ms zien bij 46,2 tokens per seconde met een opvallend schoner foutpercentage van 0,66%. Qwen3.7-Max zat op een mediaan van 4.509 ms, maar 169,8 tokens per seconde met een foutpercentage van 3,80%. De oudere tier antwoordt dus langzamer aan de voorkant en streamt daarna drie keer sneller, terwijl hij vaker faalt. Als je workload bursty is, is dat verschil in foutpercentage meer aandacht waard dan de mediaan.
Beide niveaus zijn live op één OrcaRouter-sleutel naast de vastgezette snapshot, met automatische failover tussen providers. Voor een vergelijking als deze is dat het praktische punt: het meten van je eigen prompts tegen beide Max-generaties is een configuratiewijziging, geen tweede contract.

Reproduceerbaarheid is nu de doorslaggevende factor.
Hier is het deel van de Apsara-openbaarmaking dat niemand heeft ingeprijsd. Een live model-ID waarvan de gemeten capaciteit in de loop van een maand van 40 naar 45 is gegaan, zonder versiewijziging en zonder aankondiging op dat moment, is een reproduceerbaarheidsrisico. Als je productgedrag een functie is van een bewegend ID, heb je een model dat kan verbeteren — of verschuiven — onder een bevroren evaluatiesuite, een gecachte promptbibliotheek of een goedgekeurde regressieset.
Beide generaties bieden gedateerde snapshots, en dat is de mitigatie. Qwen3.7-Max wordt door Alibaba gedocumenteerd als functioneel equivalent aan qwen3.7-max-2026-05-20, met verdere gedateerde builds op 2026-05-17 en 2026-06-08. Qwen3.8-Max heeft qwen3.8-max-0902, de post-trained septemberbuild, waarnaar de 45 verwijst. Als je iets uitbrengt dat reproduceerbaar moet zijn, pin dan de gedateerde ID en behandel de zwevende ID als een stagingdoel. De RSI-cycli zijn een kenmerk van de zwevende ID; de pin is hoe je je eraan onttrekt.
Eén detail over de naamgeving dat je moet weten, zodat je de catalogus niet verkeerd leest. Alibaba vermeldt een derde datumvorm, qwen3.8-max-2026-09-02, naast de 0902-alias; ze verwijzen naar dezelfde build. De oorspronkelijke release van 3 augustus is aan onze kant niet meer routeerbaar — wij serveren Qwen3.8-Max, de bijbehorende 0902-pin, en Qwen3.7-Max.
Wie moet welke kiezen
De beslissing hangt niet af van welk model beter is. Ze hangt af van wat je koopt.
Blijf bij Qwen3.7-Max als je workload alleen tekst is, kennisintensief in plaats van tool-intensief, en doorvoergevoelig — grootschalige classificatie, extractie, retrieval met een lange context, batch-samenvatting. Op GPQA Diamond en long-context recall zit het binnen één punt van het nieuwere model, streamt het drie tot vier keer sneller, en kost het $1,15 per taak tegenover $5,41. Het is ook het juiste antwoord voor iedereen die een goedkope second opinion wil in een fusion- of routingconfiguratie, want tegen zijn promotietarief zit het in een heel andere prijsklasse. Twee kanttekeningen: de promotie is een promotie, en Artificial Analysis heeft het model al gemarkeerd als deprecated, opgevolgd door Qwen3.8-Max. Sluit er geen verbintenis van meerdere jaren op af.
Stap over op Qwen3.8-Max als een van deze waar is: je hebt beeld- of video-invoer nodig, wat Qwen3.7-Max helemaal niet accepteert; je workload is agentisch, met lange tool-call-ketens of meerstaps codeerloops, waar de 88.76 tegenover 74.53 op Terminal-Bench 2.1 en het viervoudige verschil in toolgebruik het verschil vormen tussen wel of niet shippen; of je schrijft tegen de Singaporese internationale tariefkaart, waar het nieuwere model simpelweg 20% goedkoper is en er geen afweging te maken valt. Zet vast op qwen3.8-max-0902 als je wilt dat het gedrag stabiel blijft.
Als je in Beijing, Frankfurt of Virginia bent, is de keuze eenvoudiger dan welke vergelijking dan ook suggereert: beide Max-tiers kosten $1,65 / $4,951 per miljoen tokens. Identiek. Tegen die tarieven is niets extra betalen voor multimodale input, een 16 punten hogere Index en een viermaal betere tool-use-score geen beslissing, het is gratis — en de enige reden om bij Qwen3.7-Max te blijven wordt ruwe doorvoersnelheid.
Twee vragen die een direct antwoord verdienen
Betekent de trainingsrun van 33 cycli dat het model is veranderd onder bestaand API-verkeer? Dat is wat de openbaarmaking impliceert, en daarom bestaat de gedateerde pin. Alibaba beschrijft het verbeterde model als "het bijgewerkte Qwen3.8-Max", de zwevende ID, niet een nieuwe. Als je in september workloads op de zwevende ID had, werden die bediend door een model waarvan de gemeten capaciteit in dat venster verschoof. Alibaba heeft geen changelog gepubliceerd voor de tussenliggende builds, dus de enige betrouwbare manier om te weten welk gedrag je hebt, is pinnen.
Is de RSI-claim onafhankelijk geverifieerd? De score die het opleverde is dat wel — de Index is van Artificial Analysis, en de 45 staat op hun pagina. Het mechanisme erachter is Alibaba's eigen beschrijving van zijn eigen trainingsproces, zonder externe replicatie, zonder gepubliceerd evaluatieprotocol en zonder dat een derde partij de 33 cycli observeert. Beschouw "33 iteratieve cycli" als een leveranciersclaim en "45 na 40" als een gemeten paar. Het zijn niet hetzelfde soort beweringen, en het verschil is de reden dat de kop het waard is om zorgvuldig te lezen in plaats van te herhalen.
Het volgende waar je op moet letten is niet Qwen 4. Het is of de halveprijspromotie van Qwen3.7-Max de komst overleeft van het model dat het moet vervangen. Zo niet, dan zullen heel veel teams ontdekken dat ze een lijstprijs met een korting vergeleken, en dat het oudere van twee zustermodellen al die tijd het duurdere was.
