Een hero-titelkaart voor 'Qwen3.8-Max vs Qwen 3.8' met de ondertitel 'Eén 2.4T-kern — gehuurde API of open gewichten', badges voor de 0902-refresh van 2 september 2026, de gehoste API voor $2/$6 per 1M tokens, en de open gewichten van 12 augustus, en een voettekst die vermeldt dat de onafhankelijke Code Arena WebDev #1 op 1,691 staat voor de 0902-build en dat de open checkpoint nog geen onafhankelijke scores heeft.
Guides & Insights

Qwen3.8-Max versus Qwen 3.8: één 2.4T-core, gehuurd of gerund — na de 0902-refresh

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Op 2 september 2026 bracht Alibaba een gedateerde update van Qwen3.8-Max uit — de build die zij als Qwen3.8-Max-0902 bestempelt — en een onafhankelijke codeerranglijst zette de nieuwe snapshot diezelfde week op #1. De downloadbare versie van diezelfde kern met 2,4 biljoen parameters, het model dat de meeste mensen bedoelen wanneer ze “Qwen 3.8” zonder achtervoegsel schrijven, staat nog steeds op het checkpoint van 12 augustus: alleen tekst, redeneren vast ingeschakeld, en honderden gigabytes te kort om op iets kleiner dan een GPU-rek te kunnen draaien. Die kloof tussen het gehoste vlaggenschip en de open gewichten bestond in augustus nog niet. De hele vergelijking draait nu om die kloof, en daarom blijft hetzelfde model onder twee namen aan je worden verkocht.

Qwen3.8-Max is het gehoste vlaggenschip van Alibaba: een sparse mixture-of-experts-model met 2,4 biljoen parameters, waarbij per token ongeveer 95 miljard parameters actief zijn, sinds 3 augustus live via een betaalde API en met een multimodaal contextvenster van 1 miljoen tokens. Qwen 3.8, op zichzelf beschouwd, is de open release van dezelfde generatie — met als belangrijkste uitgave Qwen3.8-2.4T-A95B, de gewichten die Alibaba op 12 augustus onder een aangepaste licentie publiceerde. Het is niet zo dat de ene een goedkoper broertje is en de andere een premium broertje. Het is hetzelfde brein dat op twee manieren wordt verkocht, en een post-trainingronde van september is begonnen de twee leveringsvormen uit elkaar te trekken. Dit stuk zet uiteen naar welke "Qwen 3.8" je daadwerkelijk kijkt, wat de 0902-refresh heeft veranderd en voor welke route — de API huren of de gewichten draaien — je vandaag zou moeten kiezen.

De koppeling die geen rivaliteit vormt.

Voordat we de data en de tariefkaarten bespreken: de architectuur. Qwen3.8-Max en Qwen3.8-2.4T-A95B delen een fijnmazig MoE-ontwerp met 512 experts per laag (10 gerouteerd plus één gedeelde, per laag), 92 lagen, en een hybride stack waarin 69 van de 92 lagen lineaire aandacht gebruiken — Gated DeltaNet gecombineerd met gated attention — met full attention tussengevoegd voor het werk met lange contexten. Daarom kan de modelkaart een context van een miljoen tokens op de API claimen, en daarom bereikt de open build ook een native 262K die met de juiste servingconfiguratie tot een miljoen reikt. De verschillen tussen de twee namen zitten niet in de architectuur van de gewichten; ze zitten aan de randen, en de randen zijn sinds 2 september verschoven.

Parameters — Qwen3.8-Max: 2,4T in totaal / ~95B actief, MoE. Qwen3.8-2.4T-A95B: dezelfde kern, hetzelfde aantal actieve parameters.

• Levering — Qwen3.8-Max: gehoste API, live sinds 3 augustus, op 2 september vernieuwd als Qwen3.8-Max-0902. Qwen3.8-2.4T-A95B: downloadbare gewichten, voor het eerst gepubliceerd op 12 augustus, sindsdien geen nieuwere checkpoint.

• Modaliteit — Qwen3.8-Max: tekst-, beeld- en video-invoer. Qwen3.8-2.4T-A95B: alleen tekst.

• Redeneercontrole — Qwen3.8-Max: denken kan worden in- en uitgeschakeld, inclusief een modus zonder denken. Qwen3.8-2.4T-A95B: denken staat altijd aan, met alleen een regelaar voor redeneerinspanning (laag / hoog / extra hoog).

• Tooling — Qwen3.8-Max: native function calling, vijf ingebouwde tools en gestructureerde output. Qwen3.8-2.4T-A95B: geen native tool-laag; wat je krijgt hangt af van het inferentieframework waarmee je het serveert.

Wat de refresh van 2 september veranderde

De 0902-build is een post-trainingronde, geen nieuwe architectuur. Alibaba richtte de build op de twee dingen waar Qwen3.8-Max al om bekendstond — coderen en “cowork”, de naam voor agentisch werk met een lange horizon en kantoorwerk — en de cijfers die eromheen zijn gepubliceerd, zijn de reden dat deze vernieuwing ertoe doet. Op het onafhankelijke leaderboard Code Arena: WebDev debuteerde Qwen3.8-Max-0902 met 1.691 Elo, een sprong van 22 punten ten opzichte van de vorige build en genoeg om direct de eerste plaats op te eisen. Alibaba presenteert de build ook als het hoogst scorende model op de kosten-prestatie-Pareto-frontier van dat leaderboard, tegen een effectief tarief van ongeveer $5 per miljoen tokens — de catalogusprijzen van $2 en $6, gewogen naar outputintensief agentisch verkeer — ruwweg een kwart van wat een aanroep van een vergelijkbaar frontiermodel elders kost. Die cijfers moet de lezer goed uit elkaar houden: de 1.691 Elo is een resultaat uit een onafhankelijke arena; de Pareto-frontier-framing is Alibaba’s eigen karakterisering van dat onafhankelijke leaderboard.

Alibaba's interne evals voor de 0902-pass, door de leverancier gerapporteerd en niet gereproduceerd, wijzen in dezelfde richting: Terminal-Bench 3.0 stijgt van 11.3 naar 29.0, ProgramBench van 10.5 naar 28.0, JobBench van 53.4 naar 64.0, en WorkArena Elo van 1,348 naar 1,468. Lees die als "de refresh heeft de agentische en codeer-assen verplaatst", niet als geverifieerde scores. Aan de kant van algemene intelligentie heeft Artificial Analysis' Intelligence Index Qwen3.8-Max op 56 staan — concurrerend, maar niet de reden om ernaar te grijpen; de codeer- en agentische resultaten zijn dat wel.

Het deel dat de meeste berichtgeving heeft gemist, is dat de 0902 post-training op dit moment alleen via de API beschikbaar is. Alibaba heeft geen open checkpoint van het vernieuwde model gepubliceerd — de Qwen3.8-2.4T-A95B-gewichten op Hugging Face zijn nog steeds terug te voeren op de release van 12 augustus. Dat betekent dat de gehoste Qwen3.8-Max en de downloadbare kern niet langer hetzelfde model zijn zoals ze half augustus waren. De API heeft de post-training van september; de gewichten niet. Als je hele reden om de open release te draaien was om exact te reproduceren wat het vlaggenschip doet, is die aanname op 2 september stilletjes niet meer waar gebleken.

A comparison scoreboard for Qwen3.8-Max (0902) and Qwen 3.8 (2.4T-A95B open): left column shows Hosted API with a Sep-2 build tag, Text + image + video, 1M native context, a thinking toggle including off, native tools and JSON, and $2/$6 per 1M with a $0.25 cache tag; right column shows Open weights with an Aug-12 tag, Text only, 262K native context, thinking always on, framework-level tools and JSON, and weights plus your own GPUs; the footer notes independent Code Arena WebDev 1,691 and AA Index 56 for the Max, and that the open checkpoint has no independent scores yet.

De vijf punten waar ze werkelijk uiteenlopen

Leg de gedeelde architectuur even terzijde en de praktische verschillen komen helder naar voren. Modaliteit is het eerste filter: als je workload afbeeldingen of video omvat — screenshots, grafieken, documenten met figuren, videoframes — dan accepteert alleen Qwen3.8-Max die, en het venster van 1M tokens is native in plaats van een extensie. De open gewichten zijn tekst-only. Redeneercontrole is het tweede: de gehoste API kan draaien met denken uitgeschakeld, wat belangrijk is voor latentiegevoelige extractie en extractie op grote schaal, waarbij een denkketen pure overhead is; de open versie kan dat niet uitschakelen. Tooling is het derde: function calling, de vijf ingebouwde tools en JSON-modus maken deel uit van het gehoste product, terwijl de open versie afhankelijk is van wat je servinglaag biedt.

Context is subtieler dan het specificatieblad doet vermoeden. Beide kanten kunnen grofweg een miljoen tokens bereiken, maar het gehoste model doet dat native met multimodale invoer, terwijl de 262K native context van de open build via configuratie moet worden uitgebreid, en elk token van dat uitgebreide venster is tekst. Ook de outputlimieten verschillen — de API staat maximaal ongeveer 131K outputtokens toe, en de open build is doorgaans geconfigureerd met een vergelijkbaar plafond, maar het praktische maximum aan de open kant wordt bepaald door je serving-stack, niet door het model.

Wat elke route daadwerkelijk kost

Dit is waar de twee leveringen helemaal niet meer vergelijkbaar zijn. Qwen3.8-Max heeft een catalogusprijs: $2,00 per miljoen invoertokens, $6,00 per miljoen uitvoertokens en $0,25 per miljoen voor gecachte invoer. Omdat OrcaRouter de catalogusprijzen van providers doorgeeft met 0% opslag, is dat het tarief dat je hier betaalt, en wanneer Alibaba het wijzigt, is het nieuwe getal dezelfde dag live. De 0902-snapshot is apart vastgezet als qwen/qwen3.8-max-0902 voor teams die reproduceerbaar gedrag willen — dezelfde prijs, dezelfde mogelijkheden, maar een vast checkpoint in plaats van het doorlopende model. Op het verkeer van OrcaRouter ligt de mediaan over 7 dagen van de time-to-first-token voor Qwen3.8-Max ruwweg op 2–4 seconden, en Artificial Analysis meet ongeveer 45–50 uitvoertokens per seconde: niet traag, maar breedsprakig, en daarom kunnen agentische taken op dit model verrassend veel tokens verbruiken ondanks het goedkope tarief.

A screenshot of the OrcaRouter model page for Qwen3.8-Max (qwen/qwen3.8-max), showing the flagship description, the price card at $2.00 per 1M input and $6.00 per 1M output tokens, a 1,000,000-token context window, and 7-day median time-to-first-token and traffic figures.

Qwen3.8-2.4T-A95B heeft geen adviesprijs, want de prijs is jouw infrastructuur. De BF16-gewichten beslaan ruwweg 4,9 TB en zelfs de officiële FP8-build is ongeveer 2,4 TB, dus dit is hardware op rackschaal: de kleinste gedocumenteerde servingconfiguraties beginnen rond acht B300- of GB300-GPU's, en een volledige GB300 NVL72-rack is de referentie-implementatie. Agressieve kwantisering verlegt de ondergrens — een NVFP4-build past in ongeveer 1,3 TB, en Unslooths 1-bit gelaagde kwantisering comprimeert het model tot circa 397 GB, waardoor één goed uitgeruste node eindelijk haalbaar wordt — maar elk van die routes gaat ervan uit dat je GPU's op datacenterschaal opereert. Third-party hosts die de open checkpoint aanbieden, verkopen je tokens onder de prijs per token van de Max, maar daarvoor lever je de multimodale invoer, de non-thinking-modus, de native tooling en de 0902-post-training in, en er is nog geen onafhankelijke benchmark van die downloadbare checkpoint zelf gepubliceerd. Alibaba's eigen modelkaart is eerlijk over de relatie: die beschrijft Qwen3.8-Max als de officiële versie die op Qwen3.8-2.4T-A95B is gebouwd, met visuele invoer, non-thinking-ondersteuning, een standaard context van 1M en ingebouwde tools bovenop de open kern.

A screenshot of the Hugging Face model card for Qwen/Qwen3.8-2.4T-A95B, showing the Text Generation and Transformers tags and the card text explaining that Qwen3.8-Max is the official version built on Qwen3.8-2.4T-A95B with vision input, non-thinking support, a 1M default context, and built-in tools.

Onafhankelijke cijfers versus leveranciersclaims

{{1}}De eerlijkheid van de bronvermelding doet er hier meer toe dan bij de meeste vergelijkingen, omdat de twee kanten bewijsmateriaal van sterk verschillende ouderdom hebben.{{/1}} {{2}}Qwen3.8-Max is onafhankelijk getest: het resultaat van 1.691 op Code Arena: WebDev voor de 0902-build en Artificial Analysis' Intelligence Index van 56 zijn metingen door derden, en de prijsstelling die de Pareto-frontier-claim interessant maakt, is een gepubliceerde prijslijst.{{/2}} {{3}}Qwen3.8-2.4T-A95B heeft dat nog niet — de benchmarktabel die Alibaba publiceerde, beschrijft de Max-class-kern, niet een onafhankelijke run van de downloadbare checkpoint, dus de open kant van deze vergelijking is nog grotendeels "de leverancier zegt dat de kern zo scoort."{{/3}} {{4}}Als u tussen deze twee moet kiezen op grond van capaciteiten, behandel de topcijfers van de open gewichten dan als claims totdat een derde partij ze heeft gedraaid.{{/4}}

Wie moet welke kiezen

De beslissing volgt uit de bovenstaande lijst. Grijp naar de gehoste Qwen3.8-Max — vandaag, specifiek de 0902-build — wanneer je de september-post-training, afbeelding- of video-invoer, een niet-denkmode, native tools en gestructureerde output, of een venster van een miljoen tokens nodig hebt zonder infrastructuur op te zetten. Dat is de voorhoedepositie op het gebied van coderen en agentische AI, en voor $2/$6 met $0,25 gecachete invoer is het agressief geprijsd voor wat het is.

Kies Qwen3.8-2.4T-A95B wanneer controle zwaarder weegt dan gemak: je hebt de gewichten nodig op je eigen hardware of bij een provider die je al draait, je wilt een vast checkpoint dat je kunt auditen en reproduceren, of je aanhoudende volume maakt de kosten per token tot de dominante factor en je bent bereid een 2.4T-MoE te draaien. Aanvaard de lijst van afwegingen — alleen tekst, denkmodus altijd aan, geen native tooling, nog geen 0902-posttraining — en controleer de licentievoorwaarden voor jouw omzetklasse, want de maatwerklicentie van Qwen3.8-Max is geen Apache 2.0-licentie en voegt voorwaarden toe voor grote commerciële exploitanten.

Als je workload een hoog volume heeft, op één GPU draait of latentiegevoelig is, is geen van beide misschien het juiste pad — het zustermodel met 27 miljard parameters van deze generatie, Qwen3.8-27B, is daarop toegesneden en wordt apart behandeld in onze vergelijking tussen Qwen3.8-27B en Qwen3.8-Max.

Hoe probeer je beide zonder je stack op het spel te zetten?

De schone manier om deze aanroep te doen is om beide kanten op je eigen prompts te draaien, en dit is waar een routinglaag zijn bestaansrecht bewijst in plaats van er een achteraf aan te koppelen. Qwen3.8-Max en de vastgezette snapshot Qwen3.8-Max-0902 zitten beide achter één OpenAI-compatibel eindpunt op OrcaRouter, zodat het schakelen tussen de rolling flagship en het reproduceerbare controlepunt een model-id-wijziging is, geen herimplementatie. Wanneer een team besluit de open gewichten in huis te halen, kan de routing-DSL een self-hosted vLLM- of SGLang-eindpunt dat Qwen3.8-2.4T-A95B bedient, aan de voorkant plaatsen en in dezelfde aanroepgraaf opnemen — bulkverkeer naar je eigen implementatie, moeilijke prompts en multimodale verzoeken die worden doorgestuurd naar de gehoste Qwen3.8-Max, met automatische failover ertussen. Op die manier kost het uitproberen van een nieuw controlepunt een configuratiewijziging in plaats van een migratie, wat precies is wat je wilt wanneer de twee kanten van deze vergelijking nog met verschillende snelheden bewegen.

De bottom line

Qwen3.8-Max en Qwen 3.8 zijn niet twee modellen die strijden om dezelfde baan. Ze zijn één kern van 2,4 biljoen parameters, geleverd als een gehuurde API en als downloadbare gewichten; de update van 2 september zorgde ervoor dat die twee leveringen inmiddels iets anders betekenen. Wie de API huurt, krijgt de 0902-posttraining die de leiding nam in Code Arena: WebDev, plus vision, een niet-denkende modus, native tooling en een native contextvenster van één miljoen tokens, voor $2/$6, met $0,25 voor gecachte invoer. Wie de open gewichten draait, krijgt dezelfde architectuur, bevroren in de staat van 12 augustus — uitsluitend tekst, redeneren altijd ingeschakeld — zonder onafhankelijke scores en met een rekening voor datacenterhardware. Als de verbeteringen van september op coderings- en agentisch gebied voor jou belangrijk zijn, heeft vandaag slechts één van de twee namen ze. Als reproduceerbare controle zwaarder weegt, is slechts één van de twee namen echt van jou om te houden.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt