
Qwen3.8-Max-recensie: Alibaba's 2.4T-vlaggenschip voor $2/$6 — 0902-build voert Code Arena WebDev aan.
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen
Alibaba Qwen gaf een preview van Qwen3.8-Max op de World AI Conference in Shanghai op 19 juli 2026, en twee weken lang was het het meest besproken model waar niemand daadwerkelijk een prijs voor kon krijgen. Er was geen prijslijst, geen benchmarktabel, geen modelkaart, geen licentie en geen aantal actieve parameters — alleen een headline van 2,4 biljoen parameters en de bewering dat het model „alleen door Claude Fable 5 wordt overtroffen."
Op 3 augustus 2026 veranderde dat. Qwen3.8-Max is algemeen beschikbaar: een gepubliceerde tariefkaart van $2 per miljoen inputtokens en $6 per miljoen outputtokens, een OpenAI- en DashScope-compatibele endpoint, een volledige benchmarktabel en open gewichten die op 12 augustus zijn verschenen. Een week later, op 14 augustus, ging het live op DigitalOcean Serverless Inference als Alibaba's 'dag-nul'-lanceringspartner – de eerste grote westerse cloud die het model aanbood. Op 2 september bracht Alibaba een vernieuwde versie uit, Qwen3.8-Max-0902, die verder is getraind op Coding en Cowork, waarvan Qwen stelt dat het de prestaties bij complexe enterprise- en wetenschappelijke werkzaamheden versterkt. Deze review is geschreven op basis van de GA-feiten, met die dag-nul-lancering en de 0902-build erin verwerkt, en beantwoordt de vraag die teams nu daadwerkelijk hebben, nu het model te koop is: is Qwen3.8-Max klaar voor productie, of is het nog een watchlist-model?
Het korte antwoord is dat het verder is gegroeid dan de meeste mensen hadden verwacht — met name de prijsstelling is agressief op een manier die de grenzen opnieuw vaststelt, en de vernieuwing van 2 september zet nog sterker in op de twee dingen waar het model al goed in was — programmeren en samenwerken. De onafhankelijke scorekaart die inmiddels is verschenen, is oprecht goed, maar bevat een kanttekening die de moeite waard is om te lezen voordat je verkeer inzet.
TL;DR. Qwen3.8-Max is nu GA voor $2 / $6 per 1M tokens, vast voor de volledige 1M-tokencontext zonder toeslag voor lange prompts — goedkoper dan Kimi K3 ($3/$15) en Claude Opus 5 ($5/$25) op output, de kostenbepalende factor voor redeneerwerk. Alibaba publiceerde een sterke benchmarktabel (Terminal-Bench 2.1 86.6, GPQA Diamond 92.6, OSWorld-Verified 86.1) en de sprong in codeerprestaties ten opzichte van zijn voorganger is dramatisch: FrontierSWE 73.5 tegenover 40.7. Maar de kwaliteitstabel is van Alibaba zelf, en de eerste onafhankelijke beoordelaar — de Artificial Analysis Intelligence Index — heeft zich nu uitgesproken: Qwen3.8-Max scoort 56 bij $1,14 per taak, gelijk aan Claude Opus 4.8 (56) en één punt achter open-weights-leider Kimi K3 (57), met 25% hogere kosten per taak. Het aantal actieve parameters is geen vraagteken meer: 95B geactiveerd van 2.4T totaal, bevestigd op de officiële modelkaart, waardoor buitenstaanders eindelijk de economie van het serveren kunnen beredeneren. Sinds deze review voor het eerst verscheen, is er ook een tweede beheerd pad geopend: Qwen3.8-Max ging live op DigitalOcean Serverless Inference op 14 augustus als Alibaba's Day 0-partner, met door DigitalOcean gepubliceerde serveercijfers — prefill die schaalt naar ~16.000 tokens/sec en ~1.937 outputtokens/sec bij 256 gelijktijdige verzoeken met nul fouten — de eerste harde latentiegegevens van een andere aanbieder dan Alibaba. Op 2 september ververste Alibaba het vlaggenschip als Qwen3.8-Max-0902, verder getraind op Coding en Cowork; Qwen zegt dat de nieuwe snapshot sterker is op complexe enterprise- en wetenschappelijke workloads — een bewering van de leverancier zonder onafhankelijke cijfers voor enterprise- of wetenschappelijk werk. De codeerkant van de 0902-build heeft nu een eigen onafhankelijk arenaresultaat: Qwen3.8-Max-0902 debuteerde op #1 op de Code Arena: WebDev-leaderboard met 1.691 punten — 22 meer dan de vorige build en vóór Claude Opus 5 en Kimi K3 — volgens Alibaba, dat verwijst naar de live third-party arena-lijst. Het agentische-commerceverhaal kreeg dezelfde week een scorebord: op CommerceAgentBench, een nieuwe benchmark van Alibaba's Accio-team, gebouwd op stateful replica's van echte commerce-software, noteert Qwen3.8-Max het sterkste open-weightsresultaat — 156 geaggregeerde passes over drie harnesses, twee meer dan DeepSeek V4 Pro — een tabel van de leverancier, geen onafhankelijke beoordelaar. Oordeel: nu echt aanschafbaar, en goedkoop genoeg om een echte evaluatie te rechtvaardigen — maar zet het gericht in, niet over de hele linie.
Belangrijkste conclusies
• GA sinds 3 augustus 2026. Het tijdperk van preview- en creditscampagnes is voorbij; er zijn een echte prijslijst en een echt eindpunt.
• $2 / $6 per 1M tokens, één vast tarief voor de volledige 1M context. De meeste concurrenten rekenen een toeslag voor lange prompts. Alibaba doet dat niet, wat enorm belangrijk is voor werk met lange documenten en grote repositories.
• De benchmarktabel van Alibaba is sterk, maar niet gecontroleerd: Terminal-Bench 2.1 86.6, GPQA Diamond 92.6, PaperBench 93.0, IFBench 82.8, OSWorld-Verified 86.1, OmniDocBench 1.5 92.1.
• De generatiesprong in coderen is het echte verhaal: FrontierSWE 73.5 (van 40.7) en DeepSWE 1.1 56.6 (van 21.6) — bijna een verdubbeling voor beide.
• De eerste onafhankelijke score is binnen: Qwen3.8-Max scoort 56 op de AA Intelligence Index bij $1.14/task — een sprong van 10 punten ten opzichte van Qwen3.7-Max (46), gelijk aan Claude Opus 4.8 (56), één punt achter Kimi K3 (57). Het algemene klassement van LMArena heeft nog steeds geen publieke score.
Actieve parameters bevestigd op 95B — de officiële modelkaart vermeldt 2,4T totaal en 95B geactiveerd, waarmee de grootste open vraag in de rekensom voor servingkosten wordt beantwoord.
Open gewichten zijn vrijgegeven — Qwen3.8-2.4T-A95B (BF16) en Qwen3.8-2.4T-A95B-FP8 zijn op 12 augustus op Hugging Face verschenen onder een aangepaste Qwen3.8-Max-licentie, niet Apache 2.0. Het Qwen3.8-27B on-premise-pad is op 14 augustus uitgebracht onder Apache 2.0.
• Een tweede beheerd pad werd geopend op 14 augustus. Qwen3.8-Max is live op DigitalOcean Serverless Inference als Alibaba's "Day 0-lanceringspartner" — NVFP4 op NVIDIA HGX B300, $2/$6 met $0.20 gecachede invoer, aangeboden op de native 262K-context van het open checkpoint. De door DigitalOcean gemeten cijfers (prefill ~16K tokens/sec, nul fouten bij 256 gelijktijdige verbindingen) zijn de eerste prestatiegegevens voor serving op een beheerd platform buiten Alibaba.
• Update van 2 september: Qwen3.8-Max-0902. Alibaba heeft het vlaggenschipmodel een vervolgtraining gegeven op Coding en Cowork en biedt het op QwenCloud aan voor dezelfde $2/$6 en 1M-context. Qwen zegt dat de prestaties op enterprise- en wetenschapsgebied sterker zijn — nog altijd beweringen van de leverancier — terwijl de codeerkant dezelfde dag een onafhankelijk arenaresultaat behaalde: de build debuteerde op #1 in Code Arena: WebDev met een score van 1.691 (Code Arena-bullet hieronder).
• CommerceAgentBench: open-weight-leider, door de leverancier uitgevoerd. Het Accio-team van Alibaba heeft deze week CommerceAgentBench uitgebracht — 107 taken met een lange horizon in stateful replica's van echte commerce- en bedrijfssoftware, die state-based worden beoordeeld in de Accio-, OpenClaw- en Pi-harnesses. Qwen3.8-Max leidt de open-weight modellen met 156 geaggregeerde passes, twee meer dan DeepSeek V4 Pro; het gesloten model Claude Opus 5 leidt overall met 191, en de tabel is van Alibaba zelf, niet van een onafhankelijke scheidsrechter.
• Code Arena: WebDev #1 — het onafhankelijke arena-resultaat van de 0902-build. Qwen3.8-Max-0902 debuteerde bovenaan het Code Arena: WebDev-klassement met 1.691 punten — 22 meer dan de vorige build en vóór Claude Opus 5 en Kimi K3 — en voert de Pareto-frontier voor kosten en prestaties van dat klassement aan tegen een gewogen gemiddelde prijs van ~$5/MToken, ongeveer een kwart van de gewogen gemiddelde prijs van Claude Opus 5. Het officiële QwenCloud-account van Qwen bevestigde de plaatsing. In tegenstelling tot CommerceAgentBench is dit klassement afkomstig van een derde partij: een blinde arena met menselijke stemmen, geen Alibaba-tabel, hoewel 'debuteerde op #1' een aankondiging van Alibaba is die verwijst naar een momentopname van het klassement.
Nauwkeurigheidsnotitie: de Qwen3.8-Max-benchmarktabel in deze review is door Alibaba gerapporteerd en is niet onafhankelijk gerepliceerd. De Artificial Analysis Intelligence Index-score (56 bij $1,14 per taak) is onafhankelijk gemeten door AA op de officiële API van Alibaba — de eerste onafhankelijke scheidsrechter van het model. De prijzen komen van de GA-prijslijst van Alibaba Model Studio. De open-weights-repositories (Qwen3.8-2.4T-A95B en Qwen3.8-2.4T-A95B-FP8), het actieve 95B-cijfer en de licentietekst zijn first-party: ze komen van Qwen's eigen Hugging Face-organisatie, geverifieerd op 13 augustus 2026. De beschikbaarheid op DigitalOcean, de bijbehorende prijslijst, de serveerprestatiemetingen en de GPQA-steekproef van 88 op de gekwantiseerde build komen uit DigitalOcean's eigen documentatie en community-tutorial, gepubliceerd bij de aankondiging van 14 augustus; de karakterisering 'Day 0-lanceringspartner' is de taal van Alibaba's aankondiging. Waar we concurrentiecijfers aanhalen, komen die van Artificial Analysis of van de leverancier die inline wordt genoemd. De op 2 september aangekondigde Qwen3.8-Max-0902-update is in alle opzichten afkomstig van de leverancier: de specificaties, de beschrijving van de post-training 'Coding-and-Cowork' en de geclaimde voordelen voor bedrijven en wetenschap komen allemaal uit Qwen's eigen aankondiging en de QwenCloud-modelpagina, en geen van de cijfers is onafhankelijk gereproduceerd. De Code Arena: WebDev-positie die in het benchmarkgedeelte wordt behandeld, is de enige uitzondering: dat bord is een arena van derden met blind stemmen, geen Alibaba-tabel — hoewel 'debuut op #1 met 1.691' Alibaba's aankondiging is van een momentopname, en arena-scores blijven bewegen naarmate er stemmen bijkomen. Het CommerceAgentBench-resultaat dat hieronder wordt behandeld valt in dezelfde categorie: de benchmark is gebouwd en gepubliceerd door Accio, het team van Alibaba International, dus de tabellen zijn door Alibaba gerapporteerd — een open-source benchmark, maar geen onafhankelijke scheidsrechter zoals Artificial Analysis dat is. Leveranciersbenchmarktabellen zijn doorgaans optimistisch — behandel deze als een hypothese om op je eigen workload te testen, niet als een definitieve rangschikking.

Wat is Qwen3.8-Max?
Qwen3.8-Max is het vlaggenschip van Alibaba's Qwen-familie: een sparse Mixture-of-Experts-model met in totaal 2,4 biljoen parameters, een contextvenster van 1M tokens en native multimodale invoer. Het accepteert tekst, afbeeldingen en video, en retourneert tekst. Het ondersteunt denkmodus, functieaanroepen, ingebouwde tools en gestructureerde uitvoer, en wordt aangeboden via een OpenAI-compatibel /v1/chat/completions-eindpunt, wat betekent dat de meeste bestaande integraties een wijziging van de base-URL nodig hebben in plaats van een herschrijving. De huidige productieversie, uitgebracht op 2 september, is Qwen3.8-Max-0902, verder post-getraind op Coding en Cowork.
De praktische contextgetallen zijn iets specifieker dan de marketing "1M." Alibaba's cloudmetadata vermelden een venster van 983,616 tokens met de denkmodus ingeschakeld, een maximale invoer van ruwweg 991K tokens, en een maximale uitvoer van 131,072 tokens. Die uitvoerlimiet is uitzonderlijk royaal en is belangrijk voor taken zoals het genereren van volledige bestanden of het opstellen van lange rapporten, waar lagere limieten je dwingen om te chunk-en-stitchen. Het open checkpoint dat DigitalOcean nu aanbiedt is een andere configuratie: de modelkaart vermeldt standaard 262,144 tokens, uitbreidbaar tot ongeveer 1,010,000, dus bij derden die de open basis draaien, zal men doorgaans op het kleinere oorspronkelijke aantal uitkomen.
Het aantal actieve parameters is nu openbaar, en de repositorynaam draagt het: A95B betekent 95 miljard geactiveerd. De officiële modelkaart voor Qwen3.8-2.4T-A95B vermeldt "2.4T in totaal en 95B geactiveerd", een fijnmazige Mixture-of-Experts met 512 experts, waarvan er per token 10 gerouteerde plus één gedeelde actief zijn. Dat getal doet er meer toe dan de 2.4T-kop. Voor een dense model vertellen totale parameters je ongeveer wat inferentie kost; voor een MoE-model zeggen ze bijna niets — alleen het actieve aantal telt, want dat is wat er per token daadwerkelijk draait. Een 2.4T-model dat 30B activeert, gedraagt zich volledig anders in latentie en in de economie van het serveren dan een model dat 200B activeert. Met 95B actief valt de rekenkracht per token in dezelfde orde als die van een dense model rond de 90B — een fractie van wat een dense 2.4T zou vergen — en dat is het getal dat de self-hosting-vraag hieronder uiteindelijk beantwoordbaar maakt.
De update van 2 september: Qwen3.8-Max-0902
Op 2 september 2026 bracht Qwen zijn eerste benoemde productie-refresh uit. Qwen3.8-Max-0902 behoudt dezelfde 2.4T-parameter sparse-MoE-architectuur, dezelfde 95B actieve parameters en hetzelfde 1M-token contextvenster, maar is verder post-getraind op twee capaciteiten — Coding en Cowork — en is live op de API van QwenCloud als qwen3.8-max-0902 (ook vermeld als qwen3.8-max-2026-09-02). Het is de huidige aanbevolen build in plaats van een zijtak: het ongedateerde qwen3.8-max-eindpunt van Alibaba bedient nu de 0902-snapshot, dus een aanroep naar de standaardmodelnaam belandt bij de refresh, terwijl de gedateerde id er is voor teams die de exacte build willen vastpinnen. Sinds 3 september wordt de snapshot ook vermeld als een eigen routeerbaar model-id op beheerde API's van derden. De tariefkaart bleef ongewijzigd: $2 per 1M input, $6 per 1M output, met dezelfde cachetarieven.
De prestatieclaims zijn van Qwen. De aankondiging en de QwenCloud-modelpagina beschrijven een codeercapaciteit die "nieuwe wegen baant" op projecten op engineerschaal en autonome ontwikkeling met een lange horizon, een "aanzienlijk verbeterde" collaboratieve agentervaring bij multi-toolorkestratie en end-to-end taakuitvoering, en — zoals het bedrijf het stelt — sterkere prestaties bij complexe bedrijfstaken, wetenschappelijk onderzoek en langcyclische workflows. De eerste onafhankelijke controle kwam dezelfde dag binnen. Qwen3.8-Max-0902 debuteerde op nummer 1 van het Code Arena: WebDev-leaderboard — een arena van derden met blinde stemming voor agentische webontwikkeling, het project dat voorheen bekend stond als WebDev Arena — met 1.691 punten, 22 meer dan de vorige build en vóór Claude Opus 5 en Kimi K3, volgens Alibaba, dat naar het live leaderboard verwijst — een notering die het officiële account van Qwen dezelfde dag bevestigde, verwijzend naar de QwenCloud API. Wat dat wel en niet bewijst, wordt uiteengezet in het benchmarkgedeelte hieronder. De overige claims van de vernieuwing — bedrijfsredenering, wetenschappelijk werk en algemene autonomie met een lange horizon — zijn nog steeds afkomstig van de leverancier, dus handhaaf de discipline die gold voor de tabel van augustus: behandel die als een hypothese totdat een Artificial Analysis-run of een echte workload ze bevestigt.
Wat "Cowork" in de praktijk betekent, is waar de nieuwe versie interessant wordt. De Qwen3.8-Max uit het GA-tijdperk leunde al op autonomie over een lange horizon — de 16-daagse oh-my-cli-build, de virtuele business met meer dan 2.000 rondes — en de 0902-build is Alibaba die nog dieper op die as inzet: agenten die meerdere tools orkestreren en een taak end-to-end opleveren in plaats van eenmalige antwoorden. In dezelfde week publiceerde het Accio-team van Alibaba CommerceAgentBench, een benchmark die is gebouwd om die as direct te meten: 107 taken over een lange horizon binnen stateful replica's van echte commerce- en bedrijfssoftware, waarin Qwen3.8-Max het open-weights-veld aanvoert — gedetailleerd in het benchmarkgedeelte hieronder. Voor teams die het model evalueren voor bedrijfsmatig gebruik, is dat de claim die ze als eerste moeten testen, want die is ook het moeilijkst om vanuit een benchmarktabel te verifiëren.
Prijsstelling: het meest agressieve aspect van deze lancering
Alibaba Model Studio vermeldt Qwen3.8-Max voor $2,00 per 1M invoertokens en $6,00 per 1M uitvoertokens. De output bevat denktokens, wat van belang is omdat redeneerintensieve configuraties hun interne denkwerk tegen het uitvoertarief in rekening brengen. Cache-economie: gecachte invoertreffers kosten $0,25 per 1M, expliciete cachecreatie $2,50, en expliciete cachereads $0,17.
Het structureel interessante deel is niet het headline-cijfer, maar het vaste tariefniveau. Alibaba rekent dezelfde $2/$6, of je prompt nu 5.000 of 900.000 tokens bevat. De meeste concurrenten hanteren een toeslag voor lange context, juist omdat het bedienen van een prompt met bijna een miljoen tokens duur is. Dat Alibaba die kosten voor zijn rekening neemt, is een doelbewuste landroof die precies gericht is op de workloads waar lange context centraal staat: code-review van een volledige repository, analyse van contracten en deponeringen, synthese van onderzoek uit meerdere documenten.
Uitgewerkt voorbeeld. Stel dat je een repo-analyse-agent draait: 200.000 invoertokens aan codecontext en 8.000 uitvoertokens per aanroep.
• Per oproep: 0.2M × $2 = $0.40 invoer, plus 0.008M × $6 = $0.048 uitvoer. ≈ $0.45 per oproep.
• Bij 1.000 gesprekken per dag: ≈ $448/dag, of ongeveer $13.400/maand.
• Dezelfde aanroep naar Claude Opus 5 voor $5/$25: $1.00 + $0.20 = $1.20 — ongeveer 2,7× meer.
• Met prompt-caching in een stabiele codecontext verlaagt gecachte input van $0,25 de inputkant van $0,40 naar $0,05, waardoor de aanroep uitkomt op ≈ $0,10 — een reductie van bijna 4,5× bij herhaald verkeer.
Dat cacheverschil is waar het echte budget zit. Als je agent bij elke beurt een grotendeels ongewijzigde context opnieuw leest — wat voor de meeste codeer- en supportagents geldt — ligt de effectieve prijs veel dichter bij $0,25/$6 dan bij $2/$6. Teams die de cacheconfiguratie overslaan, betalen routinematig 3–4× te veel voor dit model.
Ter vergelijking tegen catalogusprijzen: Qwen3.8-Max $2/$6; zijn eigen voorganger Qwen3.7-Max $2.50/$7.50; Kimi K3 $3/$15; GPT-5.6 Terra $2/$12; Claude Opus 5 $5/$25. Bij invoer is Qwen slechts concurrerend. Bij uitvoer — de kant die de uitgaven aan redeneren en agentisch werk domineert — is het het goedkoopste model met frontier-claims op die lijst.
De onafhankelijke meting van Artificial Analysis legt de keerzijde van die goedkope tokens bloot. Op zijn Intelligence Index kost Qwen3.8-Max $1.14 per taak — meer dan het dubbele van de $0.53 van de voorganger, en 25% hoger dan de $0.86 van Kimi K3 ook al vermeldt Kimi K3 $3/$15 per token. Het verschil is gedragsmatig, geen prijsverhoging: het model had gemiddeld 64 stappen per GDPval-AA-taak versus 14 voor Qwen3.7-Max, en omdat de harness bij elke stap het volledige gesprek opnieuw verzendt, groeiden de inputtokens ruwweg 15× en de output ~45%. Goedkope tokens staan niet gelijk aan goedkope agents — de breedsprakigheid die de preview-testers opmerkten heeft nu een gemeten prijskaartje. Omdat OrcaRouter de lijstprijzen doorgeeft met 0% opslag achter één OpenAI-compatibel eindpunt, is die vraag van $1.14 versus $0.86 iets dat je kunt meten op identieke prompts zonder een tweede contract.

De benchmarktabel, en wat elk nummer daadwerkelijk meet
Tijdens GA publiceerde Alibaba de tabel die het tijdens de preview had achtergehouden. Gerapporteerde scores:
• Terminal-Bench 2.1 — 86.6. Meet of een model een echte shell volledig kan bedienen: commando's uitvoeren, output lezen, herstellen van fouten. Dit is de dichtstbijzijnde proxy voor "kan het functioneren als een code-agent in plaats van een code-suggestietool."
• GPQA Diamond — 92.6.Vragen over natuurkunde, scheikunde en biologie op masterniveau, geschreven om niet eenvoudig opzoekbaar te zijn. Een hoge score duidt op echte wetenschappelijke redenering in plaats van herinnering. 92.6 staat aan de top van het huidige veld.
• PaperBench — 93.0. Het reproduceren van resultaten uit onderzoekspapers — een methodologie lezen en deze opnieuw implementeren. Beloont aanhoudend meerstapsbegrip.
• IFBench — 82.8. Instructievolging onder beperkingen: formaat, lengte en negatieve instructies. Opvallend is de laagste score in Alibaba's eigen tabel, wat consistent is met de klacht uit de preview-periode dat het model zo grondig te werk gaat dat het reikwijdtebeperkingen negeert.
• OSWorld-Verified — 86.1. Computergebruik: het bedienen van een echte desktop-GUI om taken uit te voeren. De sterke score hier ondersteunt de agentische positionering.
• OmniDocBench 1.5 — 92.1. Documentparsing — tabellen, lay-out, gemengde tekst en figuren. Vormt samen met de 1M flat-rate context een sterk argument voor documentpijplijnen.
• FrontierSWE — 73,5, tegenover de 40,7 van een voorganger. DeepSWE 1.1 — 56,6, tegenover 21,6.
Die laatste twee verdienen extra aandacht. Bijna-verdubbelingen op moeilijke software-engineering-benchmarks in één generatie zijn geen normale incrementele verbeteringen, en ze passen bij Alibaba's beslissing om dit model op ontwikkelaars te richten in plaats van op chatgebruikers. Als het FrontierSWE-cijfer onafhankelijke replicatie overleeft, is Qwen3.8-Max een serieus codeermodel en niet zomaar een groot model.
Het voorbehoud uit de preview is kleiner geworden, maar niet verdwenen. De bovenstaande tabel is door Alibaba geproduceerd, op een eigen testopstelling, onder omstandigheden die niemand anders kan controleren. Tabelresultaten van leveranciers worden gekozen, niet aselect getrokken — laboratoria publiceren de benchmarks waar ze goed in zijn. Maar sinds 6 augustus is er nu een echte onafhankelijke scheidsrechter: Artificial Analysis heeft Qwen3.8-Max beoordeeld met een score van 56 op de Intelligence Index voor $1.14 per taak, gemeten op de officiële API van Alibaba — een sprong van 10 punten ten opzichte van de 46 van de voorganger, gelijk aan Claude Opus 4.8 (56), en één punt achter Kimi K3 (57). Op AA's agentic GDPval-AA-leaderboard bereikt het model 1.739 Elo, waarmee het Kimi K3 (1.685) en GPT-5.6 Sol (1.730) voorbijgaat, met alleen Claude Opus 5 (1.852) nog voor zich. AA's eigen kanttekeningen verdienen evenveel gewicht: een eerdere run scoorde 53 voordat endpoint-problemen waren opgelost en de hertest via de officiële API leverde 56 op; AA-Omniscience verloor 10 punten door een hallucinatiepercentage dat steeg van 23% naar 40%; en de kosten per taak zijn hoog juist omdat het model veel meer stappen doorloopt. Het algemene leaderboard van LMArena heeft nog steeds geen publieke score.
De DigitalOcean-lancering voegde een derde datapunt toe, dit keer op de gekwantiseerde build in plaats van het vlaggenschip. DigitalOcean's eigen interne steekproef van de NVFP4-gewichten die het serveert scoorde 88 op GPQA Diamond, tegen Alibaba's gepubliceerde 92,6 voor het niet-gekwantiseerde vlaggenschip. DigitalOcean zelf bestempelt de vergelijking als "een indicatief datapunt in plaats van een gecontroleerde vergelijking" — de verschillen lopen langs drie assen (open-gewichtenbasis in plaats van het gehoste vlaggenschip, NVFP4 in plaats van BF16, en een andere evaluatiestack) — maar het is de eerste onafhankelijke controle op een echte serving-implementatie van deze gewichten, en een herinnering dat de open checkpoint niet byte-voor-byte het getal op Alibaba's tabel is.
CommerceAgentBench: het scorebord voor agentische commerce
Naast de vernieuwing heeft het Accio-team van Alibaba International CommerceAgentBench uitgebracht, een benchmark die precies het langetermijnwerk scoort dat Qwen blijft aanprijzen. Een agent start elke taak in een verse container in een van de 14 offline replica's van echte commerce- en bedrijfssoftware — productpublicatie, vrachtboeking, winkelbeheer, betaaloperaties, leveranciersanalyse — en de beoordeling is statusgebaseerd: een taak slaagt alleen wanneer de onderliggende mockdiensten en geproduceerde bestanden daadwerkelijk veranderen, dus een agent die een aannemelijke workflow beschrijft zonder de status te wijzigen, scoort niets. De suite voert 107 taken uit via CLI-, browser-, bestands-/document- en API/MCP-interfaces, uitgevoerd via drie harnesses — Accio, OpenClaw en Pi — en de harnesscode (Apache 2.0) en taakdata (CC BY 4.0) zijn open voor inspectie of heruitvoering.
In de gepubliceerde tabellen behaalt Qwen3.8-Max {{1}}het sterkste resultaat bij de open-gewichtmodellen: 56 van de 107 taken op de Accio-harness, 47 op OpenClaw en 53 op Pi — 156 geaggregeerde passes, twee meer dan de 154 van DeepSeek V4 Pro.{{/1}} Het volledige open-gewichtvoordeel komt van de Accio-harness; {{2}}de twee modellen eindigen gelijk op OpenClaw en Pi.{{/2}} De koploper bij de open-gewichtmodellen is niet de algehele leider: {{3}}het gesloten model Claude Opus 5 laat het hele veld achter zich met 191 geaggregeerde passes en een voorsprong van 35.{{/3}} En de tabel is van Alibaba zelf — Accio is het team van Alibaba, en de repository zelf attendeert op de beperkingen van de audit: {{4}}de Accio-harness is uitsluitend ter referentie en niet reproduceerbaar vanuit een checkout (OpenClaw is het opnieuw uitvoerbare pad){{/4}}, {{5}}resultaten op taakniveau missen onveranderlijke publieke checksums{{/5}}, en {{6}}de rijen van Qwen berustten op een replay-protocol voor reasoning-inhoud om vergelijkbaar te blijven.{{/6}} Behandel het als een {{7}}door de leverancier opgegeven datapunt op dezelfde agentische as die OSWorld-Verified en AA's GDPval-AA-benadering vanuit verschillende invalshoeken benaderen{{/7}} — de moeite waard om aan je eigen workflows te toetsen, {{8}}geen vaststaande ranglijst.{{/8}}
Code Arena WebDev: de onafhankelijke scheidsrechter van de 0902 build
Code Arena is het onafhankelijke bewijsstuk dat bij de refresh ontbrak. Het is een ranglijst van een derde partij voor agentische webontwikkeling — het project dat voorheen bekendstond als WebDev Arena — waar blinde, paarsgewijze stemmen van mensen over welke output van een model een gebruiker liever zou uitbrengen, worden omgezet in een Elo-achtige rating. Op het WebDev-klassement debuteerde Qwen3.8-Max-0902 bovenaan met 1.691 punten, 22 meer dan de vorige build en vóór Claude Opus 5 en Kimi K3. Die plaatsing heeft bovendien een kostenvoordeel: tegen een gewogen ~$5 per miljoen tokens — de lijstprijs van $2/$6, gewogen naar de output-zware mix die webapp-generatie daadwerkelijk produceert — is de 0902-build het hoogst scorende model op de Pareto-frontier van het klassement. Het kost ongeveer een kwart van de gewogen ~$20/M van Claude Opus 5 en ruim onder de ~$12/M van Kimi K3; daarom bevinden die twee zich buiten de frontier, ondanks dat ze qua score op #2 en #3 staan. Alibaba kondigde de positie aan op 2 september en het officiële Qwen-account bevestigde dit, waarbij gebruikers naar QwenCloud worden verwezen; de meting is niet van Alibaba: in tegenstelling tot de bovenstaande benchmarktabel of de net bovenstaande CommerceAgentBench-run wordt deze score geproduceerd door een arena van een derde partij op basis van menselijke voorkeursstemmen.
Twee kanttekeningen houden het eerlijk. Ten eerste: arena-classificaties zijn momentopnamen: 1.691 is waar het scorebord stond toen Alibaba de lancering aankondigde, en het zal verschuiven naarmate er stemmen bijkomen, dus beschouw het als een sterk signaal voor webontwikkelingsprogrammering, niet als een permanente kroon. Ten tweede: het bestrijkt slechts die ene as. De beweringen van de update over enterprise-, wetenschappelijke en algemene langetermijnmogelijkheden hebben nog steeds geen onafhankelijke scheidsrechter; daarom blijven de leverancierstabel en de AA Index 56 op het basismodel de referentiepunten voor alles buiten agentisch front-endwerk. Ten derde: de frontierprijs is een modelleerkeuze, geen nieuwe tariefkaart: het cijfer van ~$5/MToken mengt de ongewijzigde $2/$6-lijst met een aanname van zwaar outputverbruik, dus behandel het als een kostenefficiëntie-ranking op de eigen voorwaarden van de arena, niet als een herprijzing door Alibaba.

Open weights, Qwen3.8-27B, en de on-premise vraag
Alibaba's open-weight-belofte is nu nagekomen. Op 12 augustus 2026 publiceerde Qwen twee repositories op Hugging Face — Qwen3.8-2.4T-A95B in BF16 en Qwen3.8-2.4T-A95B-FP8 — elk met 213 gewichtsbestanden. De licentie is een aangepaste Qwen3.8-Max-licentie, niet Apache 2.0; het licentieveld op Hugging Face vermeldt 'other'. De voorwaarden staan gebruik, wijziging, distributie en fine-tuning toe, inclusief commercieel gebruik, met naamsvermelding, plus twee op schaal gebaseerde drempels: producten met meer dan 100 miljoen maandelijkse actieve gebruikers of meer dan $20 miljoen maandelijkse omzet moeten de modelnaam prominent tonen, en Model-as-a-Service- of AI-Work-Assistant-bedrijven met een gecombineerde omzet van meer dan $50 miljoen over de afgelopen twaalf maanden hebben een aparte licentie van Qwen nodig. De meeste teams vallen binnen die drempels; als je bedrijf er overheen gaat, lees dan de licentietekst voordat je erop voortbouwt. De downloadtellers bevestigen de recentheid — op het moment van schrijven 978 op de BF16-repo en 3.851 op de FP8-repo, laag voor een baanbrekende release en consistent met een repository die op 8 augustus is aangemaakt en pas op 12 augustus openbaar is gemaakt, niet een die al een week zichtbaar was. Nog een eerlijkheidsnoot: de open checkpoint is het basismodel, alleen tekst met denken altijd aan, terwijl de gehoste Qwen3.8-Max-API visuele invoer, een optionele niet-denkende modus en de volledige 1M-context toevoegt — het downloaden van de gewichten levert je het model op, niet elke API-functie.
Het self-host draaien van het vlaggenschip is voor de meeste teams nog altijd onhaalbaar, maar nu is het onhaalbaar met bekende cijfers. De volledige gewichtenset van 2,4 biljoen parameters weegt ruwweg 4,9 TB in BF16 en ongeveer 2,4 TB in FP8, omdat elke expert in het geheugen aanwezig moet zijn, ook al worden er per token slechts 95 miljard geactiveerd. Bij 4-bits kwantisering ligt dat in de orde van 1,2 TB, tegenover ruwweg 141 GB per H200, dus je hebt acht of meer high-end accelerators nodig voordat je ook maar één token serveert. Wat de nu openbaar gemaakte actieve telling toevoegt, is de doorvoerkant: met 95 miljard geactiveerde parameters per token is de rekenkracht per token vergelijkbaar met een dicht model in de ~90 miljard-klasse — een fractie van de kosten die een dicht model van 2,4 biljoen parameters zou opleggen — dus zodra de gewichten eenmaal in het geheugen staan, zijn de kosten per token niet de nachtmerrie die het totale aantal parameters doet vermoeden. Die combinatie van een groot geheugenbeslag en bescheiden rekenwerk per token is precies de reden waarom Alibaba output kan prijzen op $6/1M, en het stuurt self-hostingteams richting multi-GPU-nodes met FP8-checkpoints, in plaats van iets op één GPU.
De servingkeuze van DigitalOcean is een werkend voorbeeld van die rekensom in de praktijk. Het draait het model NVFP4-gekwantiseerd op NVIDIA HGX B300-GPU's, specifiek zodat de 2,4T-gewichten op één node passen en cross-node-expertroutering wordt vermeden — een live-implementatie van de 4-bit-economie die in deze sectie op papier is doorgerekend. De afweging is exact dezelfde als die de GPQA-steekproef hierboven kwantificeert: een kleinere voetafdruk, tegen een meetbaar kwaliteitsverlies ten opzichte van het niet-gekwantiseerde vlaggenschip.
Dat maakt Qwen3.8-27B voor de meeste lezers de belangrijkere release — en in tegenstelling tot het vlaggenschip verschenen de gewichten op schema. Op 14 augustus 2026 publiceerde Qwen Qwen/Qwen3.8-27B op Hugging Face en ModelScope onder Apache 2.0: een dicht 27B-model, natively multimodaal, met een native context van 262K tokens die uitbreidbaar is tot 1M en een configureerbare reasoning_effort-modus. Daniel Han van Unsloth had geschat dat het zou draaien in ongeveer 17GB VRAM — één prosumer-kaart — en dat is nu testbaar: de officiële repo levert BF16-safetensors (ongeveer 55,6GB verspreid over 18 shards), met GGUF-quants die volgen in community-repo's. Daarmee is het releasepatroon van deze generatie nu compleet: de gewichten van het 2,4T-vlaggenschip kwamen eerst op 12 augustus, en het kleine on-premise-model verscheen twee dagen later. We volgden de release in ons bericht over de releasedatum van Qwen3.8-27B.
Waar Qwen3.8-Max past: vier scenario's
1. Analyse van lange documenten en contracten. Dit is de beste match. Het vaste tarief voor 1M tokens plus OmniDocBench 92.1 betekent dat je een document van 400 pagina's in één aanroep kunt verwerken zonder toeslag en zonder opdelen in stukken. Concurrenten die een toeslag rekenen voor lange context maken dezelfde klus aanzienlijk duurder. Wat het DigitalOcean-traject betreft: onthoud dat dat traject de open base bij 262K context bedient — nog steeds een groot document, maar niet het volledige miljoen.
2. Codeeragenten op repo-schaal.Terminal-Bench 86.6 en FrontierSWE 73.5 ondersteunen dit, en de cache-prijsstelling maakt iteratief werken aan een stabiele codebase goedkoop. Wat je eerst moet testen is de latentie onder je eigen concurrency, omdat reviewers uit het previewtijdperk het model grondig maar traag vonden bij lange agentische runs, en GA-serving is een ander beest dan preview-serving. AA's GDPval-AA-resultaat — een toonaangevende 1.739 Elo ten koste van 64 stappen per taak — is de onafhankelijke bevestiging van beide kanten van die afweging. DigitalOcean's metingen van 12 augustus — een geaggregeerde doorvoer die bijna lineair opschaalt naar ~1.937 outputtokens per seconde bij 256 gelijktijdige verzoeken, met nul fouten en geen gevonden verzadiging — zijn het eerste datapunt van een beheerd platform over die vraag, hoewel het DigitalOcean's eigen cijfers zijn over de eigen serving, geen head-to-head-vergelijking met die van Alibaba.
3. Pijplijnen voor documenten en screenshots.Video- en beeldinvoer plus OSWorld-Verified 86.1 maken het geloofwaardig voor workflows die schermen lezen — QA-automatisering, support-triage op basis van screenshots, RPA-gerelateerde taken. Nogmaals, de multimodale invoer is een functie van de gehoste API; het open-base pad van DigitalOcean ondersteunt alleen tekst.
4. Waar we het nog niet zouden plaatsen. Latentie-kritische interactieve UX en elke gereguleerde workload die reproduceerbare evaluatie vereist. Voor het eerste wil je gemeten doorvoer die je onder controle hebt. Voor het tweede heeft reproduceerbaarheid nu een modelkaart en een licentie om te citeren, maar de benchmarktabel van Alibaba is nog steeds niet gerepliceerd — en AA's Omniscience-regressie (hallucinatiepercentage tot 40%) herinnert ons eraan dat de onafhankelijke score een tweesnijdend zwaard is.

Hoe krijg je toegang tot Qwen3.8-Max
Er zijn verschillende praktische routes. Direct via Alibaba Model Studio / DashScope — of Qwen's eigen QwenCloud API — krijg je de bovenstaande prijslijst en de vroegste toegang tot nieuwe gedateerde snapshots — de Qwen3.8-Max-0902-build van 2 september verscheen daar eerst voordat hij naar andere endpoints werd uitgerold — ten koste van het onboarden van een nieuwe leverancier en het beheren van een extra sleutel. Qwen Chat en de Qwen App zijn de snelste manier om het gedrag te bekijken voordat je code schrijft. Het downloaden van de open gewichten van Hugging Face is een vierde pad voor teams die hun eigen infrastructuur willen draaien — met de bovengenoemde kanttekeningen over grootte en licentie. Via een router is de optie die de meeste productieteams zouden moeten overwegen, omdat het de migratiebeslissing loskoppelt van de evaluatiebeslissing.
Sinds 14 augustus 2026 is er een werkelijk nieuwe optie: Qwen3.8-Max is live op DigitalOcean Serverless Inference, die Alibaba aankondigde als zijn 'Day 0 launch partner' — Alibaba's eigen framing, hoewel de vermelding van DigitalOcean is en op zichzelf staat. DigitalOcean serveert de open-weights-checkpoint (platformmodel-ID qwen3.8-max), NVFP4-gekwantiseerd op NVIDIA HGX B300-GPU's in een technische samenwerking met Inferact, als een volledig beheerde serverless API: één endpoint, prijzen op basis van gebruik, geen infrastructuur om te beheren. De prijslijst komt overeen met die van Alibaba — $2.00 input / $6.00 output per 1M, met gecachte input op $0.20 — en het serveert de native 262K context van de open basis, met denken altijd aan, in plaats van de ~1M-token multimodale modus van de gehoste flagship. Dat contextmaximum is van belang als je workload aan de lange kant zit: de volledige miljoen-token-modus blijft alleen beschikbaar via de Alibaba-API.
Wat het DigitalOcean-pad naast geografie toevoegt, zijn de eerste harde serving-data van een andere provider dan Alibaba. DigitalOcean's eigen metingen aan het productie-endpoint, uitgevoerd op 12 augustus, tonen dat prefill lineair schaalt met ongeveer 16.000 tokens/sec — vuistregel TTFT ≈ (input ÷ 16.000) + 0,7s, dus ~1,1s bij ~1.080 tokens en ~15,8s bij ~254K — en een geaggregeerde doorvoer van ~1.937 output tokens/sec bij 256 gelijktijdige verzoeken met nul fouten en geen verzadigingspunt gevonden. Dat zijn DigitalOcean's cijfers voor de eigen implementatie, geen gecontroleerde bake-off, maar het zijn de eerste latentie- en concurrencygegevens voor dit model buiten Alibaba's cloud, en ze gaan direct in op de zorg over 'grondig maar langzaam' uit het preview-tijdperk.
Qwen3.8-Max is live op OrcaRouter als qwen/qwen3.8-max, en de vernieuwing van 2 september is routeerbaar onder zijn eigen datum-id — qwen/qwen3.8-max-0902 — beide tegen hetzelfde lijstarief van $2,00 / $6,00. OrcaRouter hanteert 0% opslag en geeft de providerprijzen direct door, dus beide routes kosten evenveel als een rechtstreekse verbinding. Onze eigen serving-telemetrie toont momenteel een p50-tijd-tot-eerste-token van 1,64 seconden over een periode van 7 dagen. Dat is een eigen latentiemeting in plaats van een leveranciersclaim, en het is de moeite waard om die af te wegen tegen de preview-tijdperk-rapporten over het 'traagste model dat ik heb gebruikt': die kwamen van één enkele recensent die urenlang agentische builds op preview-infrastructuur draaide, en ze zouden opnieuw getest moeten worden tegen GA-serving in plaats van herhaald als huidig feit.
De praktische waarde van het routerpad is dat Qwen3.8-Max achter hetzelfde OpenAI-compatibele endpoint zit als de modellen die je al draait, dus een evaluatie is een wijziging van de modelstring. Je kunt 5% van het productieverkeer ernaartoe sturen, vergelijken met je huidige model op identieke prompts, en een fallback aanhouden — precies de houding die een model met een niet-gerepliceerde leverancierstabel verdient. Diezelfde houding is de juiste manier om de DigitalOcean-implementatie te testen: draai er een deel van het verkeer op met een fallback, in plaats van een productiepad te verwedden op een twee weken oude serving-stack.

Beperkingen en eerlijke risico's
• Leverancierstabel nog niet gecontroleerd. De onafhankelijke score is binnen (AA Index 56), maar de eigen benchmarktabel van Alibaba blijft niet gerepliceerd, en de meting van AA signaleert een Omniscience-regressie met een hallucinatiepercentage tot 40%. Onafhankelijke scoring helpt; het maakt de leverancierstabel niet controleerbaar.
• Het DigitalOcean-pad is de open basis, niet het vlaggenschip. Het bedient het checkpoint op 262K context, alleen tekst, denken altijd ingeschakeld, NVFP4-gekwantiseerd — en DigitalOcean's eigen steekproefscores die 88 halen op GPQA Diamond versus Alibaba's gepubliceerde 92,6, een kloof die DigitalOcean indicatief noemt in plaats van gecontroleerd. Als je de volledige multimodale API met een miljoen tokens nodig hebt, wordt die nog steeds gehost door Alibaba.
• Qwen3.8-27B is uitgebracht, maar de nummering is door de leverancier toegekend. De gewichten van de 27B kwamen op 14 augustus beschikbaar onder Apache 2.0, waarmee de on-premise-kloof werd gedicht — maar de benchmarkclaims zijn alleen door Alibaba gerapporteerd en niet gerepliceerd, en de community-kwantisaties werden op het moment van deze update nog uitgerold.
• Aangepaste licentie, niet Apache 2.0. De Qwen3.8-Max-licentie staat commercieel gebruik toe met naamsvermelding, maar kent twee schaaldrempels — prominente weergave van de modelnaam boven 100M MAU of $20M maandelijkse omzet, en een aparte licentie voor MaaS/AI-Work-Assistant-bedrijven met meer dan $50M omzet over de afgelopen twaalf maanden. Lees dit voordat je voorbij de drempels schaalt.
• Breedsprakigheid en instructiedrift. IFBench 82.8 is het zwakste resultaat in Alibaba's eigen tabel, en previewtesters zagen herhaaldelijk dat het model de scope overschreed — door ongevraagde functies toe te voegen. AA's eigen cijfers kwantificeren het nu: 64 stappen per GDPval-AA-taak is wat de kosten opdrijft tot $1,14, 25% boven Kimi K3. Charmant in een demo, duur wanneer output wordt gefactureerd tegen $6/1M en destabiliserend wanneer je exacte formaten nodig hebt.
• Inhoudsbeperkingen. Net als andere in China gehoste frontiermodellen zijn antwoorden op politiek gevoelige onderwerpen beperkt. Relevant als uw product open vragen verwerkt.
• Denktokens worden als output gefactureerd. Met redeneren ingeschakeld liggen de werkelijke kosten boven naïeve schattingen. Meet met redeneren geconfigureerd zoals je het daadwerkelijk zult uitbrengen.

Veelgestelde vragen
Is Qwen3.8-Max nu beschikbaar?
Ja. Het is algemeen beschikbaar geworden op 3 augustus 2026, met een gepubliceerde prijslijst en een API die compatibel is met zowel OpenAI als DashScope. De huidige productieversie — Qwen3.8-Max-0902, uitgebracht op 2 september — is live op de API van QwenCloud en is wat het standaard qwen3.8-max-eindpunt nu bedient. Dit is een wijziging ten opzichte van de previewstatus van 19 juli, toen de toegang beperkt was tot Qwen Chat, de Qwen App en de credits-campagne van Qoder.
Wat is Qwen3.8-Max-0902?
Qwen3.8-Max-0902 is de productie-update van Qwen3.8-Max van 2 september 2026: dezelfde 2.4T-parameter sparse-MoE-vlaggenschip en 1M-tokencontext, verder nageposttraind op Coding en Cowork, en live op de API van QwenCloud tegen dezelfde $2/$6. Qwen zegt dat de nieuwe snapshot sterker is op complexe enterprise- en wetenschappelijke taken — een leveranciersclaim, nog niet onafhankelijk gebenchmarkt — terwijl het op de coderingsas al een onafhankelijk resultaat heeft: #1 op het Code Arena: WebDev-klassement met 1.691 punten en de top van zijn kosten-prestatie-Pareto-frontier bij een gemengde ~$5/MToken, volgens Alibaba's aankondiging van de live-arena-lijst, bevestigd door Qwen's eigen QwenCloud-account.
Hoeveel kost Qwen3.8-Max?
$2,00 per 1M invoertokens en $6,00 per 1M uitvoertokens, gelijk voor de volledige 1M-tokencontext zonder toeslag voor lange prompts. Gecachte invoerhits kosten $0,25 per 1M, expliciete cachecreatie $2,50 en cache-uitlezingen $0,17. Denktokens worden in rekening gebracht tegen het uitvoertarief. Op de Intelligence Index van Artificial Analysis zijn de gemeten kosten van het model $1,14 per taak — zie de prijssectie voor waarom dat hoger uitvalt dan de tokenberekening. Het serverloze pad van DigitalOcean vermeldt dezelfde $2/$6 met gecachte invoer op $0,20.
Hoeveel parameters heeft Qwen3.8-Max?
2,4 biljoen in totaal, in een sparse Mixture-of-Experts-configuratie. Het aantal actieve parameters — het getal dat daadwerkelijk de servingkosten en latentie bepaalt — is nu bevestigd op 95 miljard actieve parameters, volgens de officiële modelkaart voor Qwen3.8-2.4T-A95B (512 experts; 10 gerouteerde plus één gedeelde actieve per token).
Zijn de Qwen3.8-Max-gewichten open?
Ja — sinds 12 augustus 2026. Qwen heeft Qwen3.8-2.4T-A95B (BF16) en Qwen3.8-2.4T-A95B-FP8 op Hugging Face gepubliceerd, elk met 213 gewichtsbestanden. De licentie is een aangepaste Qwen3.8-Max-licentie (Hugging Face vermeldt deze als 'other'), niet Apache 2.0: deze staat commercieel gebruik met naamsvermelding toe en kent twee schaalgebaseerde drempels. De open checkpoint is tekst-only met de denkmodus altijd ingeschakeld; de gehoste API voegt beeldherkenning, een optionele modus zonder denken en de volledige 1M-context toe.
Is Qwen3.8-Max onafhankelijk gebenchmarkt?
Ja — vanaf 6 augustus 2026. Artificial Analysis geeft het een score van 56 op zijn Intelligence Index tegen $1,14 per taak, gemeten op de officiële API van Alibaba: een sprong van 10 punten ten opzichte van Qwen3.7-Max (46), op gelijke hoogte met Claude Opus 4.8 (56), en één punt achter Kimi K3 (57). De bovenstaande benchmarktabel blijft echter door Alibaba gerapporteerd en niet gerepliceerd, en het algemene leaderboard van LMArena heeft nog steeds geen publieke score. Het beeld van de onafhankelijke arena veranderde op 2 september: de 0902-refresh debuteerde met 1.691 punten op #1 van het Code Arena: WebDev-board van hetzelfde platform — een resultaat van derden via blinde stemming, geen tabel van Alibaba — en de kosten-prestatiefrontier van Code Arena vermeldt het als de hoogst scorende waarde van het bord tegen een gewogen prijs van ~$5/MToken. De steekproef die DigitalOcean uitvoerde op de gekwantiseerde build (88 op GPQA Diamond) is de eerste controle door een derde partij op een serving-deployment en is uitdrukkelijk indicatief in plaats van gecontroleerd. Eén kanttekening bij de kolom 'onafhankelijk': CommerceAgentBench, waar Qwen3.8-Max bovenaan staat bij open-weight-modellen, is geen tweede onafhankelijke scheidsrechter — Accio, die het heeft gebouwd en gepubliceerd, is het eigen team van Alibaba.
Is Qwen3.8-Max beter dan Qwen3.7-Max?
Op Alibaba's eigen cijfers is het aanzienlijk — FrontierSWE 73,5 tegenover 40,7 en DeepSWE 1.1 56,6 tegenover 21,6 zijn bijna verdubbelingen bij moeilijke software-engineeringtaken. Het is ook goedkoper dan de $2,50/$7,50 van zijn voorganger. Onafhankelijk daarvan plaatst AA de generatiesprong op 10 punten op zijn Intelligence Index (56 tegenover 46). Beide leveranciersclaims moeten nog worden geverifieerd op uw werklast.
Kan ik Qwen3.8-Max zelf hosten?
Niet praktisch. De volledige set van 2,4 biljoen gewichten is ongeveer 4,9 TB in BF16 en circa 2,4 TB in FP8, rond 1,2 TB bij 4-bit — tegenover ongeveer 141 GB per H200, dat zijn acht of meer top-GPU's. Met 95 miljard actieve parameters per token is de rekenkracht per token relatief bescheiden, maar de geheugenvoetafdruk is de beperkende factor. DigitalOcean's NVFP4-serving op B300's bewijst in de praktijk dat 4-bit het model op één node past. De Qwen3.8-27B — naar verluidt ~17 GB VRAM — is de realistische optie voor on-premise gebruik, en de gewichten zijn op 14 augustus 2026 onder Apache 2.0 verschenen — nu downloadbaar in plaats van een belofte.
Wat is Qwen3.8-27B?
Een veel kleiner model dat naast het vlaggenschip is aangekondigd, gepositioneerd als de praktische route voor on-premise-implementatie. Het is een dense 27B-model, native multimodaal, met een native context van 262K tokens die uitbreidbaar is tot 1M, en het wordt uitgebracht onder Apache 2.0. De gewichten verschenen op 14 augustus 2026 op Hugging Face en ModelScope; Daniel Han van Unsloth meldt dat het draait in ruwweg 17GB VRAM — een enkele high-end consumenten-GPU. De benchmarkclaims zijn afkomstig van Alibaba en zijn niet onafhankelijk gereproduceerd.
Is Qwen3.8-Max multimodaal?
Ja — het accepteert tekst-, beeld- en video-invoer en retourneert tekst. Het ondersteunt ook denkmodus, functieaanroepen, ingebouwde tools en gestructureerde uitvoer. Het checkpoint met open gewichten is alleen-tekst; multimodale invoer is een functie van de gehoste API, en dat is wat het DigitalOcean-pad niet bevat.
Is Qwen3.8-Max beschikbaar op DigitalOcean?
Ja — sinds 14 augustus 2026. DigitalOcean Serverless Inference serveert de open-weights checkpoint (NVFP4 op NVIDIA HGX B300) voor $2,00/$6,00 per 1M met $0,20 gecachte invoer, een context van 262K tokens, alleen tekst, denken altijd ingeschakeld. Alibaba noemt DigitalOcean zijn 'Day 0-lanceringspartner'; de vermelding zelf is van DigitalOcean en onafhankelijk van die taal. DigitalOcean's gemeten cijfers: prefill ~16K tokens/sec en ~1.937 output tokens/sec bij 256 gelijktijdige verzoeken met nul fouten.
Kan ik Qwen3.8-Max gebruiken via OrcaRouter?
Ja. Het is live als qwen/qwen3.8-max, en de snapshot van 2 september als een eigen gedateerde id — qwen/qwen3.8-max-0902 — tegen dezelfde lijstprijs van $2.00/$6.00, met 0% opslag. Routing kost hetzelfde als direct gaan, achter het OpenAI-compatibele eindpunt dat u al gebruikt. Onze 7-daagse telemetrie toont een p50 time-to-first-token van 1,64 seconden.
Moet ik het productieverkeer vandaag ernaartoe verplaatsen?
Niet volledig. De prijzen en de eerste onafhankelijke score maken een serieuze evaluatie goedkoop en de moeite waard om nu te doen, maar met een kosten per taak die 25% hoger liggen dan die van Kimi K3, is de gedisciplineerde zet een verkeerssplitsing tegen je huidige aanbieder op identieke prompts, met een fallback voorzien — geen migratie. Het DigitalOcean-pad voegt een tweede beheerde implementatie toe om tegen te testen, wat de evaluatie nog goedkoper maakt.
Kortom
Qwen3.8-Max was twee weken lang het interessantste model dat niemand kon kopen. Bij GA is het een wezenlijk andere propositie: een vast tarief van $2/$6 over een miljoen tokens is agressieve prijsstelling, de cachetarieven maken iteratief agentwerk goedkoop, en de generatiesprong op FrontierSWE en DeepSWE — als die zich herhaalt — maakt dit een echt codeermodel in plaats van een schaalvertoon. De open gewichten die op 12 augustus onder een echte licentie verschenen, veranderden 'open weights coming' van een belofte in een feit, en het op 14 augustus aangekondigde DigitalOcean-traject vanaf dag één — met gemeten servingcijfers en een cacheread van $0,20 — versterkt de 'try it cheaply'-case en geeft teams een beheerde third-party-implementatie om te vergelijken met Alibaba's eigen API. De Qwen3.8-Max-0902-refresh van 2 september houdt die these intact: dezelfde $2/$6 en 1M-context, met meer post-training op het codeer- en samenwerkingswerk waarvoor het model al was gepositioneerd. De refresh voegde ook een onafhankelijk, op menselijke voorkeur gebaseerd scorebord toe voor die codeer-pitch: Qwen3.8-Max-0902 debuteerde op #1 van Code Arena's WebDev-leaderboard met 1.691 punten, vóór Claude Opus 5 en Kimi K3, en met een blended tarief van ~$5/MToken is het het hoogst scorende model op de kosten-prestatie-Pareto-frontier van dat leaderboard. Het CommerceAgentBench-resultaat dat Alibaba's Accio-team dezelfde week publiceerde — met Qwen3.8-Max aan kop van het open-gewichtenveld op een benchmark die is opgebouwd uit echte commerce-workflows — geeft die samenwerkingsthese een concreet eigen scorebord, zij het een door de leverancier gerund exemplaar.
Wat er is veranderd, is dat zowel de scheidsrechter als de gewichten zijn geland — en het oordeel is overwegend goed, met echte sterretjes. AA plaatst Qwen3.8-Max met 56 op de Intelligence Index, een echte generatiesprong die op gelijke hoogte uitkomt met Claude Opus 4.8, al toont dezelfde scorekaart Kimi K3 een punt voor bij 25% lagere kosten per taak en meldt een daling van 10 punten op Omniscience bij een stijgend hallucinatiepercentage. De kwestie van de actieve parameters is beslecht — 95B geactiveerd, bevestigd op de modelkaart — en de licentie is gepubliceerd, op maat gemaakt in plaats van Apache 2.0. Wat niet is veranderd: Alibaba's eigen benchmarktabel is nog steeds niet gerepliceerd, de kosten per taak zijn nog steeds hoog omdat het model zich door zoveel stappen heen werkt, het open basismodel dat op DigitalOcean wordt aangeboden is een iets ander model dan de kopcijfers van het vlaggenschip doen vermoeden (262K context, NVFP4, GPQA-steekproef 88 tegenover 92,6), en de benchmarkclaims van de Qwen3.8-27B zijn door de leverancier gerapporteerd, ook al zijn de gewichten uitgebracht. Die combinatie maakt van Qwen3.8-Max geen slechte gok — tegen deze prijs grenst het aan een verplicht experiment — maar het betekent wel dat de juiste houding is: agressief evalueren, doordacht routeren, een vangnet houden. De ontwikkeling om nu in de gaten te houden is of het aantal agentische stappen achter die kosten van $1,14 per taak iets is dat jouw werklast kan absorberen, of de voorsprong van de 0902-build in Code Arena: WebDev standhoudt naarmate er meer stemmen binnenkomen, of de winsten op Coding en Cowork zich herhalen op echte workloads, of de open-gewichten-voorsprong op CommerceAgentBench — twee geaggregeerde runs op Alibaba's eigen testomgeving — een onafhankelijke run overleeft, of de benchmarkclaims van de 27B standhouden, en of de gemeten doorvoer van de DigitalOcean-implementatie standhoudt onder echt verkeer — dat zal bepalen of 'slechts tweede na Fable 5' positionering of profetie was.

Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
