
Maak kennis met Qwen3.8-Flash: een open-weight multimodale MoE die een voorproefje geeft van de Qwen4-architectuur — $0,15/$0,47 per 1M tokens op QwenCloud
- AlibabaNIEUWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiNIEUWZ.ai: GLM 5.3 Flash2026-08-2658Intelligentie72Coderen
- DeepSeekNIEUWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 mln tokens
- z-aiNIEUWZ.ai: GLM 5.32026-08-1860Intelligentie75Coderen
- obsidianNIEUWQwen3.8 27B2026-08-1552Intelligentie68Coderen
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1261Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1653Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1560Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligentie71Coderen
Op 26 augustus 2026 bracht het Qwen-team de gewichten achter Qwen3.8-Flash uit als open source — gepubliceerd op Hugging Face en ModelScope onder de naam Qwen3.8-Flash-Next — en lanceerde het productiemodel dat de naam Qwen3.8-Flash draagt op de QwenCloud-API, waarmee de officiële prijzen de volgende dag werden bevestigd. Het spraakmakende cijfer — officieel bevestigd in Alibaba's eigen aankondiging op 28 augustus — is een multimodale mixture-of-experts met 125 miljard parameters die slechts ongeveer 6 miljard parameters per token activeert, een sparsiteit van ruwweg 95%, gebouwd op een architectuur die Alibaba expliciet omschrijft als een vroege preview van de Qwen4-generatie. De productie-API is live op QwenCloud tegen $0,15 per miljoen invoertokens, $0,47 per miljoen uitvoertokens en $0,016 per miljoen bij cache-hits — de goedkoopste manier om iets te draaien dat structureel afstamt van Alibaba's volgende vlaggenschip, en de eerste keer dat het lab een architectuurpreview als openbare open gewichten heeft uitgebracht voordat de volledige modelfamilie bestaat.
Eén getal weegt zwaarder dan de rest van het specificatieblad: 6B. Qwen3.8-Flash ontleent zijn kunnen niet aan brute omvang — maar aan waar het de rekenkracht inzet. Een 125B MoE-lichaam, een 51B N-gram-embeddingtabel en een kleine multi-token-voorspellingsmodule slaan bijna 180B parameters op schijf op, maar elk token wordt door slechts 6B daarvan geleid. Dat is de weddenschap waar deze hele release op rust, en het is de reden dat de trainingskosten zo ver zijn gedaald.
Wat er daadwerkelijk is uitgebracht
Qwen3.8-Flash, zonder het achtervoegsel, is het model dat nu in productie is genomen en live staat op de QwenCloud API en in Alibaba's Qwen Office-product; het wordt geleverd met een standaardcontext van 1M tokens en ingebouwde tools, voor $0,15/$0,47 per miljoen tokens, met cache-hits voor $0,016. Op 28 augustus werd de beschikbaarheidslijst verbreed: volgens de aankondiging van Alibaba is Qwen3.8-Flash nu ook bereikbaar via OpenCode Go, het flat-rate-abonnement van de open-source terminal coding agent — OpenCode's eigen modellenlijst vermeldt het als qwen3.8-flash tegen dezelfde tarieven van $0,15/$0,47 per miljoen.

De officiële aankondiging van Qwen Studio plaatst de open-weights-release als een uitnodiging aan het ecosysteem: breng de structurele wijzigingen vroeg uit, zodat de community en de inference-stacks zich kunnen aanpassen voordat de volledige Qwen4-line-up wordt gebouwd. Het eerste teken dat dit werkte is SGLang — de door LMSYS gesteunde inference-engine — die op dag 0 ondersteuning voor Qwen3.8-Flash-Next publiceerde op dezelfde dag, met het model ook geconfigureerd voor Transformers, vLLM en TokenSpeed.
De architectuur is het verhaal
Dit is geen verkleinde versie van een Qwen 3.8-generatiemodel. Qwen3.8-Flash introduceert vier wijzigingen waarvan het team zegt dat de Qwen4-familie ze zal overnemen, en elk daarvan richt zich op een andere bottleneck.
• Aandacht — Gated DeltaNet plus Qwen Sparse Attention. Gated DeltaNet (GDN) comprimeert geschiedenis in toestanden van vaste grootte in drie van elke vier lagen, zodat het model niet bij elke stap alles opnieuw leest; QSA behandelt lange context vervolgens als een zoekprobleem — een lichtgewicht indexeerder aggregeert de reeks in microblokken, scoort het belang op blokniveau en routeert aandacht naar de meest relevante regio's. Volgens metingen van Alibaba bereikt de QSA-aandachtskernel tot 7,6× snellere prefill en 4,9× snellere decode bij een context van 1M tokens (door leverancier gerapporteerd).
• Residual — Gegate residual. De enkele residualstroom splitst zich op in vier parallelle takken met elementsgewijze gating, waardoor het netwerk per token kan bepalen hoeveel het op elke tak leest en schrijft; één tak vormt een langeafstandskanaal dat vroege aandachtslagen verbindt met diepe lagen. Residualtoestanden worden opgeslagen in FP8 om geheugenbandbreedte te verminderen.
• Embedding — N-gram embeddings. Een opzoektabel met 51 miljard parameters, geïndexeerd op het huidige token en enkele voorgaande tokens. Dit voegt capaciteit toe zonder extra rekenkracht per token, en omdat de tabel in het hostgeheugen kan worden opgeslagen en asynchroon kan worden voorafgeladen, neemt het geen permanent GPU-geheugen in beslag.
• Optimizer — Muon. Grote 2D-lineaire parameters (attention, GDN, MoE-experts) trainen met Muon, terwijl embeddings, de router en de laag-rankonderdelen van Gated Residual AdamW blijven gebruiken; het team heeft de schalingswet opnieuw afgestemd op de nieuwe architectuur rond de mix.

Voor een ontwikkelaar zijn er twee dingen die er direct toe doen: de attention-stack is de reden waarom een context van 1M tokens de norm kan zijn in plaats van een reikdoel, en de N-gram-tabel is de reden waarom een 125B-model toch licht verteerbaar kan blijven. De rest is voorproefmateriaal voor Qwen4 — en dat is precies hoe Alibaba het positioneert.
Het benchmarkblad, eerlijk geëtiketteerd
Elk getal in deze sectie is Alibaba's eigen evaluatie, één dag oud en op het moment van schrijven niet gereproduceerd door een onafhankelijk laboratorium. Beschouw ze als richtinggevende beweringen, niet als definitieve scores. Op Alibaba's suite scoort Qwen3.8-Flash-Next (6B actief) SWE-bench Pro 62.5, DeepSWE 1.1 58.7, CoWorkBench 73.9, AndroidWorld 84.5 en MathVision 95.7, met een JobBench-score van 55.7 — en de basisvariant, Qwen3.8-Flash-Next-Base, wordt gerapporteerd als het beste open model op 8 van de 14 benchmarks in een rechtstreekse vergelijking, waaronder MMLU-Pro, SuperGPQA, BBH en MMMU.
De claims van Alibaba over de positionering in de familie moeten worden bestempeld als wat ze zijn: claims. Het bedrijf zegt dat Qwen3.8-Flash Claude Opus 4.6 verslaat met 9,1 punten op SWE-bench Pro en ruwweg 20 punten op JobBench, en binnen handbereik komt van Claude Opus 4.8. Alles door de leverancier gerapporteerd, alles niet gereproduceerd. Wat vandaag onafhankelijk controleerbaar is, is beperkter: de gewichten zijn uitgebracht, de inferencestack draait ze al, en SGLang leverde dezelfde dag ondersteuning. De onafhankelijke reproductie van het benchmarkblad is dagen verwijderd, niet weken.
Wat het kost
De prijsstelling is het gemakkelijkst te verifiëren, omdat het een gepubliceerde prijs betreft in plaats van een benchmark — en op 27 augustus bevestigde Alibaba officieel het productietarief van QwenCloud: $0,15 per miljoen inputtokens, $0,47 per miljoen outputtokens, en $0,016 per miljoen bij cachetreffers, met het binnenlandse China-tarief op ¥0,8/¥2,7/¥0,1. Het cachetreffer-cijfer is het getal dat ertoe doet voor agentische workloads: een long-context-agent die bij elke beurt een grote geschiedenis opnieuw leest, betaalt vrijwel niets bij herhaalde leesbeurten, en dat is precies de workload waar de Qwen4-preview-attention-stack op is gericht. Chinese persberichtgeving vergeleek de kopersprijs onmiddellijk met concurrenten — ruwweg een derde van wat DeepSeek-V4-Flash rekent, en een afrondingsfout vergeleken met frontier-gesloten modellen. Volgens Alibaba's eigen boekhouding kostte de trainingsrun ongeveer een negende van Qwen3.7-Plus, en die structurele hefboomwerking is wat de API-prijs op het huidige niveau laat staan.
Naast de rest van de Qwen 3.8-familie is de kloof groot: het vlaggenschip Qwen3.8-Max rekent $2.00 en $6.00 per miljoen tokens, en is al live op OrcaRouter tegen de prijs van de aanbieder zonder opslag. Nu de productie-API van Qwen3.8-Flash open is, geldt dezelfde doorberekening voor het officiële tarief van $0.15/$0.47 en het cache-hit-tarief van $0.016 — een routeringslaag is het verschil tussen lezen over een prijsverlaging en het hebben ervan in een configuratie. Beide modellen achter één sleutel, failover ertussen, geen tweede contract.
Wat "preview van Qwen4" betekent
Lees de aankondiging letterlijk en de inzet is duidelijk: dit is geen nieuwe laag van Qwen 3.8 — het is de architectuur van Qwen4 die vroeg wordt uitgebracht, onder het beschermende merk van een kleiner, goedkoper model. De redenen om dat te doen zijn degelijk: frameworks, kwantisering en implementatiepatronen hebben tijd nodig om te rijpen, en een model met 6B actieve parameters is een goedkope manier voor de community om GDN + QSA op schaal te stresstesten voordat Alibaba het dure product er bovenop bouwt. De keerzijde is dat de productie-Qwen3.8-Flash een API is die is gebouwd op een architectuur die het bredere ecosysteem nog steeds aan het auditen is. Early adopters zijn, per definitie, de testset.
De snelle weg om het te proberen
Vandaag heb je vier realistische opties. Host de open gewichten zelf via vLLM, SGLang, Transformers of TokenSpeed — de FP8-build is de logische eerste stap op alles wat minder is dan een volledige node. Roep de QwenCloud API aan, nu live tegen het officiële tarief van $0,15/$0,47 met cache-hits tegen $0,016. Gebruik het binnen OpenCode Go, het flat-rate abonnement van de open-source terminal coding agent, dat deze week Qwen3.8-Flash heeft toegevoegd (aangekondigd door Alibaba op 28 augustus, bevestigd op OpenCode's eigen modellenlijst). Of roep de productie-Flash aan via een router op dezelfde manier als je Qwen3.8-Max al aanroept, met het officiële tarief dat zonder opslag wordt doorgegeven — geen maatwerkintegratie om te onderhouden.

De open vraag is de eerlijke: kan een model dat 6 miljard van zijn parameters activeert, standhouden in productie bij een breed scala aan workloads, of zal het benchmarkblad dat er vandaag als één dag oud uitziet, er over een maand nog zo uitzien? Dat is geen reden om te wachten — het is een reden om het achter failover te plaatsen in plaats van voor je hele stack. De gewichten zijn uit, de prijs is vastgesteld, en de architectuur is de verklaarde richting van Alibaba. De komende weken bepalen of 6B genoeg was.
Vergeleken in dit artikel2
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
