Maak kennis met Qwen3.8-Flash — een open-weight multimodale MoE die een voorproefje geeft van de Qwen4-architectuur. Geregenereerde illustratie.
Guides & Insights

Maak kennis met Qwen3.8-Flash: een open-weight multimodale MoE die een voorproefje geeft van de Qwen4-architectuur — $0,15/$0,47 per 1M tokens op QwenCloud

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Op 26 augustus 2026 bracht het Qw​en-team de gewichten achter Qwen3.8-Flash uit als open source — gepubliceerd op Hugging Face en ModelScope onder de naam Qwen3.8-Flash-Next — en lanceerde het productiemodel dat de naam Qwen3.8-Flash draagt op de QwenCloud-API, waarmee de officiële prijzen de volgende dag werden bevestigd. Het spraakmakende cijfer — officieel bevestigd in Alibaba's eigen aankondiging op 28 augustus — is een multimodale mixture-of-experts met 125 miljard parameters die slechts ongeveer 6 miljard parameters per token activeert, een sparsiteit van ruwweg 95%, gebouwd op een architectuur die Alibaba expliciet omschrijft als een vroege preview van de Qwen4-generatie. De productie-API is live op QwenCloud tegen $0,15 per miljoen invoertokens, $0,47 per miljoen uitvoertokens en $0,016 per miljoen bij cache-hits — de goedkoopste manier om iets te draaien dat structureel afstamt van Alibaba's volgende vlaggenschip, en de eerste keer dat het lab een architectuurpreview als openbare open gewichten heeft uitgebracht voordat de volledige modelfamilie bestaat.

Eén getal weegt zwaarder dan de rest van het specificatieblad: 6B. Qwen3.8-Flash ontleent zijn kunnen niet aan brute omvang — maar aan waar het de rekenkracht inzet. Een 125B MoE-lichaam, een 51B N-gram-embeddingtabel en een kleine multi-token-voorspellingsmodule slaan bijna 180B parameters op schijf op, maar elk token wordt door slechts 6B daarvan geleid. Dat is de weddenschap waar deze hele release op rust, en het is de reden dat de trainingskosten zo ver zijn gedaald.

Wat er daadwerkelijk is uitgebracht

Qwen3.8-Flash, zonder het achtervoegsel, is het model dat nu in productie is genomen en live staat op de QwenCloud API en in Alibaba's Qwen Office-product; het wordt geleverd met een standaardcontext van 1M tokens en ingebouwde tools, voor $0,15/$0,47 per miljoen tokens, met cache-hits voor $0,016. Op 28 augustus werd de beschikbaarheidslijst verbreed: volgens de aankondiging van Alibaba is Qwen3.8-Flash nu ook bereikbaar via OpenCode Go, het flat-rate-abonnement van de open-source terminal coding agent — OpenCode's eigen modellenlijst vermeldt het als qwen3.8-flash tegen dezelfde tarieven van $0,15/$0,47 per miljoen.

A screenshot of the official Qwen Studio blog post 'Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency' (captured August 27, 2026), showing the Qwen Studio navigation bar, the article headline, and the 'Now Open Weights' announcement banner.

De officiële aankondiging van Qw​en Studio plaatst de open-weights-release als een uitnodiging aan het ecosysteem: breng de structurele wijzigingen vroeg uit, zodat de community en de inference-stacks zich kunnen aanpassen voordat de volledige Qwen4-line-up wordt gebouwd. Het eerste teken dat dit werkte is SGLang — de door LMSYS gesteunde inference-engine — die op dag 0 ondersteuning voor Qwen3.8-Flash-Next publiceerde op dezelfde dag, met het model ook geconfigureerd voor Transformers, vLLM en TokenSpeed.

De architectuur is het verhaal

Dit is geen verkleinde versie van een Qw​en 3.8-generatiemodel. Qwen3.8-Flash introduceert vier wijzigingen waarvan het team zegt dat de Qwen4-familie ze zal overnemen, en elk daarvan richt zich op een andere bottleneck.

• Aandacht — Gated DeltaNet plus Qw​en Sparse Attention. Gated DeltaNet (GDN) comprimeert geschiedenis in toestanden van vaste grootte in drie van elke vier lagen, zodat het model niet bij elke stap alles opnieuw leest; QSA behandelt lange context vervolgens als een zoekprobleem — een lichtgewicht indexeerder aggregeert de reeks in microblokken, scoort het belang op blokniveau en routeert aandacht naar de meest relevante regio's. Volgens metingen van Alibaba bereikt de QSA-aandachtskernel tot 7,6× snellere prefill en 4,9× snellere decode bij een context van 1M tokens (door leverancier gerapporteerd).

• Residual — Gegate residual. De enkele residualstroom splitst zich op in vier parallelle takken met elementsgewijze gating, waardoor het netwerk per token kan bepalen hoeveel het op elke tak leest en schrijft; één tak vormt een langeafstandskanaal dat vroege aandachtslagen verbindt met diepe lagen. Residualtoestanden worden opgeslagen in FP8 om geheugenbandbreedte te verminderen.

• Embedding — N-gram embeddings. Een opzoektabel met 51 miljard parameters, geïndexeerd op het huidige token en enkele voorgaande tokens. Dit voegt capaciteit toe zonder extra rekenkracht per token, en omdat de tabel in het hostgeheugen kan worden opgeslagen en asynchroon kan worden voorafgeladen, neemt het geen permanent GPU-geheugen in beslag.

• Optimizer — Muon. Grote 2D-lineaire parameters (attention, GDN, MoE-experts) trainen met Muon, terwijl embeddings, de router en de laag-rankonderdelen van Gated Residual AdamW blijven gebruiken; het team heeft de schalingswet opnieuw afgestemd op de nieuwe architectuur rond de mix.

A single-column spec-sheet scoreboard titled 'Qwen3.8-Flash — the scoreboard' with the subtitle 'The 6B-active MoE that previews Qwen4', six rows reading 'Params: 125B MoE + 51B N-gram (~180B stored)', 'Active per token: ~6B (<5% activation)', 'Architecture: Qwen4 preview (QSA + GDN, gated residual, Muon)', 'Context: 262K native / 1M via YaRN', 'Price: $0.16 / $0.47 per 1M tokens', 'Open weights: Qwen3.8-Flash-Next (FP8 build available)', and a footer 'Benchmark figures vendor-reported; pricing as announced by Alibaba'; the OrcaRouter logo is composited in the bottom-right corner.

Voor een ontwikkelaar zijn er twee dingen die er direct toe doen: de attention-stack is de reden waarom een context van 1M tokens de norm kan zijn in plaats van een reikdoel, en de N-gram-tabel is de reden waarom een 125B-model toch licht verteerbaar kan blijven. De rest is voorproefmateriaal voor Qwen4 — en dat is precies hoe Alibaba het positioneert.

Het benchmarkblad, eerlijk geëtiketteerd

Elk getal in deze sectie is Alibaba's eigen evaluatie, één dag oud en op het moment van schrijven niet gereproduceerd door een onafhankelijk laboratorium. Beschouw ze als richtinggevende beweringen, niet als definitieve scores. Op Alibaba's suite scoort Qwen3.8-Flash-Next (6B actief) SWE-bench Pro 62.5, DeepSWE 1.1 58.7, CoWorkBench 73.9, AndroidWorld 84.5 en MathVision 95.7, met een JobBench-score van 55.7 — en de basisvariant, Qwen3.8-Flash-Next-Base, wordt gerapporteerd als het beste open model op 8 van de 14 benchmarks in een rechtstreekse vergelijking, waaronder MMLU-Pro, SuperGPQA, BBH en MMMU.

De claims van Alibaba over de positionering in de familie moeten worden bestempeld als wat ze zijn: claims. Het bedrijf zegt dat Qwen3.8-Flash Claude Opus 4.6 verslaat met 9,1 punten op SWE-bench Pro en ruwweg 20 punten op JobBench, en binnen handbereik komt van Claude Opus 4.8. Alles door de leverancier gerapporteerd, alles niet gereproduceerd. Wat vandaag onafhankelijk controleerbaar is, is beperkter: de gewichten zijn uitgebracht, de inferencestack draait ze al, en SGLang leverde dezelfde dag ondersteuning. De onafhankelijke reproductie van het benchmarkblad is dagen verwijderd, niet weken.

Wat het kost

De prijsstelling is het gemakkelijkst te verifiëren, omdat het een gepubliceerde prijs betreft in plaats van een benchmark — en op 27 augustus bevestigde Alibaba officieel het productietarief van QwenCloud: $0,15 per miljoen inputtokens, $0,47 per miljoen outputtokens, en $0,016 per miljoen bij cachetreffers, met het binnenlandse China-tarief op ¥0,8/¥2,7/¥0,1. Het cachetreffer-cijfer is het getal dat ertoe doet voor agentische workloads: een long-context-agent die bij elke beurt een grote geschiedenis opnieuw leest, betaalt vrijwel niets bij herhaalde leesbeurten, en dat is precies de workload waar de Qwen4-preview-attention-stack op is gericht. Chinese persberichtgeving vergeleek de kopersprijs onmiddellijk met concurrenten — ruwweg een derde van wat DeepSeek-V4-Flash rekent, en een afrondingsfout vergeleken met frontier-gesloten modellen. Volgens Alibaba's eigen boekhouding kostte de trainingsrun ongeveer een negende van Qwen3.7-Plus, en die structurele hefboomwerking is wat de API-prijs op het huidige niveau laat staan.

Naast de rest van de Qw​en 3.8-familie is de kloof groot: het vlaggenschip Qwen3.8-Max rekent $2.00 en $6.00 per miljoen tokens, en is al live op OrcaRouter tegen de prijs van de aanbieder zonder opslag. Nu de productie-API van Qwen3.8-Flash open is, geldt dezelfde doorberekening voor het officiële tarief van $0.15/$0.47 en het cache-hit-tarief van $0.016 — een routeringslaag is het verschil tussen lezen over een prijsverlaging en het hebben ervan in een configuratie. Beide modellen achter één sleutel, failover ertussen, geen tweede contract.

Wat "preview van Qwen4" betekent

Lees de aankondiging letterlijk en de inzet is duidelijk: dit is geen nieuwe laag van Qw​en 3.8 — het is de architectuur van Qwen4 die vroeg wordt uitgebracht, onder het beschermende merk van een kleiner, goedkoper model. De redenen om dat te doen zijn degelijk: frameworks, kwantisering en implementatiepatronen hebben tijd nodig om te rijpen, en een model met 6B actieve parameters is een goedkope manier voor de community om GDN + QSA op schaal te stresstesten voordat Alibaba het dure product er bovenop bouwt. De keerzijde is dat de productie-Qwen3.8-Flash een API is die is gebouwd op een architectuur die het bredere ecosysteem nog steeds aan het auditen is. Early adopters zijn, per definitie, de testset.

De snelle weg om het te proberen

Vandaag heb je vier realistische opties. Host de open gewichten zelf via vLLM, SGLang, Transformers of TokenSpeed — de FP8-build is de logische eerste stap op alles wat minder is dan een volledige node. Roep de QwenCloud API aan, nu live tegen het officiële tarief van $0,15/$0,47 met cache-hits tegen $0,016. Gebruik het binnen OpenCode Go, het flat-rate abonnement van de open-source terminal coding agent, dat deze week Qwen3.8-Flash heeft toegevoegd (aangekondigd door Alibaba op 28 augustus, bevestigd op OpenCode's eigen modellenlijst). Of roep de productie-Flash aan via een router op dezelfde manier als je Qwen3.8-Max al aanroept, met het officiële tarief dat zonder opslag wordt doorgegeven — geen maatwerkintegratie om te onderhouden.

A screenshot of the Hugging Face model card for Qwen/Qwen3.8-Flash-Next (captured August 27, 2026), showing the Image-Text-to-Text tag, the qwen4_exp library tag, the model description stating the artifacts are compatible with Hugging Face Transformers, vLLM, SGLang, and TokenSpeed, and that Qwen3.8-Flash is the official production version with 1M context by default and built-in tools, plus License 'qwen-community-1.0', Model size 180B params, Tensor type BF16, and 2,551 downloads last month.

De open vraag is de eerlijke: kan een model dat 6 miljard van zijn parameters activeert, standhouden in productie bij een breed scala aan workloads, of zal het benchmarkblad dat er vandaag als één dag oud uitziet, er over een maand nog zo uitzien? Dat is geen reden om te wachten — het is een reden om het achter failover te plaatsen in plaats van voor je hele stack. De gewichten zijn uit, de prijs is vastgesteld, en de architectuur is de verklaarde richting van Alibaba. De komende weken bepalen of 6B genoeg was.

Vergeleken in dit artikel2

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

providers@orcarouter.ai

Word lid van de community

Discordsupport@orcarouter.aiXGitHubYouTube