Qwen3.8-Flash-Next Release — Een blik in Alibaba's Qwen4-architectuurvoorvertoning. Opnieuw gegenereerde illustratie.
Guides & Insights

Qwen3.8-Flash-Next Release: Een kijkje in Alibaba's Qwen4-architectuurpreview

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Het nuttigste document dat Ali​baba op 26 augustus 2026 publiceerde, was niet het perspakket — het was een technisch rapport. Qwen3.8-Flash-Next, het open-weight multimodale mixture-of-experts-model dat die dag werd uitgebracht, verscheen samen met een paper getiteld "On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability", en het rapport is het verhaal. Het doet wat leveranciers bij lanceringen bijna nooit doen: het publiceert de ablaties, de negatieve resultaten en de experimenten met het trainingsrecept, en trekt vervolgens van elke bevinding een lijn naar de architectuur van de Qwen4-familie waarvan dit model een voorproefje moet zijn.

Wat er daadwerkelijk op 26 augustus uitkwam

Het model zelf is bescheiden naar de maatstaven van Qw​en in 2026, en dat is opzettelijk. Qwen3.8-Flash-Next slaat 125B parameters van het hoofdmodel op plus een aparte 51B n-gram-embeddingtabel — ruwweg 176B vóór een 4B multi-token-predictiemodule — maar activeert slechts 6B per token. Het is een mixture-of-experts-model met 512 experts, top-10-routing en 48 lagen, native 262.144 tokens context en uitbreidbaar tot 1M via YaRN. Het neemt tekst, beeld en video als invoer en produceert tekst. De gewichten staan op Hugging Face en ModelScope onder de qwen-community-1.0-licentie, en Ali​baba's eigen blog noemt het “een experimentele preview van de architectuur die Qwen4 zal onderbouwen” — dezelfde rol die Qwen3-Next speelde voor de Qw​en3.5-lijn, een kanarie die vóór het vlaggenschip uit vliegt.

Op dezelfde dag schakelde Ali​baba de commerciële tegenhanger in: een gehoste build genaamd Qwen3.8-Flash op de QwenCloud API voor $0,16 per miljoen inputtokens en $0,47 per miljoen output. De twee zijn gemakkelijk te verwarren en het is de moeite waard om ze uit elkaar te houden. Qwen3.8-Flash-Next is de preview met open gewichten die het technisch rapport ontleedt; Qwen3.8-Flash is de productie-API-build, met een prijs, een standaardcontext van 1M tokens en Open​AI- en Anthropic-compatibele requestformaten. De prijs, de benchmarks en de architectuurargumenten stammen allemaal af van dezelfde engineering.

The official QwenLM/Qwen3.8-Flash-Next GitHub repository, showing the model card ('foundation model developed by Qwen Team, Alibaba Group'), 171 stars, and the tech_report.pdf file in the repository listing.

De vier architectuurbeslissingen in het technisch rapport.

De ruggengraat van het artikel wordt gevormd door vier weddenschappen over hoe een frontiermodel met lange context en lage kosten eruit zou moeten zien, elk met experimentele onderbouwing.

• Aandacht — GDN + QSA hybride. Drie van elke vier lagen gebruiken Gated DeltaNet, een lineaire-aandachtlaag die de geschiedenis comprimeert tot een recurrente toestand van vaste grootte in plaats van een KV-cache die groeit met de sequentielengte. De resterende laag is Qw​en Sparse Attention, die de sequentie aggregeert in microblokken, ze goedkoop scoort en alleen volledige aandacht uitvoert op de gebieden die ertoe doen. Ali​baba rapporteert tot 7.6× prefill- en 4.9× decode-versnellingen bij 1M context; SGLang's eigen dag-0-benchmark mat nog hogere waarden, namelijk 10.2× en 6.6×. Bij een prefix-cache hitrate van 90% bereikt de prefill-doorvoer 8.6× die van Qwen3.7-Plus. Dit zijn door leveranciers en partners gerapporteerde cijfers, niet onafhankelijk gecontroleerde.

Residual stream — Gated Residual. Het enkele residupad wordt verbreed naar vier parallelle takken met elementgewijze dynamische gating, een multi-takontwerp in Hyper-Connection-stijl met besturing in GatedNorm-stijl. De gate regelt het lezen en schrijven per tak, wat volgens het paper activatie-uitschieters onderdrukt en in de praktijk de residuele toestanden in FP8 laat opslaan.

• Embedding — de 51B n-gramtabel. In plaats van één embedding per token, gebruikt het model een opzoektabel die is gesleuteld op het huidige token plus de voorgaande tokens, en die hele zinsdelen en lokale patronen opslaat. Het is per token vrijwel gratis, en omdat de opzoekadressen van tevoren bekend zijn, kan het in het hostgeheugen worden opgeslagen en asynchroon worden vooraf opgehaald, volledig buiten het GPU-geheugen. Dit is de truc waardoor een opgeslagen checkpoint van 176B kan draaien op machines van de 75GB-klasse, en het is terug te voeren op de per-laag-embeddings van Gemma 3n en Deep​Seek's Engram.

• Optimalisatie — Muon, afgestemd. De training gebruikt de Muon-optimizer, een op orthogonalisatie gebaseerde momentummethode, toegepast op tweedimensionale lineaire afbeeldingen (attention, GDN en MoE-expertgewichten), terwijl AdamW wordt gehandhaafd voor embeddings, de router en laagrangeparameters. Het paper rapporteert ook een negatief resultaat dat de moeite waard is om te lezen: batch-size-warmup werd geschrapt nadat bleek dat het 18,8% meer optimizerstappen kostte zonder iets te verbeteren.

De benchmarktabel, lees aandachtig

Elk getal in de koppen hier is van Qw​en zelf, gepubliceerd op de modelkaart en in het rapport, en niets ervan is onafhankelijk gereproduceerd — het model is een dag oud en nog geen derde partij heeft het gecontroleerd. Als je het zo leest, is het nog steeds opvallend, omdat Qwen3.8-Flash-Next gelijk op gaat met DeepSeek-V4-Flash-0731, een veel groter en gevestigd model, op 6B actieve parameters.

DeepSWE 1.1 — 58.7 vs 54.4 (door leverancier gerapporteerd).

• SWE-bench Pro — 62.5 vs 56.0 (door de leverancier opgegeven).

Toolathlon Geverifieerd — 73,5 vs 70,3 (door leverancier opgegeven).

• LiveCodeBench v6 — 91.9 vs 90.6 (door leverancier gerapporteerd).

• GPQA Diamond — 91,7 vs 90,8 (door leverancier gerapporteerd).

• IFBench — 81.3 vs 79.2 (door de leverancier gerapporteerd).

Dan is er de misser die het rapport openlijk blootlegt: NL2Repo-Bench, 48.1 tegen 54.2 van DeepSeek-V4-Flash-0731 — een echte achterstand op het gebied van codegeneratie op repository-niveau, de enige agentic-coding dimensie waarin het kleinere model niet kan bijbenen. Agents' Last Exam is een gelijkspel met 24.3 tegen 25.2. Op het gebied van kantoorautomatisering rapporteert Qw​en een 73.9 op CoWorkBench — maar dat is een interne benchmark en Ali​baba houdt het buiten de hoofdgrafiek.

Scoreboard card for Qwen3.8-Flash-Next: 6B active of 176B stored params, 262K to 1M context (YaRN), DeepSWE 1.1 58.7, SWE-bench Pro 62.5, GPQA Diamond 91.7 (each marked vendor), API price $0.16 / $0.47 per 1M, with a footer noting all benchmark figures are vendor-reported and not independently verified.

Qua visie toont de zelfgerapporteerde tabel AndroidWorld 84.5 tegen 62.0 voor Claude Opus 4.6 Max en RealWorldQA 88.5 tegen 73.9. Humanity's Last Exam is de enige benchmark waar Qw​en ronduit verliest van Claude Opus 4.6 Max — en die score is zelf beoordeeld door GPT-4o, dus zelfs die vergelijking is niet zuiver.

De prijs: een twaalfde van het vlaggenschip.

Dan het getal dat voor budgetten telt. De aangeboden Qwen3.8-Flash-build kost $0,16 per miljoen invoertokens en $0,47 per miljoen uitvoertokens op QwenCloud. Dat is ruwweg een twaalfde van de prijs van Ali​baba's eigen vlaggenschip, Qwen3.8-Max, voor $2,00 per miljoen invoer en $6,00 per miljoen uitvoer — voor een model dat volgens het rapport is getraind met ongeveer een negende van de rekenkracht van Qwen3.7-Plus. Chinese modelleveranciers hebben de zomer besteed aan het verlagen van flash-tierprijzen, en deze release is de Qw​en-kant van die campagne, die landt met een architectuuronderbouwing eraan in plaats van alleen een korting.

Voor iedereen die binnen de categorie vergelijkt, is de berekening eenvoudiger wanneer elke provider hetzelfde getal toont. OrcaRouter routeert de rest van de Qwen-familie — Qwen3.8-Max, Qwen3.8-27B en Qwen3.8 — tegen de lijstprijs van de provider met 0% opslag, zodat een prijsverlaging van de leverancier dezelfde dag dat deze wordt aangekondigd live is bij ons. Qwen3.8-Flash-Next staat nog niet in onze catalogus; zodra het een runtime bereikt die we routeren, past het in dezelfde one-key-lijstprijsopstelling zonder een tweede contract.

Wat je er vandaag mee kunt doen

De ondersteuning voor serving op dag nul is ongewoon breed. SGLang levert een cookbook-pagina en een speciale image (lmsysorg/sglang:qwen38flashnext); vLLM heeft vllm/vllm-openai:qwen38-flash-next; NVIDIA valideert beide plus TensorRT LLM op een GB300 NVL72-rack met meer dan 16.000 tokens per seconde per GPU in FP8, en NeMo dekt fine-tuning af. Onder datacenterschaal draait het model op DGX Spark-clusters en 4×RTX PRO 6000-werkstations, en de community-kwantiserings-trein van dezelfde dag — Unsloth's GGUFs en een 1-bit build die in 75GB RAM past met ongeveer 80% van de volledige nauwkeurigheid — betekent dat de 176B-opgeslagen checkpoint echt draaibaar is op hardware die een klein team bezit. Teams die het liever aanroepen dan draaien, kunnen de Qwen3.8-Flash API bereiken via Ali​baba's eigen QwenCloud en verschillende platforms van derden, hoewel de open gewichten zijn wat de meeste vroege gebruikers als eerste zullen oppakken.

LMSYS's SGLang blog post 'Qwen3.8-Flash-Next: Day-0 Support in SGLang', dated August 26, 2026, describing the GDN + QSA hybrid attention and the day-0 runtime support for the model.

{{1}}De VRAM-rekensom achter die lijst is de n-gramtabel, en dat is waar de serving-stacks vervolgens naartoe convergeren.{{/1}} {{2}}De per-laag-embedding die het techrapport buiten het GPU-geheugen houdt, is een pure opzoekstructuur — per gegenereerd token haalt het model slechts ongeveer 16 van de 320 miljoen rijen op — wat het offloaden ervan goedkoop maakt.{{/2}} {{3}}vLLM serveert Qwen3.8-Flash-Next vanuit een dedicated dev-image terwijl de pull request voor architectuurondersteuning nog openstaat, en het nieuwste onderdeel van dat werk, een draft-PR van dezelfde vLLM-auteur (vllm-project/vllm#54371, niet gemerged), voegt een PLE-Offload-servingpad toe dat de tabel in het hostgeheugen houdt en deze uitleest via CUDA unified virtual addressing in plaats van VRAM te reserveren.{{/3}} {{4}}Bij FP8 is de tabel ongeveer 48GB van de checkpoint van ~173GB, dus het offloaden ervan is het verschil tussen een datacenter-GPU en een enkele 96GB-kaart — een RTX PRO 6000, of één unified-memory-pool van een DGX Spark.{{/4}} {{5}}Het is nog pril, dus behandel het als richting eerder dan als een vandaag ondersteunde optie; maar het is de runtime die aansluit bij wat het techrapport al claimde, en het punt om in de gaten te houden als het VRAM-getal is wat je heeft tegengehouden.{{/5}}

Een preview van één dag oud met niet-gereproduceerde cijfers is het schoolvoorbeeld van waarom je er geen productiepad op zou gokken, en dat is precies waar failover voor dient. Als een runtime Qwen3.8-Flash-Next ondersteunt en je richt één endpoint erop met automatische failover naar een model dat je al vertrouwt, krijg je de meerwaarde van de nieuwe architectuur op niet-kritiek verkeer en een schone fallback wanneer het worstelt — geen herbedrading, want dat is een routeringsregel, geen codeaanpassing.

Wat deze preview zegt over Qwen4

Ali​baba heeft dit eerder gedaan. Qwen3-Next gaf een voorproefje van Gated DeltaNet eind 2025 met weinig documentatie, en de architectuur werd pas volledig gespecificeerd toen de Qw​en3.5-serie het op schaal adopteerde. Het patroon herhaalt zich: Qwen3.8-Flash-Next is de kanarie, en het rapport is de specificatie-door-experiment. De concrete zaken om op te letten zijn of de Qwen4-vlaggenschip de drie-op-één GDN-tot-QSA-verdeling overneemt, of de n-gram-embedding het contact met productieserving op de schaal van het vlaggenschip overleeft, en vooral of onafhankelijke evaluaties het 6B-actieve voordeel ten opzichte van grotere modellen bevestigen. Als de efficiëntiethesis standhoudt, zou het Qwen4-vlaggenschip met aanzienlijk lagere servingkosten kunnen verschijnen dan de generatie ervoor.

Veelgestelde vragen

Qwen3.8-Flash-Next en Qwen3.8-Flash — hetzelfde model?

Nee, en dat onderscheid is belangrijk. Qwen3.8-Flash-Next is de preview van de open-weights-architectuur die in het technisch rapport wordt geanalyseerd; Qwen3.8-Flash is de productie-API-build die Ali​baba op QwenCloud aanbiedt voor $0,16/$0,47 per miljoen tokens met een standaardcontext van 1M. Zelfde technische afstamming, verschillende artefacten — de ene is voor self-hosting en inspectie, de andere is een betaalde beheerde dienst.

Zouden productieworkloads er vandaag naartoe moeten overstappen?

Niet zonder een tweede mening. Elke benchmark is door leveranciers gerapporteerd en niet gereproduceerd, de architectuur is nieuw genoeg dat serving stacks nog steeds convergeren — vLLM's eigen ondersteuning wordt nog steeds via open pull requests binnengehaald — en het enige agentic-coding-hiaat (NL2Repo) betreft precies het soort taak waar productieontwikkelaars tegenaan lopen. De open gewichten maken het goedkoop om zelf te evalueren, en day-0-ondersteuning voor SGLang en vLLM maakt een pilot deze week mogelijk — maar een pilot achter failover is de eerlijke manier om te starten, niet een cutover.

Wanneer verschijnt de echte Qwen4?

Ali​baba heeft niets gezegd. Het enige timingsignaal in deze release is historisch: de laatste kanarie, Qwen3-Next, vloog ongeveer een seizoen voordat de Qw​en3.5-serie zijn architectuur overnam. Op dat ritme zijn de vlaggenschepen van Qwen4 dichterbij dan ze lijken — maar het rapport gaat expliciet over architectuur, niet over een roadmap.

De bottom line

Qwen3.8-Flash-Next is een zeldzame release waarbij het paper het product is. Over het model zelf zegt de eerlijke scorekaart: 6B actieve parameters die op de meeste gedeelde benchmarks gelijkwaardig presteren aan veel grotere modellen, één benoemd hiaat op repository-niveau code, een prijs die een twaalfde bedraagt van het vlaggenschip, en een architectuur die Qw​en's antwoord is op hoe een frontier-model goedkoop wordt. Het techrapport zegt waarvoor Qwen3.8-Flash-Next dient — en dat is niet het model. Het is het bewijs voor de architectuur die Qwen4 zal worden, en dat is de moeite waard om te lezen voordat Qwen4 uitkomt, omdat de beslissing die het verandert de beslissing is die jij zult nemen wanneer Qwen4 arriveert.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

providers@orcarouter.ai

Word lid van de community

Discordsupport@orcarouter.aiXGitHubYouTube