
Qwen3.8-Flash-Next: Alibaba toont alvast de Qwen4-architectuur voordat Qwen4 bestaat
- DeepSeekNIEUWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 mln tokens
- z-aiNIEUWZ.ai: GLM 5.32026-08-1860Intelligentie75Coderen
- obsidianNIEUWQwen3.8 27B2026-08-1552Intelligentie68Coderen
- qwenNIEUWQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNIEUWDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligentie69Coderen
- grokNIEUWSpaceXAI: Grok 4.62026-08-1261Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1653Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1560Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligentie71Coderen
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligentie77Coderen
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligentie77Coderen
{{1}}Alibaba{{/1}} staat op het punt om de {{2}}Qwen4{{/2}}-architectuur te publiceren voordat het een {{3}}Qwen4{{/3}}-model uitbrengt. {{4}}Qwen3.8-Flash-Next{{/4}} — een open-weight, multimodaal mixture-of-experts-model gebouwd op de architectuur van de volgende generatie die de {{5}}Qwen4{{/5}}-familie zal aandrijven — staat gepland om op 26 augustus 2026 om 23:00 Beijing-tijd op {{6}}ModelScope{{/6}} te verschijnen. {{7}}Alibaba{{/7}} presenteert de release als een technology preview: ontwikkelaars krijgen de architectuur vroeg, de volledige {{8}}Qwen4{{/8}}-familie komt later. Op het moment van schrijven zijn het aantal parameters, de licentie en de prijs niet bevestigd, dus dit is een wat-we-tot-nu-toe-weten-stuk — elk specifiek punt hieronder is voorzien van een betrouwbaarheidsaanduiding.
Als u deze maand het tempo van Alibaba niet hebt gevolgd, is het anker Qwen3.8-Max — het vlaggenschip met 2,4 biljoen parameters dat op 3 augustus is uitgebracht en minder dan twee weken later als open source is gepubliceerd onder de naam Qwen3.8-2.4T-A95B. Qwen3.8-Flash-Next verschijnt minder dan een maand daarna. Hetzelfde laboratorium dat een open-weightmodel met 2,4 biljoen parameters uitbracht, deelt nu de architectuur voor de volgende generatie uit, voordat het vlaggenschip van die generatie zelfs maar een naam heeft.
Wat werd er aangekondigd?
Het signaal bereikte de arena via de gebruikelijke kanalen. Op 25 augustus ging een ModelScope-teaserpagina voor Qwen3.8-Flash-Next live met een badge "Binnenkort open-source release", de slogan "Door naar de volgende generatie — razendsnel" en een release-timer die wees naar 2026-08-26 23:00 (UTC+08:00). Het Qwen-team van Alibaba plaatste dezelfde dag op X: "De volgende Qwen-golf komt eraan." Het bericht dat dit stuk bij ons bezorgde, van @kimmonismus op X, beschreef hetzelfde in iets andere woorden: een open-gewicht multimodale MoE op de architectuur van de volgende generatie, met vroege toegang zodat de community zich kan voorbereiden op de Qwen4-familie.

Het deel dat het herlezen waard is, is Alibaba's eigen framing. Het model wordt beschreven als gebouwd op de architectuur van de volgende generatie 'die de komende Qwen4-familie zal aandrijven' — en expliciet niet als Qwen4 zelf. Alibaba's opgegeven reden is dat de architectuurwijzigingen vóór de komst van de familie in handen van de community moeten zijn, zodat runtimes, kwantisaties en applicaties klaar zijn wanneer het echte product uitkomt. Dat is een marketingstandpunt, maar het is ook een technische toewijding: eerst het moeilijke deel previewen en de community meenemen.
Wat is er vandaag bevestigd, en wat niet:
• Bevestigd, volgens de teaser en de Qwen-verklaring: Qwen3.8-Flash-Next is open-weight, multimodaal en een MoE-model op de Qwen4-architectuur.
• Bevestigd, volgens de verklaring van Qwen: het introduceert twee voornaamste architectuurwijzigingen — de GDN-hybride architectuur en Qwen Sparse Attention (QSA).
• Bevestigd, volgens de teaser: de releasetijd, 2026-08-26 23:00 (UTC+08:00), op ModelScope.
• Niet bevestigd: totale of actieve parameters, licentievoorwaarden, contextlengte, API-beschikbaarheid of prijzen, en elke benchmarkscore. Er is nog geen onafhankelijke evaluatie, omdat de gewichten nog niet zijn uitgebracht.

Wat de Qwen4-architectuur eigenlijk is
Twee mechanismen dragen het verhaal. De eerste, GDN — Gated Delta Network — is de lineaire-aandachtslaag van Alibaba. Waar een standaardtransformer een key-value-cache bijhoudt die groeit met de sequentielengte, handhaaft een GDN-laag een recurrente toestand van vaste grootte en werkt deze bij met een aangeleerde gating-regel; de afstamming loopt via DeltaNet en Mamba-2. De opbrengst is degene die de Qwen-lijn sinds Qwen3-Next stilletjes heeft aangedreven: lange contexten blijven goedkoop omdat de toestand niet groeit, terwijl een minderheid van volledige-aandachtslagen in de mix blijft om de precieze terugwinning te doen waar lineaire aandacht slecht in is. In de huidige generatie is die mix ongeveer drie GDN-lagen per volledige-aandachtslaag — community-analyse van de Qwen3.8-2.4T-A95B-checkpoint telt 69 GDN-lagen tegenover 23 aandachtslagen. Qwen3.8-Flash-Next wordt beschreven als de "GDN hybride architectuur" op precies die afstamming.
De tweede, QSA — Qwen Sparse Attention — is het werkelijk nieuwe onderdeel, en er is nog geen publieke technische beschrijving van: alleen de naam, en de vermelding als een van de twee hoofdveranderingen van de preview. Dat gebrek aan details is zelf onderdeel van het patroon. De preview van Qwen3-Next introduceerde eind 2025 Gated DeltaNet met dezelfde schaarste aan documentatie, en de architectuur werd pas volledig gespecificeerd toen de Qwen3.5-serie deze overnam. Voor een lezer is de praktische conclusie beide keren hetzelfde: de architectuurkanarie verschijnt eerst, de documentatie en de productiemodellen verschijnen daarna.
Het draaiboek dat al eens werkte.
Alibaba heeft dit exacte spelletje eerder gespeeld, en het werkte. Eind 2025 previewde Qwen3-Next Gated DeltaNet en een hybride van lineaire en volledige aandacht. Toen de Qwen3.5-serie uitkwam, nam deze dat blauwdruk op grote schaal over — en de hybride is sindsdien doorgevoerd in de Qwen3.8-generatie, inclusief het 2.4T-vlaggenschip. De reden dat dit precedent hier ertoe doet, is de timing die het impliceert. De volledige Qwen4-familie moet worden verwacht aan de overkant van deze preview, niet erin; als de Qwen3-Next-kloof een indicatie is, wordt de afstand tussen "hier is de architectuur" en "hier is de familie" gemeten in maanden. Niets in de teaser bevestigt dat — het is een afleiding uit een patroon dat Alibaba nu twee keer heeft gespeeld.
Wat we nog niet weten
De onbekenden zijn de essentie van een preview, en ze zijn reëel:
• Parameters. De teaser maakt niets bekend. Speculatie in de community op X en Reddit — zonder officiële bevestiging — wijst op een configuratie van ongeveer 125B totaal / 6B actief, met een grote n-gram-embeddings-opzoektabel. Beschouw het als een gerucht.
• De "Flash"-laag. In de Qwen3.5-generatie was de cloud-only Qwen3.5-Flash een verbeterde variant van het open-weight Qwen3.5-35B-A3B-model. Of Qwen3.8-Flash-Next het open-weight-tegenhanger is van een vergelijkbaar groot Qwen3.8-model is onbekend; het zou in plaats daarvan het model van de 125B-A6B-klasse kunnen zijn. Beide interpretaties zijn gissingen.
• Licentie. Alibaba's recente Qwen-releases lopen uiteen van Apache-2.0 (Qwen3.8-27B) tot de omzetafhankelijke Qwen3.8-Max-licentie. Waar Flash-Next terechtkomt, bepaalt of het commercieel gebruikt kan worden, en waarvoor.
• Benchmarks. De Qwen-verklaring benadrukt agentische codering, langetermijntaken en multimodale intelligentie, maar er zijn geen cijfers aan verbonden en er is geen onafhankelijke evaluatie totdat de gewichten worden vrijgegeven.
Een familie die om de twee weken itereert
De omringende cadans is een verhaal op zich. Qwen3.8-Max, het vlaggenschip met 2,4 biljoen parameters, verscheen op 3 augustus; het open-gewicht Qwen3.8-2.4T-A95B volgde op 12–13 augustus; het gratis Apache-2.0 Qwen3.8-27B kwam enkele dagen later uit; en nu, nog voor de maand om is, wordt de architectuur van de volgende generatie gepreviewd. Geen enkel ander lab werkt momenteel op dit tempo. Voor een lezer die modellen kiest, is de praktische consequentie dat "de beste Qwen" een bewegend doelwit is — en de delta tussen generaties komt sneller aan dan het omringende ecosysteem zich doorgaans aanpast. Het kopen van een beslissing in plaats van een model is steeds vaker de verdedigbare zet.
Wat een ontwikkelaar nu moet doen
Plan voor de architectuur, niet alleen voor het model. Qwen3.8-Flash-Next zal op dag één een onbewezen preview zijn: geen onafhankelijke benchmarks, een runtime-ecosysteem dat nog achterloopt, en alleen leveranciersclaims voor de agentische en langetermijnsterktes die ertoe doen voor de workloads die het zouden gebruiken. De veilige manier om het te evalueren is niet om het in een productiepad in te bouwen — maar om een risicoarme kopie van een workload ernaartoe te routeren, de output te vergelijken met die van het huidige model, en automatische failover de momenten te laten opvangen waarop de provider die een gloednieuw open-weight-model serveert zich misdraagt. Op OrcaRouter is dat hetzelfde endpoint en dezelfde key die je al gebruikt: Qwen3.8-Flash-Next en je huidige model zitten achter één API, en de routing-DSL kan de preview A/B-testen tegen het huidige model met dezelfde prompt voordat er iets wordt vastgelegd.
Prijzen moeten, wanneer ze bestaan, op dezelfde manier worden gelezen. {{1}}Alibaba heeft nog geen API-prijs voor Flash-Next aangekondigd, en niet-uitgebrachte modelgewichten zijn nergens routeerbaar.{{/1}} Wanneer een provider het wel beschikbaar stelt, geeft OrcaRouter de lijstprijs van de provider rechtstreeks door met 0% opslag — dus {{2}}wat Alibaba's bedrag ook blijkt te zijn, het verschijnt ongewijzigd op dezelfde dag.{{/2}} De dichtstbijzijnde baseline die je vandaag daadwerkelijk kunt aanroepen, is Qwen3.8-Max (qwen/qwen3.8-max), het vlaggenschip waaronder deze architectuur uiteindelijk zal staan: {{3}}een contextvenster van 1.000.000 tokens tegen $2,00 per miljoen invoertokens en $6,00 per miljoen uitvoertokens, dat tegen de lijstprijs wordt doorgegeven.{{/3}} Houd dat getal in gedachten wanneer de prijs van Flash-Next daalt; het is {{4}}de prijs die de volgende generatie moet verslaan.{{/4}}

Wat er te zien is bij de drop
Vier dingen doen ertoe op het moment dat de vrijgavetimer afloopt:
• Het aantal parameters en het actieve-parameterniveau — of dit het 125B-A6B-klasse model is dat de geruchten beschrijven, of een kleiner instapmodel.
• De licentie — permissief zoals Qwen3.8-27B, of beperkt zoals de Max-licentie.
Of de eerste onafhankelijke evaluaties de agentic-coding- en long-horizon-claims van de leverancier reproduceren — de cijfers om te vertrouwen, niet de marketingpraat.
• Hoe lang Alibaba wacht voordat de volledige Qwen4-familie op de preview volgt.
Niets daarvan is vanaf hier te achterhalen. Wat vandaag wél te weten valt, is de vorm van de beslissing die Alibaba heeft genomen: het gokt erop dat de volgende generatie van zijn architectuur de moeite waard is om vóór het vlaggenschip weg te geven. Die gok is het verhaal — en de gewichten komen morgen uit.
