Hero-titelkaart voor het artikel 'Qwen3.8-Flash-Next — LEKRAPPORT' met een 'NIET GEVERIFIEERD — QWEN4-ARCHITECTUURPREVIEW'-badge, de ondertitel 'Alibaba brengt de Qwen4-architectuur uit vóór het model', drie chips met 'Bron: @kimmonismus', '25 aug 2026' en 'Release: 26 aug 23:00 UTC+08', een kaart links met 'De bewering: een multimodale MoE met open gewichten die een voorproefje geeft van de Qwen4-architectuur' en een kaart rechts met 'Status: gewichten niet vrijgegeven, ~24 uur tot release'. Het OrcaRouter-logo is in de rechterbenedenhoek gecomponeerd.
Guides & Insights

Qwen3.8-Flash-Next: Alibaba toont alvast de Qwen4-architectuur voordat Qwen4 bestaat

Auteur

Elias Hawthorne

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

{{1}}Alibaba{{/1}} staat op het punt om de {{2}}Qwen4{{/2}}-architectuur te publiceren voordat het een {{3}}Qwen4{{/3}}-model uitbrengt. {{4}}Qwen3.8-Flash-Next{{/4}} — een open-weight, multimodaal mixture-of-experts-model gebouwd op de architectuur van de volgende generatie die de {{5}}Qwen4{{/5}}-familie zal aandrijven — staat gepland om op 26 augustus 2026 om 23:00 Beijing-tijd op {{6}}ModelScope{{/6}} te verschijnen. {{7}}Alibaba{{/7}} presenteert de release als een technology preview: ontwikkelaars krijgen de architectuur vroeg, de volledige {{8}}Qwen4{{/8}}-familie komt later. Op het moment van schrijven zijn het aantal parameters, de licentie en de prijs niet bevestigd, dus dit is een wat-we-tot-nu-toe-weten-stuk — elk specifiek punt hieronder is voorzien van een betrouwbaarheidsaanduiding.

Als u deze maand het tempo van Alibaba niet hebt gevolgd, is het anker Qwen3.8-Max — het vlaggenschip met 2,4 biljoen parameters dat op 3 augustus is uitgebracht en minder dan twee weken later als open source is gepubliceerd onder de naam Qwen3.8-2.4T-A95B. Qwen3.8-Flash-Next verschijnt minder dan een maand daarna. Hetzelfde laboratorium dat een open-weightmodel met 2,4 biljoen parameters uitbracht, deelt nu de architectuur voor de volgende generatie uit, voordat het vlaggenschip van die generatie zelfs maar een naam heeft.

Wat werd er aangekondigd?

Het signaal bereikte de arena via de gebruikelijke kanalen. Op 25 augustus ging een ModelScope-teaserpagina voor Qwen3.8-Flash-Next live met een badge "Binnenkort open-source release", de slogan "Door naar de volgende generatie — razendsnel" en een release-timer die wees naar 2026-08-26 23:00 (UTC+08:00). Het Qw​en-team van Alibaba plaatste dezelfde dag op X: "De volgende Qw​en-golf komt eraan." Het bericht dat dit stuk bij ons bezorgde, van @kimmonismus op X, beschreef hetzelfde in iets andere woorden: een open-gewicht multimodale MoE op de architectuur van de volgende generatie, met vroege toegang zodat de community zich kan voorbereiden op de Qwen4-familie.

A screenshot of the ModelScope teaser page for Qwen3.8-Flash-Next (captured August 25, 2026), showing an 'Upcoming Open-Release' badge, the model name Qwen3.8-Flash-Next with the tagline 'Onward to the Next-Gen — Lightning-Fast', a release countdown, an 'Estimated Release Time: 2026-08-26 23:00 (UTC+08:00)' line, and a 'Like and Get-Notified' button.

Het deel dat het herlezen waard is, is Alibaba's eigen framing. Het model wordt beschreven als gebouwd op de architectuur van de volgende generatie 'die de komende Qwen4-familie zal aandrijven' — en expliciet niet als Qwen4 zelf. Alibaba's opgegeven reden is dat de architectuurwijzigingen vóór de komst van de familie in handen van de community moeten zijn, zodat runtimes, kwantisaties en applicaties klaar zijn wanneer het echte product uitkomt. Dat is een marketingstandpunt, maar het is ook een technische toewijding: eerst het moeilijke deel previewen en de community meenemen.

Wat is er vandaag bevestigd, en wat niet:

• Bevestigd, volgens de teaser en de Qw​en-verklaring: Qwen3.8-Flash-Next is open-weight, multimodaal en een MoE-model op de Qwen4-architectuur.

• Bevestigd, volgens de verklaring van Qw​en: het introduceert twee voornaamste architectuurwijzigingen — de GDN-hybride architectuur en Qw​en Sparse Attention (QSA).

• Bevestigd, volgens de teaser: de releasetijd, 2026-08-26 23:00 (UTC+08:00), op ModelScope.

• Niet bevestigd: totale of actieve parameters, licentievoorwaarden, contextlengte, API-beschikbaarheid of prijzen, en elke benchmarkscore. Er is nog geen onafhankelijke evaluatie, omdat de gewichten nog niet zijn uitgebracht.

A single-column infographic titled 'Qwen3.8-Flash-Next — the leak board' with rows reading 'Status: upcoming open release', 'Release: 2026-08-26 23:00 (UTC+08)', 'Architecture: Qwen4 preview — GDN + QSA', 'Type: multimodal MoE, open-weight', 'Params: undisclosed (rumor ~125B-A6B)', 'License: undisclosed'. A small footer line reads 'From the teaser + community analysis; nothing independently verified.' The OrcaRouter logo is composited in the bottom-right corner.

Wat de Qwen4-architectuur eigenlijk is

Twee mechanismen dragen het verhaal. De eerste, GDN — Gated Delta Network — is de lineaire-aandachtslaag van Alibaba. Waar een standaardtransformer een key-value-cache bijhoudt die groeit met de sequentielengte, handhaaft een GDN-laag een recurrente toestand van vaste grootte en werkt deze bij met een aangeleerde gating-regel; de afstamming loopt via DeltaNet en Mamba-2. De opbrengst is degene die de Qwen-lijn sinds Qwen3-Next stilletjes heeft aangedreven: lange contexten blijven goedkoop omdat de toestand niet groeit, terwijl een minderheid van volledige-aandachtslagen in de mix blijft om de precieze terugwinning te doen waar lineaire aandacht slecht in is. In de huidige generatie is die mix ongeveer drie GDN-lagen per volledige-aandachtslaag — community-analyse van de Qwen3.8-2.4T-A95B-checkpoint telt 69 GDN-lagen tegenover 23 aandachtslagen. Qwen3.8-Flash-Next wordt beschreven als de "GDN hybride architectuur" op precies die afstamming.

De tweede, QSA — Qw​en Sparse Attention — is het werkelijk nieuwe onderdeel, en er is nog geen publieke technische beschrijving van: alleen de naam, en de vermelding als een van de twee hoofdveranderingen van de preview. Dat gebrek aan details is zelf onderdeel van het patroon. De preview van Qwen3-Next introduceerde eind 2025 Gated DeltaNet met dezelfde schaarste aan documentatie, en de architectuur werd pas volledig gespecificeerd toen de Qw​en3.5-serie deze overnam. Voor een lezer is de praktische conclusie beide keren hetzelfde: de architectuurkanarie verschijnt eerst, de documentatie en de productiemodellen verschijnen daarna.

Het draaiboek dat al eens werkte.

Alibaba heeft dit exacte spelletje eerder gespeeld, en het werkte. Eind 2025 previewde Qwen3-Next Gated DeltaNet en een hybride van lineaire en volledige aandacht. Toen de Qw​en3.5-serie uitkwam, nam deze dat blauwdruk op grote schaal over — en de hybride is sindsdien doorgevoerd in de Qw​en3.8-generatie, inclusief het 2.4T-vlaggenschip. De reden dat dit precedent hier ertoe doet, is de timing die het impliceert. De volledige Qwen4-familie moet worden verwacht aan de overkant van deze preview, niet erin; als de Qwen3-Next-kloof een indicatie is, wordt de afstand tussen "hier is de architectuur" en "hier is de familie" gemeten in maanden. Niets in de teaser bevestigt dat — het is een afleiding uit een patroon dat Alibaba nu twee keer heeft gespeeld.

Wat we nog niet weten

De onbekenden zijn de essentie van een preview, en ze zijn reëel:

• Parameters. De teaser maakt niets bekend. Speculatie in de community op X en Reddit — zonder officiële bevestiging — wijst op een configuratie van ongeveer 125B totaal / 6B actief, met een grote n-gram-embeddings-opzoektabel. Beschouw het als een gerucht.

• De "Flash"-laag. In de Qw​en3.5-generatie was de cloud-only Qwen3.5-Flash een verbeterde variant van het open-weight Qwen3.5-35B-A3B-model. Of Qwen3.8-Flash-Next het open-weight-tegenhanger is van een vergelijkbaar groot Qw​en3.8-model is onbekend; het zou in plaats daarvan het model van de 125B-A6B-klasse kunnen zijn. Beide interpretaties zijn gissingen.

• Licentie. Alibaba's recente Qw​en-releases lopen uiteen van Apache-2.0 (Qw​en3.8-27B) tot de omzetafhankelijke Qwen3.8-Max-licentie. Waar Flash-Next terechtkomt, bepaalt of het commercieel gebruikt kan worden, en waarvoor.

• Benchmarks. De Qwen-verklaring benadrukt agentische codering, langetermijntaken en multimodale intelligentie, maar er zijn geen cijfers aan verbonden en er is geen onafhankelijke evaluatie totdat de gewichten worden vrijgegeven.

Een familie die om de twee weken itereert

De omringende cadans is een verhaal op zich. Qwen3.8-Max, het vlaggenschip met 2,4 biljoen parameters, verscheen op 3 augustus; het open-gewicht Qwen3.8-2.4T-A95B volgde op 12–13 augustus; het gratis Apache-2.0 Qw​en3.8-27B kwam enkele dagen later uit; en nu, nog voor de maand om is, wordt de architectuur van de volgende generatie gepreviewd. Geen enkel ander lab werkt momenteel op dit tempo. Voor een lezer die modellen kiest, is de praktische consequentie dat "de beste Qw​en" een bewegend doelwit is — en de delta tussen generaties komt sneller aan dan het omringende ecosysteem zich doorgaans aanpast. Het kopen van een beslissing in plaats van een model is steeds vaker de verdedigbare zet.

Wat een ontwikkelaar nu moet doen

Plan voor de architectuur, niet alleen voor het model. Qwen3.8-Flash-Next zal op dag één een onbewezen preview zijn: geen onafhankelijke benchmarks, een runtime-ecosysteem dat nog achterloopt, en alleen leveranciersclaims voor de agentische en langetermijnsterktes die ertoe doen voor de workloads die het zouden gebruiken. De veilige manier om het te evalueren is niet om het in een productiepad in te bouwen — maar om een risicoarme kopie van een workload ernaartoe te routeren, de output te vergelijken met die van het huidige model, en automatische failover de momenten te laten opvangen waarop de provider die een gloednieuw open-weight-model serveert zich misdraagt. Op OrcaRouter is dat hetzelfde endpoint en dezelfde key die je al gebruikt: Qwen3.8-Flash-Next en je huidige model zitten achter één API, en de routing-DSL kan de preview A/B-testen tegen het huidige model met dezelfde prompt voordat er iets wordt vastgelegd.

Prijzen moeten, wanneer ze bestaan, op dezelfde manier worden gelezen. {{1}}Alibaba heeft nog geen API-prijs voor Flash-Next aangekondigd, en niet-uitgebrachte modelgewichten zijn nergens routeerbaar.{{/1}} Wanneer een provider het wel beschikbaar stelt, geeft OrcaRouter de lijstprijs van de provider rechtstreeks door met 0% opslag — dus {{2}}wat Alibaba's bedrag ook blijkt te zijn, het verschijnt ongewijzigd op dezelfde dag.{{/2}} De dichtstbijzijnde baseline die je vandaag daadwerkelijk kunt aanroepen, is Qwen3.8-Max (qwen/qwen3.8-max), het vlaggenschip waaronder deze architectuur uiteindelijk zal staan: {{3}}een contextvenster van 1.000.000 tokens tegen $2,00 per miljoen invoertokens en $6,00 per miljoen uitvoertokens, dat tegen de lijstprijs wordt doorgegeven.{{/3}} Houd dat getal in gedachten wanneer de prijs van Flash-Next daalt; het is {{4}}de prijs die de volgende generatie moet verslaan.{{/4}}

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max), showing the model id, the Vision, Tools, JSON and Reasoning capability chips, a p50 time-to-first-token of 5.15 seconds, a $2.00 per 1M input and $6.00 per 1M output price passed through at list price, and a 1,000,000-token context window.

Wat er te zien is bij de drop

Vier dingen doen ertoe op het moment dat de vrijgavetimer afloopt:

• Het aantal parameters en het actieve-parameterniveau — of dit het 125B-A6B-klasse model is dat de geruchten beschrijven, of een kleiner instapmodel.

• De licentie — permissief zoals Qwen3.8-27B, of beperkt zoals de Max-licentie.

Of de eerste onafhankelijke evaluaties de agentic-coding- en long-horizon-claims van de leverancier reproduceren — de cijfers om te vertrouwen, niet de marketingpraat.

• Hoe lang Alibaba wacht voordat de volledige Qwen4-familie op de preview volgt.

Niets daarvan is vanaf hier te achterhalen. Wat vandaag wél te weten valt, is de vorm van de beslissing die Alibaba heeft genomen: het gokt erop dat de volgende generatie van zijn architectuur de moeite waard is om vóór het vlaggenschip weg te geven. Die gok is het verhaal — en de gewichten komen morgen uit.

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

providers@orcarouter.ai

Word lid van de community

Discordsupport@orcarouter.aiXGitHubYouTube