
Qwen3.8-Flash-Next vs Qwen3.8-27B: de Qwen4-preview MoE tegen het open-weights werkpaard
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 578 tok/s
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 182 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 114 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 226 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
Het verrassende aan Qwen3.8-Flash-Next is niet dat Alibaba beweert dat een model dat slechts 6 miljard parameters per token activeert het grootste deel van het open veld verslaat — het is dat het serveren ervan meer geheugen nodig heeft dan het dense model met 27 miljard parameters waarmee het wordt vergeleken. Qwen3.8-Flash-Next, op 26 augustus 2026 als open-source preview van de Qwen4-architectuur uitgebracht, bewaart een N-gram-opzoektabel van 51 miljard parameters in systeem-RAM in plaats van VRAM; Qwen3.8-27B, het Apache-2.0 multimodale dense model dat half augustus uitkwam en het open-weights-werkpaard van de huidige Qwen 3.8-generatie is, past met 4-bit op een enkele 24GB-videokaart. Op Alibaba's eigen benchmarkoverzicht verslaat de nieuwe MoE de 27B op 21 van de 22 vergeleken benchmarks. Op basis van onafhankelijk bewijs — arena-plaatsingen, een legal-agentstudie, throughputmetingen van derden — is de 27B de enige van de twee die daar iets van heeft. Die combinatie is de hele beslissing.
De vergelijking in één zin: twee open-weight-modellen {{1}}met tekst en beeld{{/1}} uit dezelfde generatie, met dezelfde 262K native context, beide ontworpen om buiten een datacenter te draaien — en gescheiden door architectuur, door licentie, door prijs, en door hoeveel van hun verhaal is geverifieerd. Qwen3.8-Flash-Next is de sparse MoE die alvast een voorproefje geeft van alles wat Qwen4 naar verwachting zal overnemen. Qwen3.8-27B is het dense model dat comprimeert wat Alibaba heeft geleerd bij het bouwen van het 2.4T-vlaggenschip tot iets dat één GPU kan draaien. De keuze tussen beide gaat minder over capaciteit — Alibaba zegt dat de preview voorloopt — en meer over of je meer vertrouwen hebt in een één dag oud leveranciersdocument dan in een model dat de community al volledig heeft uitgeplozen.
Het scorebord
Eerst de bronvermelding: alle Qwen3.8-Flash-Next-cijfers hieronder zijn eigen cijfers van Alibaba, één dag oud en niet gereproduceerd. De belangrijkste benchmarkclaims van de Qwen3.8-27B zijn eveneens door Alibaba gerapporteerd, maar de 27B beschikt over onafhankelijke resultaten — human-preference-arena-plaatsingen, een juridisch-domeinonderzoek en AMD-doorvoermetingen — die de preview niet kan evenaren.
— Totale parameters — Qwen3.8-Flash-Next: 125B MoE + 51B N-gram + MTP (~180B opgeslagen), 6B actief. Qwen3.8-27B: ~27B dense (28B met vision-encoder), allemaal actief.
• Architectuur — Qwen3.8-Flash-Next: Qwen4-preview — Qwen Sparse Attention afgewisseld met Gated DeltaNet, gegateerde residuele verbindingen, N-gram-embeddings, Muon-getraind. Qwen3.8-27B: 48 GDN-lagen met lineaire aandacht plus 16 lagen met volledige aandacht (3:1), dense.
• Context — beide 262.144 tokens native, uitbreidbaar tot 1M via YaRN.
• Modaliteit — beide accepteren tekst, afbeeldingen en video als invoer en retourneren tekst.
• Licentie — Qwen3.8-Flash-Next: qwen-community-1.0. Qwen3.8-27B: Apache 2.0.
• Prijs — Qwen3.8-Flash-Next: $0.16 / $0.47 per 1M (aangekondigd; productie-API nog niet open). Qwen3.8-27B: $0.33 / $2.40 per 1M, vandaag live.
• Voetafdruk bij uitvoering — Qwen3.8-Flash-Next: 51B-tabel in host-RAM, ~96GB systeemgeheugen plus eventuele GPU; FP8 ~186GB, Q4 GGUF ~82GB. Qwen3.8-27B: BF16 ~55,6GB, 4-bit past op een 24GB-kaart.
• Onafhankelijk bewijs — Qwen3.8-Flash-Next: nog geen. Qwen3.8-27B: #1 open model op Arena.ai Image-to-WebDev, #9 overall op Code Arena WebDev, #1 open-weight op Harvey's Legal Agent benchmark, AMD-gemeten doorvoer.

Op Alibaba's eigen cijfers wint de preview bijna alles.
In Alibaba's gepubliceerde vergelijking scoort Qwen3.8-Flash-Next op 21 van de 22 taal- en visiebenchmarks gelijk of beter dan {{1}}Qwen3.8-27B{{/1}}, en die winsten zijn niet cosmetisch. SWE-bench Pro 62,5 tegen 61,7 is een marginale voorsprong, maar DeepSWE 58,7 tegen 42,2, JobBench 55,7 tegen 33,4 en CoWorkBench 73,9 tegen 70,7 zijn echte verschillen op precies de agentische en kantoorworkloads waar de flash-tier op is gericht. De belangrijkste cijfers van de preview — LiveCodeBench v6 91,9, GPQA Diamond 91,7, MathVision 95,7 — overtreffen ook de overeenkomstige rijen van de 27B in Alibaba's tabel. Dit is de stelling van de release, uitgedrukt in data: het grootste deel van de redeneer- en codeercapaciteit van de grotere {{2}}Qwen 3.8{{/2}}-lijn, voor een fractie van de actieve rekenkracht.
Houd het label aan die zin vast. Dit zijn Alibaba's eigen evaluaties, uit Alibaba's eigen testopstelling, in het geval van de preview één dag oud en voor beide niet gerepliceerd. De KGP Talkie-architectuuranalyse die voor deze matchup hoog scoort, komt tot dezelfde vorm van conclusie, maar werkt vanuit hetzelfde leveranciersblad. Een leverancierstabel is een belofte; niets in deze paragraaf is onafhankelijk bevestigd.
Wat de 27B heeft dat Flash-Next niet heeft: bewijs
Dit is waar de wedstrijd ophoudt eenzijdig te zijn. Qwen3.8-27B is twee weken openbaar geweest, en de gemeenschap heeft drie onafhankelijke gegevenspunten opgeleverd. Op Arena.ai's Image-to-WebDev leaderboard — blinde menselijke stemmen over welke van twee geanonimiseerde outputs een kijker liever zou uitbrengen — staat de 27B op #1 onder open modellen en #7 in het algemeen met een gerapporteerde score van 1,574. Op het zusterboard Code Arena WebDev staat het op #9 in het algemeen met 1,595, het enige model in zijn grootteklasse binnen de top tien. Harvey, het legal-AI-bedrijf, en Engram voerden een synthetische advocatenkantoorstudie uit die een aangepaste 27B bovenaan hun legal-agent benchmark plaatste — met de kanttekening dat het model de testcorpus van tevoren had bestudeerd, wat het een demonstratie maakt van de marge voor fine-tuning in plaats van een score voor de standaardgewichten. AMD publiceerde doorvoermetingen van dag-0: 24,5 tokens/s op een Ryzen AI Max+ 395 en 51,8 tokens/s op een Radeon AI PRO R9700. Geen van deze is een algemene kwaliteitsscore — er is nog steeds geen Artificial Analysis-index voor de 27B — maar elk is een derde partij die het model daadwerkelijk heeft gedraaid.
Qwen3.8-Flash-Next heeft daar niets van. Het hele benchmarkoverzicht is van Alibaba, op het moment van schrijven slechts een paar uur oud, en geen enkel onafhankelijk lab heeft ook maar één rij gereproduceerd. Dat is geen beschuldiging; het is de definitie van een dag oude release. Maar het is precies de asymmetrie die de keuze zou moeten bepalen: de preview loopt voorop op de enige cijfers die bestaan, en elk van die cijfers is geschreven door de leverancier die wil dat je het gelooft.
De deployment fork
Het praktische verschil tussen deze twee modellen is waar de parameters zich bevinden, en dat bepaalt welke hardware je nodig hebt. Qwen3.8-Flash-Next verplaatst zijn 51B N-gram-embeddingtabel doelbewust naar het hostgeheugen, waar deze asynchroon kan worden vooraf opgehaald — dat is de reden dat het 51B parameters aan capaciteit toevoegt zonder extra rekenwerk per token. Het gevolg is dat het model niet in een 24GB-consumentenkaart past zoals een lokale Qwen eerder paste. De community schat een Q4 GGUF op ongeveer 82GB totaal (ongeveer 58GB aan hoofdgewichten plus de 24GB-opzoektabel), de FP8-build op rond 186GB, BF16 op rond 360GB; het werkende recept is een machine met circa 96GB systeem-RAM plus elke GPU die de actieve 6B draait. De beloning is dat het rekenwerk per token goedkoop is — de hele gok van de architectuur — en lange 1M-tokencontext blijft betaalbaar omdat de GDN-lagen geschiedenis comprimeren in plaats van de KV-cache te laten groeien.
Qwen3.8-27B is het model precies andersom: dense, dus elke token verwerkt alle 27B parameters, maar klein genoeg om in zijn geheel te passen op hardware die je al bezit. De BF16-gewichten zijn ongeveer 55,6 GB; met 4-bit draait het op een 24GB-kaart zoals een RTX 3090 of 4090, en de metingen van AMD laten zien dat het tussen de 24,5 en 51,8 tokens/s haalt op AI Max-class- en Radeon PRO-hardware. Als de randvoorwaarde een enkele workstation is, is de 27B degene die daadwerkelijk past; als de randvoorwaarde de kosten per token op schaal betreft, wint Flash-Next op papier.
De prijsvork
De API-prijzen vertellen hetzelfde verhaal van de andere kant. {{1}}Qwen3.8-27B is vandaag live op OrcaRouter voor $0,33 per miljoen invoertokens en $2,40 per miljoen uitvoertokens, de lijstprijs van de provider wordt zonder opslag doorberekend — de self-host-optie is aanroepbaar gemaakt, je hoeft geen GPU te kopen.{{/1}} {{2}}Qwen3.8-Flash-Next wordt nog nergens gerouteerd: de open gewichten zijn de enige weg totdat de productie-Qwen3.8-Flash live gaat op de QwenCloud API tegen de aangekondigde $0,16/$0,47.{{/2}} {{3}}Wanneer die API opent, zorgt dezelfde doorberekening ervoor dat de $0,16/$0,47-prijs dezelfde dag aan onze kant staat, op dezelfde key als de 27B, met automatische failover ertussen — dus de manier om een architectuur van één dag oud te adopteren is niet om je productie erop te baseren, maar om er een deel van het verkeer naartoe te sturen met het bewezen model als fallback.{{/3}} {{4}}Een routinglaag kan ook voor een model worden geplaatst dat je zelf host, wat de praktische manier is om vandaag de open gewichten van Flash-Next te evalueren zonder een tweede integratie.{{/4}}

Welke moet ik uitvoeren?
Kies Qwen3.8-Flash-Next als je nu de Qwen4-richting wilt volgen, als je workload volume hoog genoeg is dat $0.16/$0.47 tegenover $0.33/$2.40 een reëel getal is, of als je het RAM-geheugen hebt om het zelf te hosten en je prettig voelt bij een leverancierssheet. Kies Qwen3.8-27B als je Apache-2.0-voorwaarden nodig hebt, een enkele 24GB-kaart, een model dat je vandaag kunt aanroepen, of enige mate van onafhankelijk bewijs — het is de enige van de twee die door iemand buiten Alibaba is gedraaid.

De twee bovenstaande afbeeldingen zijn het publieke gezicht van elke helft: de OrcaRouter-pagina waar Qwen3.8-27B vandaag aanroepbaar is voor $0,33/$2,40, en de modelkaart van Qwen/Qwen3.8-Flash-Next op Hugging Face.
{{1}}En de eerlijke afsluiting is een vraag, omdat de bewijsbasis één dag oud is: kan een model dat 6 miljard van zijn parameters activeert een 21-van-22 sweep behouden onder onafhankelijke replicatie, of is de N-gram-tabel die het slank laat draaien ook hetgene dat faalt bij echte workloads?{{/1}} {{2}}De 27B heeft al twee weken publieke controle overleefd. Flash-Next is waar de 27B twee weken geleden was{{/2}} — wat het beste argument is om ze naast elkaar te draaien in plaats van te kiezen.
