Qwen3.8-Flash-Next mot Qwen3.8-27B — Qwen4-preview-MoE:n mot open-weights-arbetshästen. Regenererad illustration.
Guides & Insights

Qwen3.8-Flash-Next vs Qwen3.8-27B: MoE-modellen Qwen4-preview mot arbetshästen med öppna vikter

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Det överraskande med Qwen3.8-Flash-Next är inte att Alibaba hävdar att en modell som endast aktiverar 6 miljarder parametrar per token slår de flesta öppna modellerna – det är att serveringen kräver mer minne än den 27-miljarder-parameter täta modellen som den jämförs med. Qwen3.8-Flash-Next, som släpptes med öppen källkod den 26 augusti 2026 som Qwen4-arkitekturs förhandsversion, lagrar en 51-miljarder-parameter N-gram-uppslagstabell i system-RAM i stället för i VRAM; Qw​en3.8-27B, den Apache-2.0 multimodala täta modellen som släpptes i mitten av augusti och är arbetshästen för öppna vikter i den nuvarande Qw​en 3.8-generationen, får plats på ett enda 24GB-grafikkort i 4-bit. På Alibabas egen benchmarklista slår den nya MoE-modellen 27B-modellen i 21 av 22 jämförda benchmarks. När det gäller oberoende bevis – arenaplaceringar, en juridisk-agentstudie, tredjepartsmätningar av genomströmning – är 27B-modellen den enda av de två som har något. Den kombinationen är hela beslutet.

Matchen i en rad: två open-weight-modeller med text- och bildstöd från samma generation, samma inbyggda kontext på 262K, båda designade för att köras utanför ett datacenter — och åtskilda av arkitektur, licens, pris och hur mycket av deras historia som är verifierad. Qwen3.8-Flash-Next är den glesa MoE-modellen som förhandsvisar allt Qwen4 förväntas ärva. Qw​en3.8-27B är den täta modellen som komprimerar vad Alibaba lärde sig när de byggde flaggskeppet på 2,4T till något som en enskild GPU kan köra. Att välja mellan dem handlar mindre om kapacitet — Alibaba säger att förhandsvisningen ligger före — och mer om huruvida du litar på ett en dag gammalt leverantörsdokument framför en modell som redan har plockats isär av communityn.

Resultattavlan

Källhänvisning först: alla siffror för Qwen3.8-Flash-Next nedan är Alibabas egna, ett dygn gamla och inte oberoende reproducerade. Qwen3.8-27B:s toppresultat i benchmark är också rapporterade av Alibaba, men 27B har oberoende resultat — placeringar i human-preference-arenor, en juridisk domänstudie och AMD-genomströmningsmätningar — som förhandsversionen inte kan matcha.

• Totala parametrar — Qwen3.8-Flash-Next: 125B MoE + 51B N-gram + MTP (~180B lagrade), 6B aktiva. Qwen3.8-27B: ~27B dense (28B med bildkodare), alla aktiva.

• Arkitektur — Qwen3.8-Flash-Next: Qwen4-förhandsversion — Qwen Sparse Attention växelvis med Gated DeltaNet, gated residual, N-gram-inbäddningar, Muon-tränad. Qwen3.8-27B: 48 GDN linjära attention-lager plus 16 full-attention-lager (3:1), tät.

• Kontext — både 262 144 tokens nativt och utbyggbar till 1M via YaRN.

• Modalitet — båda accepterar text, bild och video som inmatning och returnerar text.

• Licens — Qwen3.8-Flash-Next: qwen-community-1.0. Qw​en3.8-27B: Apache 2.0.

• Pris — Qwen3.8-Flash-Next: 0,16 USD / 0,47 USD per 1M (tillkännagiven; produktions-API ännu inte öppet). Qwen3.8-27B: 0,33 USD / 2,40 USD per 1M, live idag.

• Körningsfotavtryck — Qwen3.8-Flash-Next: 51B-tabell i värdminne, ~96GB systemminne plus eventuell GPU; FP8 ~186GB, Q4 GGUF ~82GB. Qw​en3.8-27B: BF16 ~55.6GB, 4-bit får plats på ett 24GB-kort.

• Oberoende belägg — Qwen3.8-Flash-Next: ännu inga. Qw​en3.8-27B: #1 öppen modell på Arena.ai Image-to-WebDev, #9 totalt på Code Arena WebDev, #1 med öppna vikter på Harvey's Legal Agent benchmark, AMD-mätt genomströmning.

A two-column comparison scoreboard titled 'Qwen3.8-Flash-Next vs Qwen3.8-27B — the scoreboard': left column Qwen3.8-Flash-Next with Params '125B MoE + 51B N-gram', Active per token '~6B', Architecture 'Qwen4 preview', Context '262K native / 1M via YaRN', Price '$0.16 / $0.47 per 1M', Independent score 'none yet'; right column Qwen3.8-27B with Params '27B dense', Active per token '27B (all)', Architecture 'GDN hybrid, current gen', Context '262K native / 1M via YaRN', Price '$0.33 / $2.40 per 1M', Independent score '#1 open Image-to-WebDev'; footer 'Flash-Next figures vendor-reported, unreproduced; 27B independent per Arena.ai, vendor figures Alibaba-reported'; the OrcaRouter logo is composited in the bottom-right corner.

Enligt Alibabas egna siffror vinner förhandsvisningen nästan allt.

Alibabas publicerade jämförelse ger Qwen3.8-Flash-Next likvärdiga eller bättre poäng på 21 av 22 språk- och visionsbenchmarks mot Qwen3.8-27B, och vinsterna är inte kosmetiska. SWE-bench Pro 62,5 mot 61,7 är en marginell ledning, men DeepSWE 58,7 mot 42,2, JobBench 55,7 mot 33,4 och CoWorkBench 73,9 mot 70,7 är verkliga luckor på exakt de agentiska och kontorsarbetsbelastningar som flash-nivån riktar sig mot. Förhandsvisningens rubriksiffror — LiveCodeBench v6 91,9, GPQA Diamond 91,7, MathVision 95,7 — överträffar också 27B:ns motsvarande rader i Alibabas tabell. Detta är releasens tes uttryckt som data: det mesta av resonemangs- och kodningsförmågan hos den större Qwen 3.8-linjen, till en bråkdel av den aktiva beräkningskraften.

Behåll etiketten på den meningen. Detta är Alibabas egna utvärderingar, från Alibabas egen testmiljö, en dag gamla i förhandsvisningens fall och inte replikerade för båda. KGP Talkies arkitekturgenomgång som rankas för denna matchning når samma slags slutsats, men den utgår från samma leverantörsblad. En leverantörstabell är ett löfte; ingenting i detta stycke har bekräftats oberoende.

Vad 27B har som Flash-Next inte har: bevis

Det är här som matchen slutar vara ensidig. Qw​en3.8-27B har varit ute i det fria i två veckor, och communityn har producerat tre oberoende datapunkter. På Arena.ai:s Image-to-WebDev-leaderboard — blinda mänskliga röster om vilket av två anonymiserade resultat en tittare hellre skulle skicka i väg — rankas 27B:an som #1 bland öppna modeller och #7 totalt med rapporterade 1 574 poäng. På systerlistan Code Arena WebDev ligger den på #9 totalt med 1 595, den enda modellen i sin storleksklass inom topp tio. Harvey, det juridiska AI-företaget, och Engram genomförde en studie med en syntetisk advokatbyrå som placerade en anpassad 27B:a överst i deras benchmark för juridiska agenter — med förbehållet att modellen hade studerat testkorpusen i förväg, vilket gör det till en demonstration av finjusteringspotential snarare än ett betyg på standardvikterna. AMD publicerade Day-0-genomströmningsmätningar: 24,5 tokens/s på en Ryzen AI Max+ 395 och 51,8 tokens/s på en Radeon AI PRO R9700. Ingen av dessa är ett generellt kvalitetsbetyg — det finns fortfarande inget Artificial Analysis-index för 27B:an — men var och en är en tredje part som faktiskt körde modellen.

Qwen3.8-Flash-Next har inget av detta. Hela dess benchmarktabell är Alibabas, bara timmar gammal vid skrivande stund, och inget oberoende labb har reproducerat en enda rad. Det är inte en anklagelse; det är definitionen av en dagsgammal release. Men det är just den asymmetrin som bör styra valet: förhandsversionen ligger före på de enda siffror som finns, och var och en av dessa siffror har skrivits av leverantören som vill att du ska tro på det.

Distributionsgaffeln

Den praktiska skillnaden mellan dessa två modeller är var parametrarna finns, och det avgör vilken hårdvara du behöver. Qwen3.8-Flash-Next flyttar medvetet sin 51B N-gram-inbäddningstabell till värdminnet, där den kan förhämtas asynkront — det är därför den lägger till 51B parametrar i kapacitet utan att öka beräkningskostnaden per token. Konsekvensen är att modellen inte får plats på ett 24 GB konsumentkort så som en lokal Qw​en har fått plats tidigare. Communityns uppskattningar anger en Q4 GGUF till totalt cirka 82 GB (ungefär 58 GB huvudvikter plus 24 GB uppslagningstabell), FP8-versionen runt 186 GB, BF16 runt 360 GB; det fungerande upplägget är en maskin med i storleksordningen 96 GB system-RAM plus valfri GPU som kör de aktiva 6B. Belöningen är att beräkningskostnaden per token är låg — arkitekturens hela satsning — och en lång kontext på 1M token förblir överkomlig eftersom GDN-lagren komprimerar historiken istället för att KV-cachen växer.

Qwen3.8-27B är modellen tvärtom: tät, så varje token kör alla 27B parametrar, men tillräckligt liten för att hela grejen ska få plats på hårdvara du redan äger. BF16-vikterna är ungefär 55,6 GB; i 4-bit körs den på ett 24 GB-kort som ett RTX 3090 eller 4090, och AMDs mätningar visar att den gör 24,5 till 51,8 tokens/s på AI Max-klass och Radeon PRO-hårdvara. Om begränsningen är en enskild arbetsstation är 27B den som faktiskt får plats; om begränsningen är kostnad per token i skala är Flash-Next den som vinner på pappret.

Prisgaffeln

API-priserna berättar samma historia från den andra sidan. Qw​en3.8-27B är live på OrcaRouter idag till $0.33 per miljon inmatningstokens och $2.40 per miljon utmatningstokens, leverantörens listpris förs vidare utan påslag — det självhostade alternativet görs anropsbart, ingen GPU att köpa. Qwen3.8-Flash-Next är inte dirigerad någonstans ännu: de öppna vikterna är den enda vägen tills produktionsversionen av Qwen3.8-Flash öppnas på QwenCloud API till de annonserade priserna $0.16/$0.47. När det API:et öppnas, ger samma vidareföring oss priset $0.16/$0.47 samma dag, på samma nyckel som 27B, med automatisk failover mellan dem — så sättet att anta en dagsgammal arkitektur är inte att satsa produktion på den, utan att peka en del av trafiken mot den med den beprövade modellen som fallback. Ett routinglager kan också ligga framför en modell som du själv betjänar, vilket är den praktiska vägen att utvärdera de öppna vikterna i Flash-Next idag utan en andra integration.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-27b (captured August 27, 2026), showing the model name 'Qwen3.8 27B', model id 'qwen/qwen3.8-27b', Vision/Tools/JSON/Reasoning tags, 'by Qwen - 2026-08-13', pricing $0.33 input and $2.40 output per 1M tokens, a p50 TTFT of 1.63s, the description 'Qwen3.8-27B is Alibaba's open-weight 27B dense multimodal model, released under Apache-2.0 and self-hosted on OrcaRouter's own infrastructure', and the OpenAI-compatible endpoint note.

Vilken ska köras?

Välj Qwen3.8-Flash-Next om du vill följa Qwen4-riktningen nu, om din arbetsbelastning är tillräckligt högvolym för att $0.16/$0.47 mot $0.33/$2.40 ska vara en verklig siffra, eller om du har RAM-minne för att self-hosta den och är bekväm med en leverantörslista. Välj Qw​en3.8-27B om du behöver Apache-2.0-villkor, ett enda 24GB-kort, en modell du kan anropa idag, eller någon grad av oberoende bevis – det är den enda av de två som har körts av någon utanför Alibaba.

A screenshot of the Hugging Face model card for Qwen/Qwen3.8-Flash-Next (captured August 27, 2026), showing the Image-Text-to-Text tag, the qwen4_exp library tag, the description stating compatibility with Hugging Face Transformers, vLLM, SGLang, and TokenSpeed, and that Qwen3.8-Flash is the official production version with 1M context by default, plus the license 'qwen-community-1.0' and model size 180B params.

De två bilderna ovan är de publika ytorna för vardera halvan: OrcaRouter-listningen där Qw​en3.8-27B är anropsbar idag till $0.33/$2.40, och Qwen/Qwen3.8-Flash-Next-modellkortet på Hugging Face.

Och det ärliga slutet är en fråga, eftersom evidensbasen är en dag gammal: kan en modell som aktiverar 6 miljarder av sina parametrar behålla en 21-av-22-svepning under oberoende replikering, eller är den N-gramtabell som gör att den serverar resurssnålt också det som misslyckas på verkliga arbetsbelastningar? 27B har redan överlevt två veckors granskning av communityn. Flash-Next är där 27B var för två veckor sedan – vilket är det bästa argumentet för att köra dem sida vid sida snarare än att välja.