
Qwen3.8-Flash-Next är ute: Alibaba levererar Qwen4-arkitekturen innan Qwen4 finns
- OrcaNYOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1M tokens · 84 tok/s
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 122 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 354 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
Qwen3.8-Flash-Next har äntligen siffror som Alibaba inte har tagit fram – och de säger inte vad den mest högljudda versionen av historien säger. På Artificial Analysis Intelligence Index, omräknat till v4.3 den 7 september, får Alibabas förhandsversion med öppna vikter 40 poäng och rankas som femma bland de 113 modellerna i sin jämförelseklass. DeepSeek V4 Flash 0731 (Reasoning, Max Effort) – modellen som den ständigt mäts mot – får 35 poäng och rankas som nia. Det är inte jämbördighet; det är en ledning med fem poäng för den mindre modellen. Det är också den första breda, oberoende resultattavlan som når en modell vars enda publicerade siffror fram till denna månad var leverantörens egna. Själva modellen är inte ny: vikterna släpptes på Hugging Face den 24 augusti och den formella ModelScope-lanseringen kom den 26 augusti. Det som har förändrats denna månad är att en läsare nu kan kontrollera påståendena i stället för att bara ta dem för givna.
Uppmaningen att återvända till det här inlägget kom från @teortaxesTex på X, som frågade om förhandsversionen i tysthet är underskattad: påstås ligga på samma Artificial Analysis-nivå som DeepSeek V4 Flash 0731, "nästan 4x mindre", med "nästan 3x färre aktiva parametrar". Två av dessa tre påståenden tål inte kontakten med de publicerade uppgifterna – och korrigeringen är till modellens fördel, för enligt de siffror som spelar roll ligger förhandsversionen före sin jämförelse, inte i nivå med den.
Börja med storleken, där siffrorna är entydiga. Qwen3.8-Flash-Next lagrar ungefär 180B parametrar — en mixture-of-experts-kropp på 125B, en separat n-gram-inbäddningstabell på 51B och ungefär 4B multi-token-prediction-lager — och aktiverar 6B av dem per token. DeepSeek V4 Flash 0731 lagrar 284B och aktiverar 13B. Det är siffrorna på Qwens modellkort och DeepSeeks dokumentation, och det är siffrorna som Artificial Analysis anger på båda modellsidorna. Kvoterna de ger är 1,6x för lagrade parametrar och 2,2x för aktiva parametrar. Det är en genuin effektivitetshistoria, och det är anledningen till att denna arkitektur spelar roll — men det är inte 4x och inte 3x. Vi kunde inte hitta någon publicerad siffra någonstans som stöder de större multiplikatorerna. Om avsikten var det serverade minnesavtrycket snarare än parameterantalet, är inte heller den siffran publicerad.
Vad som tillkännagavs
Alibaba publicerade Qwen4-arkitekturen innan en Qwen4-modell publicerades. Qwen3.8-Flash-Next – en multimodal mixture-of-experts-modell med öppna vikter byggd på nästa generations arkitektur som kommer att driva Qwen4-familjen – släpptes i två steg: det officiella Qwen/Qwen3.8-Flash-Next-repot gick live på Hugging Face den 24 augusti, två dagar före ModelScope-släppet som teaser-timern hade pekat på. Det formella ModelScope-släppet landade den 26 augusti kl. 23:00 UTC+08:00, där den serverade varianten Qwen3.8-Flash prissattes samtidigt. Modellkortets huvudpåstående, som har cirkulerat sedan dess, är att en modell som aktiverar 6B parametrar per token slår Claude Opus 4.6 Max på 8 av 9 jämförbara benchmarks i Alibabas egen tabell. Hela Qwen4-familjen, fortsätter Alibaba att säga, kommer senare.
Om du inte har följt Alibabas utgivningstakt den här månaden är ankaret Qwen3.8-Max – flaggskeppet med 2,4 biljoner parametrar som släpptes den 3 augusti och gjordes tillgängligt med öppen källkod under namnet Qwen3.8-2.4T-A95B mindre än två veckor senare. Vikterna för Qwen3.8-Flash-Next är ute mindre än en månad därefter. Samma labb som släppte en modell med öppna vikter och 2,4 biljoner parametrar delar nu ut arkitekturen för generationen efter den, innan flaggskeppet för den generationen ens har fått ett namn.

Det som är värt att läsa om är Alibabas egen inramning. Modellen beskrivs som byggd på nästa generations arkitektur ”som kommer att driva den kommande Qwen4-familjen” – och uttryckligen inte som Qwen4 i sig. Alibabas angivna skäl är att arkitekturändringarna bör vara i communityns händer innan familjen anländer, så att runtime-miljöer, kvantiseringar och applikationer är redo när den riktiga versionen släpps. Det är en marknadsföringsposition, men det är också ett tekniskt åtagande: förhandsvisa det svåra först, ta med communityn.
Vad modellkortet fastställer, och vad det inte gör:
Bekräftat, enligt det officiella modellkortet: Qwen3.8-Flash-Next är open-weight, multimodal och en mixture-of-experts-modell baserad på Qwen4-arkitekturen — kortet kallar det "en experimentell förhandsvisning av arkitekturen som kommer att ligga till grund för Qwen4."
Bekräftat, enligt modellkortet och konfigurationen: två huvudsakliga arkitekturförändringar — Gated Delta Network (GDN) och Qwen Sparse Attention (QSA) — i en hybrid med 48 lager som kör 36 linjära uppmärksamhetslager mot 12 fulla uppmärksamhetslager.
• Bekräftat från repositoriet: 125B totala parametrar med 6B som aktiveras per token (512 experter, 10 routade plus en delad) — Artificial Analysis listar 180B när den separata 51B n-gram-inbäddningstabellen och MTP-lagren räknas in — med en inbyggd kontext på 262 144 token som kan utökas till 1 000 000 under Qwen Community License 1.0.
• Inte längre obekräftad: modellen har nu utvärderats oberoende, två gånger om. Alibabas tabell är fortfarande leverantörens egen och fortfarande inte reproducerad, men den är inte längre det enda beviset i rummet.
De första oberoende betygen är inne – och de säger ”före”, inte ”jämnt”
Artificial Analysis släppte Intelligence Index v4.3 den 7 september, och ompoängsättningen är anledningen till att något av detta över huvud taget är jämförbart. Uppdateringen till v4.3 ersatte Terminal-Bench v2.1 med den mycket svårare Terminal-Bench v4.0 och bytte ut τ³-Banking mot AutomationBench-AA, ett agentiskt arbetsflödesbenchmark byggt med Zapier på en privat undanhållen testuppsättning med 657 uppgifter. Viktningen för privat undanhållen data steg till 45 %. Det angivna syftet var att stoppa frontlinjen från att manipulera indexet, och effekten på poängen var stor: GPT-6 Astra och Claude Fable 5.1, de två ledarna, landade båda på 53 efter att ha poängsatts i sextiointervallet på den gamla skalan.
Det spelar roll när du läser siffrorna från communityn. Siffrorna "56 mot 52" som cirkulerade för Qwen3.8-Flash-Next och DeepSeek V4 Flash 0731 i början av september beräknades på indexet före v4.3; under v4.3 ligger paret på 40 och 35. Att ställa den ena uppsättningen mot den andra är att jämföra två olika prov.
På det aktuella indexet ser det ut så här när de två modellerna faktiskt jämförs i Artificial Analysis egna utvärderingar:
• Intelligensindex — Qwen3.8-Flash-Next 40 (5:e av 113 i klassen) vs DeepSeek V4 Flash 0731 (Resonemang, Maximal ansträngning) 35 (9:e av 113).
• Agentiskt kunskapsarbete — AA-Briefcase 1587 mot 1259; GDPval-AA v2 1647 mot 1468; AutomationBench-AA 56 % mot 54 %.
• Terminal och kodning – Terminal-Bench v4.0 25 % mot 12 %; SciCode 51 % mot 50 %.
• Allmänt och vetenskapligt resonemang — Humanity's Last Exam 38 % mot 39 %; CritPt 11 % mot 17 %; GDP.pdf 16 % mot 11 %; AA-LCR v1.1 80 % mot 80 %.
• Faktaåtergivning kontra konfabulation – AA-Omniscience −10 mot −14, ett försprång på fyra punkter för Qwen-förhandsvisningen.
• Pris — 0,15 $ per miljon indata / 0,47 $ per miljon utdata jämfört med 0,44 $ / 1,32 $; blandat pris 0,0882 $ per miljon tokens jämfört med 0,2298 $. Kostnad per uppgift i Intelligence Index: 0,37 $ jämfört med 0,22 $.
• Hastighet och latens — 53 utdatatokens per sekund mot 210; tid till första token 2,80s mot 0,98s; svarstid från början till slut 49,76s mot 12,88s; tid per uppgift 1 572,60s mot 221,65s.
• Tokenanvändning — 108k utdatatoken per uppgift jämfört med 62k, varav 72k är resonemangstoken jämfört med 45k. Artificial Analysis kallar förhandsversionen "mycket ordrik" och "långsammare än genomsnittet."
• Kontext och storlek — 256k tokens mot 1 000k; 180B totalt / 6B aktiva mot 284B / 13B.
Läst tillsammans är det ett skarpare svar än "samma nivå". Qwen3.8-Flash-Next vinner argumentet om noggrannhet och effektivitet på nästan varje axel som Artificial Analysis mäter — det är den högre poängsatta modellen, den är mindre, och den kostar ungefär en tredjedel så mycket per token. DeepSeek V4 Flash 0731 vinner produktionsargumentet direkt: fyra gånger genomströmningen, en fjärdedel av den totala svarstiden, sju gånger mindre väggklockstid per slutförd uppgift, och fyra gånger kontextfönstret. Och vad gäller kostnaden per slutförd uppgift — siffran som överlever token-verbositet — är DeepSeek den billigare modellen till $0.22 mot $0.37, trots det högre listpriset. Om "underhypad" betyder "bättre än sitt rykte vad gäller kvalitet per parameter", är etiketten rättvis. Om det betyder "du borde köra detta i stället", säger hastighets- och latenskolumnerna något annat.

Det finns oberoende bevis utanför Artificial Analysis också. Ett testramverk från tredje part, smf-bench, publicerade en "Official A"-körning den 5 september: Qwen3.8-Flash-Next i NVIDIAs NVFP4-kvantisering på en enda DGX Spark, med tänkandet avstängt, fick 137 av 157 (87,3 %) med 30 av 30 utan fel i sin kodningsdel, mot 117 av 157 för en körning med DeepSeek V4 Flash Vision-Exp på två Spark i samma 157-testramverk. Det är ett testramverk på en maskinklass, och det är ingen ersättning för en bred utvärdering — men det är en andra datapunkt som pekar i samma riktning, och den kommer från någon som inte har något egenintresse i någon av leverantörerna.
Vad Qwen4-arkitekturen faktiskt är
Två mekanismer bär upp berättelsen. Den första, GDN – Gated Delta Network – är Alibabas linjära attention-lager. Medan en standardtransformer har en key-value-cache som växer med sekvenslängden, håller ett GDN-lager ett återkommande tillstånd av fast storlek och uppdaterar det med en inlärd gating-regel; härstamningen går via DeltaNet och Mamba-2. Vinsten är den som i tysthet har drivit Qwen-serien sedan Qwen3-Next: långa kontexter förblir billiga eftersom tillståndet inte växer, medan en minoritet av full-attention-lager finns kvar i mixen för att göra den precisa hämtning som linjär attention är dålig på. I den nuvarande generationen ligger den mixen på ungefär tre GDN-lager för varje full-attention-lager – en analys från communityn av checkpointen Qwen3.8-2.4T-A95B räknar 69 GDN-lager mot 23 attention-lager. Qwen3.8-Flash-Next visar samma tre-till-ett-fördelning: 36 linjära attention-lager mot 12 full-attention-lager.
Den andra, QSA — Qwen Sparse Attention — är den genuint nya pusselbiten, och den offentliga beskrivningen av den är fortfarande tunn: modellkortet tillägger att den arbetar på mikroblocksnivå med en budget på 512 block / 2048 tokens, men det finns ännu ingen fullständig teknisk redogörelse. Bristen på detaljer är i sig en del av mönstret. Qwen3-Nexts förhandsvisning i slutet av 2025 introducerade Gated DeltaNet med samma tunna dokumentation, och arkitekturen blev fullt specificerad först när Qwen3.5-serien antog den. För en läsare är den praktiska slutsatsen densamma båda gångerna: arkitekturkanariefågeln dyker upp först, dokumentationen och produktionsmodellerna dyker upp efteråt.
Spelboken som redan fungerade en gång
Alibaba har kört exakt samma manöver tidigare, och det fungerade. I slutet av 2025 förhandsvisade Qwen3-Next Gated DeltaNet och en hybrid av linjär och full uppmärksamhet. När Qwen3.5-serien släpptes antog den den ritningen i stor skala – och hybriden har följt med genom Qwen3.8-generationen sedan dess, inklusive flaggskeppet på 2,4T. Anledningen till att precedensen spelar roll här är den timing den antyder. Hela Qwen4-familjen bör förväntas på andra sidan av denna förhandsvisning, inte inuti den; om Qwen3-Next-gapet är någon vägledning, mäts avståndet mellan "här är arkitekturen" och "här är familjen" i månader. Ingenting i modellkortet bekräftar det – det är en slutsats från ett mönster som Alibaba nu har kört två gånger.
Det vi fortfarande inte vet
De okända har krympt, men de har inte försvunnit:
• Leverantörens benchmarktabell är fortfarande leverantörens. Artificial Analysis har nu bedömt modellen oberoende, vilket löser den största luckan i lanseringsrapporteringen – men Alibabas eget huvudpåstående, att modellen slår Claude Opus 4.6 Max i 8 av 9 jämförbara benchmarks, vilar på Alibabas egna interna utvärderingar (CoWorkBench, JobBench, AndroidWorld) tillsammans med offentliga sådana, och ingen av dem har reproducerats av en tredje part.
• Huruvida förhandsvisningen är samma modell som den serverade. Kortet framställer Qwen3.8-Flash-Next som den experimentella förhandsvisningen med öppna vikter, medan den serverade produktionsvarianten — Qwen Clouds Qwen3.8-Flash — lägger till en standardkontext på 1 000 000 tokens och inbyggda verktyg. Huruvida den serverade modellen är samma arkitektur under ett större kontextfönster har fortfarande inte angetts, och de oberoende poängen ovan gäller förhandsvisningen med öppna vikter, inte den serverade API-modellen.
• Licensen är känd och är en riktig licens: Qwen Community License 1.0 tillåter kommersiell användning, inklusive försäljning av derivatverk, men kräver ett separat kommersiellt avtal med Alibaba om du driver en Model-as-a-Service- eller AI-arbetsassistentverksamhet som överskrider ett definierat tröskelvärde för intäkter och månadsaktiva användare. Den är inte samma som den intäktsgränsade Qwen3.8-Max-licensen, men den är värd att läsa innan man bygger på vikterna.
• En fältrapport värd att flagga: en sammanställning från 6 september av ett communitybygge med NVFP4 loggar ett fel vid grammatikbegränsade verktygsanrop när både tänkande och multi-token-prediktion är aktiverade, spårat till xgrammars väg för constrained decoding. Det är en runtime-bugg i ett kvantiserat communitybygge snarare än en egenskap hos modellen – men om ditt utvärderingsramverk förlitar sig på grammatikbegränsade verktygsanrop är det det första du bör testa.
En familj som arbetar i en tvåveckorscykel
Den omgivande takten är en historia för sig. Qwen3.8-Max, flaggskeppet med 2,4 biljoner parametrar, släpptes den 3 augusti; Qwen3.8-2.4T-A95B med öppna vikter följde den 12–13 augusti; den fria Apache-2.0-modellen Qwen3.8-27B dök upp dagar senare; och nu, innan månaden är slut, förhandsvisas nästa generations arkitektur – och oberoende benchmarkas en vecka senare. Inget annat labb itererar för närvarande i den här takten. För en läsare som väljer modeller är den praktiska konsekvensen att "den bästa Qwen" är ett rörligt mål – och deltat mellan generationer kommer snabbare än det omgivande ekosystemet vanligtvis anpassar sig. Att köpa ett beslut i stället för en modell är i allt högre grad det försvarbara draget.
Vad en utvecklare bör göra nu
Effektivitetssiffrorna förändrar kalkylen för lokal serving mer än lanseringen i sig gjorde. En 6B-aktiv modell som får 40 på det aktuella indexet är komprimerbar: NVIDIAs officiella NVFP4-kvantisering är den som smf-bench-körningen den 5 september använde, och community-byggen för NVFP4 och FP8 utöver den finns redan i omlopp, vilket är det som över huvud taget gör en driftsättning i single-GPU-klass av en 180B-lagrad modell rimlig. Förbehållet är oförändrat – detta är en obeprövad förhandsversion, leverantörens tabell har inte reproducerats, och formen på de oberoende resultaten (stark på kunskapsarbete och terminaluppgifter, svagare på långsiktig repogenerering och passeringsfrekvens för one-shot-agenter) innebär att modellens svagheter visar sig exakt där produktionskodändringar finns. Kör en kopia med låg risk av en verklig arbetsbelastning mot den innan den rör något som spelar roll, och låt automatisk failover absorbera stunderna då en förhandsversion beter sig illa.
När det gäller priset är bilden som var grumlig vid lanseringen nu konkret. Artificial Analysis listar förhandsversionens serverade taxa till $0.15 per miljon indatatoken och $0.47 per miljon utdatatoken, mot $0.44 och $1.32 för DeepSeek V4 Flash 0731 — samma storleksordning som den serverade Qwen3.8-Flash-varianten, som Qwen Cloud listar till ¥1 och ¥3 (ungefär $0.16 och $0.47). Produktionsvarianten är den du faktiskt kan anropa i dag: den dirigeras hit som qwen/qwen3.8-flash, och OrcaRouter för vidare leverantörens listpris med 0 % påslag, så när Alibaba ändrar den siffran flyttas slutpunkten med samma dag. Detsamma gäller jämförelsemodellen i den här artikeln — DeepSeek V4 Flash 0731 dirigeras som deepseek/deepseek-v4-flash-0731 till leverantörens listpris, vilket gör kostnad-per-token-halvan av jämförelsen ovan testbar mot din egen trafik i stället för mot en benchmarks tokennummer. Det som inte dirigeras hit är själva Flash-Next-förhandsversionen med öppna vikter: för att använda den i dag får du hämta vikterna och servera dem själv, vilket är precis varför kvantiseringshistorien ovan är viktigare än listpriset. Taket som den här generationen måste klara är fortfarande synligt på samma slutpunkt: Qwen3.8-Max (qwen/qwen3.8-max) ligger på $2.00 per miljon indatatoken och $6.00 per miljon utdatatoken, också vidarebefordrat till leverantörens listpris.

Den praktiska sekvensen har inte förändrats särskilt mycket, men förtroendet bakom den har gjort det. Om du vill ha den serverade produktionsvarianten utan att hämta 100 GB vikter kan Qwen3.8-Flash redan anropas till listpris. Om du vill ha arkitekturen – GDN, QSA, n-gram-tabellen, offload-tricken – går vikterna att ladda ner och körmiljöerna är redo: vLLM serverar den från dag ett med en offload-väg som håller n-gram-inbäddningstabellen med 51B parametrar i värdminnet i stället för permanent VRAM, SGLang och TensorRT-LLM finns med på NVIDIAs Day 0-lista, och Ollamas bibliotek har ett MLX-bygge som du kan hämta på Apple Silicon. Det enda du bör sluta göra är att behandla modellen som en okänd faktor när det gäller kvalitet. Den har mätts nu, och den mätte väl.
Vad du ska titta på härnäst
• Huruvida de oberoende siffrorna står sig när indexet mognar. Qwen3.8-Flash-Nexts 40 kommer med en ovanligt hög tokennota — den brände 245M tokens i indexkörningen mot en median på 140M — och Artificial Analysis' egen anteckning kallar den för ”väldigt ordrik”. En poäng som produceras genom att resonera längre är fortfarande en poäng, men det är sådant som rör sig när utvärderingen ändras. Nästa indexrevidering är det verkliga testet på huruvida 40 var en nivå eller ett lokalt maximum.
• Huruvida den serverade Qwen3.8-Flash poängsätts separat. Varje oberoende siffra i den här texten avser förhandsversionen med öppna vikter. Produktionsvarianten med 1M-kontext och inbyggda verktyg har ingen egen oberoende poäng, och om det är samma arkitektur under en längre kontext är det en billig utvärdering som någon borde publicera.
• Hur väl day-0-servingstödet håller i praktiken — de leverantörsangivna genomströmningssiffrorna för GB300 är fortfarande leverantörsangivna, och konfigurationerna TP4 expert-parallel och KV-offload är fortfarande så nya att de är bräckliga.
• Hur länge väntar Alibaba innan hela Qwen4-familjen följer förhandsversionen.
Den del av den här historien som handlar om vad vi vet hittills har nu till stor del avslutats. Specifikationsbladet är offentligt, vikterna går att ladda ner, arkitekturen är bekräftad, den serverade Qwen3.8-Flash-varianten är live på hostade API:er till listpris, och modellen har oberoende betygsatts av två separata parter – där den mindre modellen vann kvalitetsargumentet och den större vann genomströmningsargumentet. Det som fortfarande är öppet är huruvida en förhandsversion med 6B aktiva parametrar generaliserar bortom de riktmärken den trimmades mot, och hur länge Alibaba väntar innan hela Qwen4-familjen följer efter. Den sista frågan är fortfarande den som släppet lämnar obesvarad, och det är fortfarande den som kommer att betyda mest.
Jämförda i den här artikeln2
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
