Qwen3.8-Flash-Next-utgåva — Inuti Alibabas Qwen4-arkitekturförhandsvisning. Regenererad illustration.
Guides & Insights

Qwen3.8-Flash-Next-släpp: Inuti Alibabas Qwen4-arkitekturförhandsvisning

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Det mest användbara dokumentet som Ali​baba publicerade den 26 augusti 2026 var inte presskitet – det var en teknisk rapport. Qwen3.8-Flash-Next, den öppna viktmultimodala mixture-of-experts-modellen som släpptes den dagen, kom tillsammans med en artikel med titeln "On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability," och rapporten är berättelsen. Den gör det som leverantörslanseringar nästan aldrig gör: den publicerar ablationerna, de negativa resultaten och träningsreceptsexperimenten, och drar sedan en linje från varje fynd till arkitekturen för Qwen4-familjen som denna modell är tänkt att förhandsvisa.

Vad som faktiskt levererades den 26 augusti

Själva modellen är blygsam enligt Qw​ens 2026-standarder, och det är avsiktligt. Qwen3.8-Flash-Next lagrar 125B huvudmodellparametrar plus en separat 51B n-gram-inbäddningstabell — ungefär 176B före en 4B-modul för multi-token-prediktion — men aktiverar endast 6B per token. Det är en mixture-of-experts-modell med 512 experter, top-10-routning och 48 lager, med inbyggd kontext på 262 144 tokens och utbyggbar till 1M via YaRN. Den tar emot text-, bild- och videoinmatning och genererar text. Vikterna finns på Hugging Face och ModelScope under qwen-community-1.0-licensen, och Ali​babas egen blogg kallar den ”en experimentell förhandsvisning av arkitekturen som kommer att ligga till grund för Qwen4” — samma roll som Qwen3-Next spelade för Qw​en3.5-serien, en kanariefågel som flyger före flaggskeppet.

Samma dag aktiverade Ali​baba den kommersiella motsvarigheten: en hanterad build som heter Qwen3.8-Flash på QwenCloud API för 0,16 USD per miljon inmatningstokens och 0,47 USD per miljon utmatning. De två är lätta att blanda ihop och värda att hålla isär. Qwen3.8-Flash-Next är förhandsversionen med öppna vikter som den tekniska rapporten analyserar; Qwen3.8-Flash är produktionsbygget för API:et, prissatt, med ett standardkontext på 1M-tokens och Open​AI- och Anthropic-kompatibla begärandeformat. Priset, riktmärkena och arkitekturargumenten härrör alla från samma teknik.

The official QwenLM/Qwen3.8-Flash-Next GitHub repository, showing the model card ('foundation model developed by Qwen Team, Alibaba Group'), 171 stars, and the tech_report.pdf file in the repository listing.

De fyra arkitektursatsningarna i teknikrapporten

Artikelns ryggrad är fyra satsningar om hur en frontier-modell med lång kontext och låg kostnad bör se ut, var och en med experimentellt stöd.

• Attention — GDN + QSA-hybrid. Tre av fyra lager använder Gated DeltaNet, ett linjärt attention-lager som komprimerar historien till ett rekurrent tillstånd av fast storlek istället för en KV-cache som växer med sekvenslängden. Det återstående lagret är Qw​en Sparse Attention, som aggregerar sekvensen till mikroblocker, poängsätter dem till låg kostnad och kör full attention endast på de regioner som är viktiga. Ali​baba rapporterar upp till 7.6× prefill-acceleration och 4.9× decode-acceleration vid 1M kontext; SGLang:s eget dag-0-benchmark mätte ännu högre, 10.2× och 6.6×. Vid en 90-procentig prefix-cache-träfffrekvens når prefill-genomströmningen 8.6× den för Qwen3.7-Plus. Dessa siffror är leverantörs- och partnerrapporterade, inte oberoende granskade.

• Residualström — Grindad residual. Den enda residualvägen breddas till fyra parallella grenar med elementvis dynamisk grindning, en Hyper-Connection-liknande flergrenad design med GatedNorm-liknande styrning. Grinden reglerar läs- och skrivoperationer per gren, vilket enligt rapporten undertrycker aktiveringsavvikelser och, i praktiken, gör att residualtillstånden kan lagras i FP8.

• Embedding — 51B n-gramtabellen. Istället för en embedding per token indexerar modellen en uppslagstabell på den aktuella token plus de föregående, och lagrar hela fraser och lokala mönster. Det kostar nästan ingenting per token, och eftersom uppslagsadresserna är kända i förväg kan tabellen leva i värdminnet och förhämtas asynkront, helt utanför GPU-minnet. Detta är tricket som gör att en 176B-lagrad kontrollpunkt kan köras på maskiner i 75GB-klassen, och det härrör från Gemma 3n:s lagervisa embeddings och Deep​Seek:s Engram.

• Optimering — Muon, finjusterad. Träningen använder Muon-optimeraren, en ortogonaliseringsbaserad momentummetod, tillämpad på tvådimensionella linjära avbildningar (attention, GDN och MoE-expertvikter) medan AdamW behålls för embeddingar, routern och lågrankade parametrar. Artikeln rapporterar också ett negativt resultat värt att läsa: batchstorleksuppvärmning togs bort efter att det visade sig kosta 18,8 % fler optimeringssteg utan att förbättra något.

Benchmark-tabellen, läs noga.

Varje rubriksiffra här är Qw​ens egen, publicerad på modellkortet och i rapporten, och inget av det har oberoende reproducerats – modellen är en dag gammal och ingen tredje part har granskat den ännu. Läser man det så är det fortfarande slående, eftersom Qwen3.8-Flash-Next mäter sig med DeepSeek-V4-Flash-0731, en mycket större och etablerad modell, på 6B aktiva parametrar.

• DeepSWE 1.1 — 58.7 mot 54.4 (leverantörsrapporterat).

• SWE-bench Pro — 62,5 mot 56,0 (leverantörsrapporterat).

• Toolathlon Verified — 73.5 vs 70.3 (leverantörsrapporterat).

• LiveCodeBench v6 — 91.9 mot 90.6 (enligt leverantören).

• GPQA Diamond — 91,7 mot 90,8 (leverantörsrapporterat).

• IFBench — 81.3 mot 79.2 (enligt leverantören).

Sedan den miss som rapporten öppet redovisar: NL2Repo-Bench, 48,1 mot DeepSeek-V4-Flash-0731:s 54,2 — en reell brist vad gäller kodgenerering på repositoriesnivå, den enda agentiska kodningsdimensionen där den mindre modellen inte hänger med. Agents' Last Exam är jämn, 24,3 mot 25,2. Vad gäller kontorsautomation rapporterar Qw​en CoWorkBench 73,9 — men det är ett internt benchmark och Ali​baba håller det utanför huvudtabellen.

Scoreboard card for Qwen3.8-Flash-Next: 6B active of 176B stored params, 262K to 1M context (YaRN), DeepSWE 1.1 58.7, SWE-bench Pro 62.5, GPQA Diamond 91.7 (each marked vendor), API price $0.16 / $0.47 per 1M, with a footer noting all benchmark figures are vendor-reported and not independently verified.

På vision visar den självrapporterade tabellen AndroidWorld 84.5 mot 62.0 för Claude Opus 4.6 Max och RealWorldQA 88.5 mot 73.9. Humanity's Last Exam är den enda rubriken där Qw​en förlorar direkt mot Claude Opus 4.6 Max — och bedömningen av det resultatet utfördes i sin tur av GPT-4o, så inte ens den jämförelsen är ren.

Priset: en tolftedel av flaggskeppet

Sedan kommer siffran som faktiskt spelar roll för budgetar. Den serverade Qwen3.8-Flash-versionen kostar 0,16 dollar per miljon inmatningstoken och 0,47 dollar per miljon utmatning på QwenCloud. Det är ungefär en tolftedel av priset för Alibabas egen flaggskeppsmodell, Qwen3.8-Max, som kostar 2,00 dollar per miljon inmatning och 6,00 dollar per miljon utmatning – på en modell som enligt rapporten tränades med ungefär en niondel av beräkningskapaciteten för Qwen3.7-Plus. Kinesiska modellleverantörer har tillbringat sommaren med att sänka priserna i flash-nivån, och denna release är Qwens del av den kampanjen som landar med en arkitekturmotivering bifogad snarare än bara en rabatt.

För den som jämför inom kategorin blir matematiken enklare när varje leverantör visar samma siffra. OrcaRouter routar resten av Qw​en-familjen — Qwen3.8-Max, Qwen3.8-27B och Qwen3.8 — till leverantörens listpris med 0% påslag, så en prissänkning från leverantören är live hos oss samma dag som den tillkännages. Qwen3.8-Flash-Next finns ännu inte i vår katalog; när den når en runtime som vi routar, hamnar den i samma upplägg med en enda nyckel och listpris utan ett andra kontrakt.

Vad du kan göra med det idag

Serveringsstödet från dag ett är ovanligt brett. {{1}}SGLang levereras med en cookbook-sida och en dedikerad image (lmsysorg/sglang:qwen38flashnext){{/1}}; {{2}}vLLM har vllm/vllm-openai:qwen38-flash-next{{/2}}; {{3}}NVIDIA validerar båda samt TensorRT LLM på ett GB300 NVL72-ställ med mer än 16 000 tokens per sekund per GPU i FP8, och NeMo täcker finjustering{{/3}}. Under datacenter-skala {{4}}körs modellen på DGX Spark-kluster och 4×RTX PRO 6000-arbetsstationer{{/4}}, och {{5}}samma dags community-kvantiseringståg — Unsloths GGUFs och en 1-bitarsbuild som ryms i 75 GB RAM med cirka 80 % av full noggrannhet — innebär att den 176B-stora checkpojnten verkligen kan köras på hårdvara som ett litet team äger{{/5}}. Team som hellre anropar den än kör den kan nå {{6}}Qwen3.8-Flash API:t via Ali​babas egen QwenCloud och flera tredjepartsplattformar{{/6}}, även om de öppna vikterna är vad de flesta early adopters plockar upp först.

LMSYS's SGLang blog post 'Qwen3.8-Flash-Next: Day-0 Support in SGLang', dated August 26, 2026, describing the GDN + QSA hybrid attention and the day-0 runtime support for the model.

VRAM-matematiken bakom den listan är n-gram-tabellen, och det är dit serving-stackarna konvergerar härnäst. Den per-lager-embedding som teknikrapporten håller utanför GPU-minnet är en ren uppslagstruktur — för varje genererad token drar modellen bara omkring 16 av sina 320 miljoner rader — vilket är det som gör avlastningen billig. vLLM servar Qwen3.8-Flash-Next från en särskild utvecklingsimage medan pull requesten för arkitekturstöd fortfarande är öppen, och den senaste delen av det arbetet — ett PR-utkast från samma vLLM-författare (vllm-project/vllm#54371, inte sammanslagen) — lägger till en PLE-Offload-servingsökväg som håller tabellen i värdminnet och läser den via CUDA unified virtual addressing i stället för att reservera VRAM. Med FP8 är tabellen ungefär 48 GB av den ~173 GB stora checkpointen, så att avlasta den är skillnaden mellan en datacenter-GPU och ett enda 96 GB-kort — en RTX PRO 6000, eller unified memory-poolen i en DGX Spark. Det är tidigt, så se det som en riktning snarare än ett alternativ som stöds idag; men det är runtime som hinner ikapp vad teknikrapporten redan hävdade, och det man ska hålla koll på om det är VRAM-siffran som har hållit dig tillbaka.

En en dag gammal förhandsversion med icke reproducerade siffror är skolexemplet på att inte satsa en produktionsväg på den, och det är precis vad failover är till för. Om en runtime har Qwen3.8-Flash-Next och du pekar en slutpunkt mot den med automatisk failover till en modell du redan litar på, får du fördelen med den nya arkitekturen på icke-kritisk trafik och en ren fallback när den kämpar — ingen omkoppling, eftersom det är en routingregel, inte en kodändring.

Vad denna förhandsvisning säger om Qwen4

Alibaba har kört det här spelet förut. Qwen3-Next förhandsvisade Gated DeltaNet i slutet av 2025 med tunn dokumentation, och arkitekturen specificerades fullt ut först när Qwen3.5-serien antog den i stor skala. Mönstret upprepar sig: Qwen3.8-Flash-Next är kanariefågeln, och rapporten är specifikation genom experiment. De konkreta sakerna att hålla koll på är huruvida Qwen4-flaggskeppet antar tre-till-ett-fördelningen GDN-till-QSA, huruvida n-gram-inbäddningen överlever kontakt med produktionsservering i flaggskeppets skala, och framför allt huruvida oberoende utvärderingar bekräftar fördelen med 6B-aktiva jämfört med större modeller. Om effektivitetstesen håller kan Qwen4-flaggskeppet lanseras med dramatiskt lägre serveringskostnader än föregående generation.

FAQ

Qwen3.8-Flash-Next och Qwen3.8-Flash — samma modell?

Nej, och skillnaden är viktig. Qwen3.8-Flash-Next är arkitekturförhandsvisningen med öppna vikter som tech-rapporten analyserar; Qwen3.8-Flash är produktions-API-bygget som Ali​baba erbjuder på QwenCloud för 0,16/0,47 dollar per miljon tokens med ett standardkontext på 1M. Samma ingenjörsmässiga härstamning, olika artefakter – den ena är för självhosting och inspektion, den andra är en prissatt hanterad tjänst.

Bör produktionsarbetsbelastningar flyttas till det idag?

Inte utan en andra åsikt. Varje benchmark är leverantörsrapporterad och inte reproducerad, arkitekturen är så pass ny att serving-stackarna fortfarande konvergerar — vLLM:s eget stöd landar fortfarande genom öppna pull requests — och det enda agentic-kodningsgapet (NL2Repo) rör exakt den typ av uppgift som produktionskodare stöter på. De öppna vikterna gör det billigt att utvärdera själv, och day-0-stöd för SGLang och vLLM gör en pilot möjlig den här veckan — men en pilot bakom failover är det ärliga sättet att börja, inte en cutover.

När levereras den faktiska Qwen4?

Ali​baba har inte sagt något. Den enda tidssignalen i den här utgåvan är historisk: den senaste kanariefågeln, Qwen3-Next, flög ungefär en säsong innan Qw​en3.5-serien antog dess arkitektur. I den takten är Qwen4:s flaggskepp närmare än de ser ut — men rapporten handlar uttryckligen om arkitektur, inte en färdplan.

Slutsatsen

Qwen3.8-Flash-Next är en sällsynt lansering där rapporten är produkten. Vad gäller själva modellen lyder det ärliga resultatkortet: 6B aktiva parametrar som matchar mycket större modeller på de flesta gemensamma benchmarks, ett namngivet gap för kod på repositorynivå, ett pris på en tolftedel av flaggskeppets, och en arkitektur som är Qw​ens svar på hur en frontmodell blir billig. Tech-rapporten berättar vad Qwen3.8-Flash-Next är till för — och det är inte modellen. Den är beviset för arkitekturen som kommer att bli Qwen4, och den är värd att läsa innan Qwen4 lanseras, eftersom beslutet den förändrar är det du kommer att fatta när Qwen4 kommer.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

providers@orcarouter.ai

Gå med i vår community

Discordsupport@orcarouter.aiXGitHubYouTube