
Qwen3.8-Flash-Next: Alibaba förhandsvisar Qwen4-arkitekturen innan Qwen4 finns.
- DeepSeekNYDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M tokens
- z-aiNYZ.ai: GLM 5.32026-08-1860Intelligens75Kodning
- obsidianNYQwen3.8 27B2026-08-1552Intelligens68Kodning
- qwenNYQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNYDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligens69Kodning
- grokNYSpaceXAI: Grok 4.62026-08-1261Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligens77Kodning
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligens77Kodning
Alibaba är på väg att publicera Qwen4-arkitekturen innan de publicerar en Qwen4-modell. Qwen3.8-Flash-Next — en öppen viktmodell (open-weight), multimodal mixture-of-experts-modell byggd på nästa generations arkitektur som kommer att driva Qwen4-familjen — är planerad att släppas offentligt på ModelScope klockan 23:00 Peking-tid den 26 augusti 2026. Alibaba beskriver lanseringen som en teknikförhandsvisning: utvecklare får arkitekturen tidigt, hela Qwen4-familjen kommer senare. I skrivande stund är parameterantalet, licensen och priset obekräftade, så detta är en "vad vi vet hittills"-artikel — varje specifikation nedan är märkt med hur säker den är.
Om du inte har följt Alibabas kadens den här månaden, är ankaret Qwen3.8-Max — flaggskeppet med 2,4 biljoner parametrar som släpptes den 3 augusti och gjordes open source som Qwen3.8-2.4T-A95B mindre än två veckor senare. Qwen3.8-Flash-Next kommer mindre än en månad efter det. Samma labb som gav ut en modell med 2,4 biljoner parametrar med öppna vikter delar nu ut arkitekturen för generationen efter, innan flaggskeppet för den generationen ens har namngetts.
Vad som tillkännagavs
Signalen nådde arenan genom de vanliga kanalerna. En ModelScope-teasersida för Qwen3.8-Flash-Next gick live den 25 augusti med märkningen "Upcoming Open-Release", tagline "Onward to the Next-Gen — Lightning-Fast," och en nedräkningstimer som pekade på 2026-08-26 23:00 (UTC+08:00). Alibabas Qwen-team postade på X samma dag — "The next Qwen wave is coming." Inlägget som vidarebefordrade detta till oss, från @kimmonismus på X, beskrev samma sak med något andra ord: en open-weight multimodal MoE på nästa generations arkitektur, tidig åtkomst så att communityn kan förbereda sig för Qwen4-familjen.

Det avsnitt som är värt att läsa om är Alibabas egen beskrivning. Modellen beskrivs som byggd på nästa generations arkitektur ”som ska driva den kommande Qwen4-familjen” — och uttryckligen inte som Qwen4 själv. Alibabas angivna skäl är att arkitekturförändringarna ska hamna i communityns händer innan familjen anländer, så att körtider, kvantiseringar och applikationer är redo när det riktiga släpps. Det är en marknadsföringsposition, men det är också ett tekniskt åtagande: förhandsvisa det svåraste först, ta med communityn på resan.
Vad är bekräftat idag, och vad är inte:
• Bekräftat, enligt teasern och Qwen-uttalandet: Qwen3.8-Flash-Next är öppen-vikt, multimodal och en MoE-modell på Qwen4-arkitekturen.
Bekräftat, enligt Qwen-uttalandet: det introducerar två huvudsakliga arkitektoniska förändringar — GDN-hybridarkitekturen och Qwen Sparse Attention (QSA).
• Bekräftat, enligt teasern: släpptiden, 2026-08-26 23:00 (UTC+08:00), på ModelScope.
• Ej bekräftat: totala eller aktiva parametrar, licensvillkor, kontextlängd, API-tillgänglighet eller prissättning, och alla benchmark-resultat. Det finns ännu ingen oberoende utvärdering eftersom vikterna inte har släppts ännu.

Vad Qwen4-arkitekturen faktiskt är
Två mekanismer driver berättelsen. Den första, GDN — Gated Delta Network — är Alibabas linjära uppmärksamhetslager. Där en vanlig transformer håller en key-value-cache som växer med sekvenslängden, upprätthåller ett GDN-lager ett återkommande tillstånd av fast storlek och uppdaterar det med en inlärd grindregel; härstamningen går genom DeltaNet och Mamba-2. Fördelen är den som tyst har drivit Qwen-serien sedan Qwen3-Next: långa kontexter förblir billiga eftersom tillståndet inte växer, medan en minoritet av lager med full uppmärksamhet finns kvar i mixen för att göra den precisa återhämtning som linjär uppmärksamhet är dålig på. I den nuvarande generationen är blandningen ungefär tre GDN-lager för varje fullt uppmärksamhetslager — gemenskapsanalys av Qwen3.8-2.4T-A95B-checkpointen räknar 69 GDN-lager mot 23 uppmärksamhetslager. Qwen3.8-Flash-Next beskrivs som "GDN-hybridarkitektur" på exakt den härstamningen.
Den andra, QSA — Qwen Sparse Attention — är den genuint nya delen, och det finns ännu ingen offentlig teknisk beskrivning av den: bara namnet och att den anges som en av de två huvudsakliga förändringarna i förhandsversionen. Denna avsaknad av detaljer är i sig en del av mönstret. Qwen3-Nexts förhandsversion i slutet av 2025 introducerade Gated DeltaNet med samma knapphet på dokumentation, och arkitekturen specificerades fullt ut först när Qwen3.5-serien antog den. För en läsare är den praktiska slutsatsen densamma båda gångerna: arkitekturkanariefågeln dyker upp först, dokumentationen och produktionsmodellerna dyker upp efteråt.
Spelboken som redan fungerade en gång
Alibaba har genomfört exakt detta drag tidigare, och det fungerade. I slutet av 2025 förhandsvisade Qwen3-Next Gated DeltaNet och en hybrid av linjär och full attention. När Qwen3.5-serien lanserades antog den den ritningen i stor skala – och hybriden har burits vidare genom Qwen3.8-generationen sedan dess, inklusive flaggskeppet på 2,4T. Anledningen till att prejudikatet är viktigt här är den tidpunkt det antyder. Hela Qwen4-familjen bör förväntas på andra sidan av denna förhandsvisning, inte i den; om Qwen3-Next-gapet är någon vägledning, mäts avståndet mellan "här är arkitekturen" och "här är familjen" i månader. Inget i teasern bekräftar det – det är en slutsats från ett mönster som Alibaba nu har kört två gånger.
Det vi fortfarande inte vet
Det okända är poängen med en förhandsvisning, och de är verkliga:
• Parametrar. Teasern avslöjar inga. Spekulationer i communityt på X och Reddit – utan officiellt stöd – pekar på en konfiguration med totalt cirka 125B / 6B aktiva parametrar och en stor n-gram-embedding-uppslagstabell. Behandla det som ett rykte.
• "Flash"-nivån. I Qwen3.5-generationen var den molnbaserade Qwen3.5-Flash en förbättrad variant av den öppna viktmodellen Qwen3.5-35B-A3B. Huruvida Qwen3.8-Flash-Next är den öppna viktmotsvarigheten till en modell av liknande storlek som Qwen3.8 är okänt; det kan istället röra sig om modellen i klassen 125B-A6B. Båda tolkningarna är gissningar.
• Licens. Alibabas senaste Qwen-utgåvor sträcker sig från Apache-2.0 (Qwen3.8-27B) till den intäktsbaserade Qwen3.8-Max-licensen. Var Flash-Next hamnar avgör om den kan användas kommersiellt, och i vilka sammanhang.
• Riktmärken. Qwen-uttalandet lyfter fram agentisk kodning, långsiktiga uppgifter och multimodal intelligens, men inga siffror bifogas och det finns ingen oberoende utvärdering förrän vikterna släpps.
En familj som arbetar i en tvåveckorscykel
Den omgivande rytmen är en historia i sig. Qwen3.8-Max, flaggskeppet med 2,4 biljoner parametrar, släpptes den 3 augusti; det med öppna vikter Qwen3.8-2.4T-A95B följde den 12–13 augusti; det kostnadsfria Apache-2.0 Qwen3.8-27B kom dagar senare; och nu, innan månaden är slut, förhandsvisas nästa generations arkitektur. Inget annat labb itererar för närvarande i denna takt. För en läsare som väljer modeller är den praktiska konsekvensen att ”den bästa Qwen” är ett rörligt mål — och skillnaden mellan generationerna kommer snabbare än vad det omgivande ekosystemet vanligtvis hinner anpassa sig. Att köpa ett beslut snarare än en modell blir alltmer det försvarbara draget.
Vad en utvecklare bör göra nu
Planera för arkitekturen, inte bara modellen. Qwen3.8-Flash-Next kommer att vara en obeprövad förhandsversion från dag ett: inga oberoende benchmarks, en runtime-ekosystem som fortfarande hinner ikapp, och endast leverantörens påståenden om de agentiska och långsiktiga styrkor som betyder något för de arbetsbelastningar som skulle använda den. Det säkra sättet att utvärdera den är inte att koppla in den i en produktionssökväg — det är att dirigera en kopia med låg insats av en arbetsbelastning till den, jämföra utdata mot den nuvarande modellen, och låta automatisk failover absorbera de stunder när leverantören som serverar en helt ny open-weight-modell beter sig illa. På OrcaRouter är det samma endpoint och samma nyckel som du redan använder: Qwen3.8-Flash-Next och din nuvarande modell ligger bakom ett API, och routing-DSL:et kan A/B-testa förhandsversionen mot den nuvarande modellen med samma prompt innan något committas.
Prissättning, när den finns, bör läsas på samma sätt. Alibaba har inte meddelat ett API-pris för Flash-Next, och ej släppta vikter kan inte dirigeras någonstans. När en leverantör väl exponerar den, skickar OrcaRouter leverantörens listpris direkt vidare med 0% påslag — så vad Alibabas siffra än visar sig bli visas oförändrad, samma dag. Den närmaste baslinjen du faktiskt kan anropa idag är Qwen3.8-Max (qwen/qwen3.8-max), flaggskeppet som denna arkitektur så småningom kommer att ligga under: ett kontextfönster på 1 000 000 token till $2,00 per miljon inmatningstoken och $6,00 per miljon utmatningstoken, vidarebefordrat till listpris. Håll den siffran i huvudet när Flash-Nexts pris sjunker; det är kostnaden som nästa generation måste slå.

Vad du ska titta på när det släpps
Fyra saker spelar roll i det ögonblick releasetimern går ut:
• Antalet parametrar och nivån för aktiva parametrar — oavsett om detta är modellen i 125B-A6B-klassen som ryktena beskriver eller en mindre instegsmodell.
• Licensen — tillåtande som Qwen3.8-27B, eller begränsad som Max-licensen.
• Huruvida de första oberoende utvärderingarna återger leverantörens påståenden om agentisk kodning och långsiktiga horisonter — siffrorna att lita på, inte marknadsföringssnacket.
• Hur länge Alibaba väntar innan hela Qwen4-familjen följer efter förhandsvisningen.
Inget av det går att veta härifrån. Det som går att veta idag är formen på beslutet som Alibaba har fattat: man satsar på att nästa generation av dess arkitektur är värd att ge bort före flaggskeppet. Den satsningen är historien — och vikterna släpps i morgon.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
