Hero-titelkort för artikeln 'Qwen3.8-Flash-Next — LÄCKAGE-RAPPORT' med ett märke som läser 'OVERIFIERAD — QWEN4 ARKITEKTUR-PREVIEW', underrubriken 'Alibaba levererar Qwen4-arkitekturen innan modellen', tre chips som läser 'Källa: @kimmonismus', 'Aug 25, 2026' och 'Släpp: Aug 26 23:00 UTC+08', ett vänsterkort som läser 'Påståendet: en multimodal MoE med öppna vikter som förhandsvisar Qwen4-arkitekturen' och ett högerkort som läser 'Status: vikterna ej släppta, ~24 timmar till släpp'. OrcaRouter-logotypen är kompositerad i det nedre högra hörnet.
Guides & Insights

Qwen3.8-Flash-Next: Alibaba förhandsvisar Qwen4-arkitekturen innan Qwen4 finns.

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Alibaba är på väg att publicera Qwen4-arkitekturen innan de publicerar en Qwen4-modell. Qwen3.8-Flash-Next — en öppen viktmodell (open-weight), multimodal mixture-of-experts-modell byggd på nästa generations arkitektur som kommer att driva Qwen4-familjen — är planerad att släppas offentligt på ModelScope klockan 23:00 Peking-tid den 26 augusti 2026. Alibaba beskriver lanseringen som en teknikförhandsvisning: utvecklare får arkitekturen tidigt, hela Qwen4-familjen kommer senare. I skrivande stund är parameterantalet, licensen och priset obekräftade, så detta är en "vad vi vet hittills"-artikel — varje specifikation nedan är märkt med hur säker den är.

Om du inte har följt Alibabas kadens den här månaden, är ankaret Qwen3.8-Max — flaggskeppet med 2,4 biljoner parametrar som släpptes den 3 augusti och gjordes open source som Qwen3.8-2.4T-A95B mindre än två veckor senare. Qwen3.8-Flash-Next kommer mindre än en månad efter det. Samma labb som gav ut en modell med 2,4 biljoner parametrar med öppna vikter delar nu ut arkitekturen för generationen efter, innan flaggskeppet för den generationen ens har namngetts.

Vad som tillkännagavs

Signalen nådde arenan genom de vanliga kanalerna. En ModelScope-teasersida för Qwen3.8-Flash-Next gick live den 25 augusti med märkningen "Upcoming Open-Release", tagline "Onward to the Next-Gen — Lightning-Fast," och en nedräkningstimer som pekade på 2026-08-26 23:00 (UTC+08:00). Alibabas Qw​en-team postade på X samma dag — "The next Qw​en wave is coming." Inlägget som vidarebefordrade detta till oss, från @kimmonismus på X, beskrev samma sak med något andra ord: en open-weight multimodal MoE på nästa generations arkitektur, tidig åtkomst så att communityn kan förbereda sig för Qwen4-familjen.

A screenshot of the ModelScope teaser page for Qwen3.8-Flash-Next (captured August 25, 2026), showing an 'Upcoming Open-Release' badge, the model name Qwen3.8-Flash-Next with the tagline 'Onward to the Next-Gen — Lightning-Fast', a release countdown, an 'Estimated Release Time: 2026-08-26 23:00 (UTC+08:00)' line, and a 'Like and Get-Notified' button.

Det avsnitt som är värt att läsa om är Alibabas egen beskrivning. Modellen beskrivs som byggd på nästa generations arkitektur ”som ska driva den kommande Qwen4-familjen” — och uttryckligen inte som Qwen4 själv. Alibabas angivna skäl är att arkitekturförändringarna ska hamna i communityns händer innan familjen anländer, så att körtider, kvantiseringar och applikationer är redo när det riktiga släpps. Det är en marknadsföringsposition, men det är också ett tekniskt åtagande: förhandsvisa det svåraste först, ta med communityn på resan.

Vad är bekräftat idag, och vad är inte:

• Bekräftat, enligt teasern och Qw​en-uttalandet: Qwen3.8-Flash-Next är öppen-vikt, multimodal och en MoE-modell på Qwen4-arkitekturen.

Bekräftat, enligt Qw​en-uttalandet: det introducerar två huvudsakliga arkitektoniska förändringar — GDN-hybridarkitekturen och Qw​en Sparse Attention (QSA).

• Bekräftat, enligt teasern: släpptiden, 2026-08-26 23:00 (UTC+08:00), på ModelScope.

• Ej bekräftat: totala eller aktiva parametrar, licensvillkor, kontextlängd, API-tillgänglighet eller prissättning, och alla benchmark-resultat. Det finns ännu ingen oberoende utvärdering eftersom vikterna inte har släppts ännu.

A single-column infographic titled 'Qwen3.8-Flash-Next — the leak board' with rows reading 'Status: upcoming open release', 'Release: 2026-08-26 23:00 (UTC+08)', 'Architecture: Qwen4 preview — GDN + QSA', 'Type: multimodal MoE, open-weight', 'Params: undisclosed (rumor ~125B-A6B)', 'License: undisclosed'. A small footer line reads 'From the teaser + community analysis; nothing independently verified.' The OrcaRouter logo is composited in the bottom-right corner.

Vad Qwen4-arkitekturen faktiskt är

Två mekanismer driver berättelsen. Den första, GDN — Gated Delta Network — är Alibabas linjära uppmärksamhetslager. Där en vanlig transformer håller en key-value-cache som växer med sekvenslängden, upprätthåller ett GDN-lager ett återkommande tillstånd av fast storlek och uppdaterar det med en inlärd grindregel; härstamningen går genom DeltaNet och Mamba-2. Fördelen är den som tyst har drivit Qw​en-serien sedan Qwen3-Next: långa kontexter förblir billiga eftersom tillståndet inte växer, medan en minoritet av lager med full uppmärksamhet finns kvar i mixen för att göra den precisa återhämtning som linjär uppmärksamhet är dålig på. I den nuvarande generationen är blandningen ungefär tre GDN-lager för varje fullt uppmärksamhetslager — gemenskapsanalys av Qwen3.8-2.4T-A95B-checkpointen räknar 69 GDN-lager mot 23 uppmärksamhetslager. Qwen3.8-Flash-Next beskrivs som "GDN-hybridarkitektur" på exakt den härstamningen.

Den andra, QSA — Qw​en Sparse Attention — är den genuint nya delen, och det finns ännu ingen offentlig teknisk beskrivning av den: bara namnet och att den anges som en av de två huvudsakliga förändringarna i förhandsversionen. Denna avsaknad av detaljer är i sig en del av mönstret. Qwen3-Nexts förhandsversion i slutet av 2025 introducerade Gated DeltaNet med samma knapphet på dokumentation, och arkitekturen specificerades fullt ut först när Qw​en3.5-serien antog den. För en läsare är den praktiska slutsatsen densamma båda gångerna: arkitekturkanariefågeln dyker upp först, dokumentationen och produktionsmodellerna dyker upp efteråt.

Spelboken som redan fungerade en gång

Alibaba har genomfört exakt detta drag tidigare, och det fungerade. I slutet av 2025 förhandsvisade Qwen3-Next Gated DeltaNet och en hybrid av linjär och full attention. När Qwen3.5-serien lanserades antog den den ritningen i stor skala – och hybriden har burits vidare genom Qwen3.8-generationen sedan dess, inklusive flaggskeppet på 2,4T. Anledningen till att prejudikatet är viktigt här är den tidpunkt det antyder. Hela Qwen4-familjen bör förväntas på andra sidan av denna förhandsvisning, inte i den; om Qwen3-Next-gapet är någon vägledning, mäts avståndet mellan "här är arkitekturen" och "här är familjen" i månader. Inget i teasern bekräftar det – det är en slutsats från ett mönster som Alibaba nu har kört två gånger.

Det vi fortfarande inte vet

Det okända är poängen med en förhandsvisning, och de är verkliga:

• Parametrar. Teasern avslöjar inga. Spekulationer i communityt på X och Reddit – utan officiellt stöd – pekar på en konfiguration med totalt cirka 125B / 6B aktiva parametrar och en stor n-gram-embedding-uppslagstabell. Behandla det som ett rykte.

• "Flash"-nivån. I Qwen3.5-generationen var den molnbaserade Qwen3.5-Flash en förbättrad variant av den öppna viktmodellen Qwen3.5-35B-A3B. Huruvida Qwen3.8-Flash-Next är den öppna viktmotsvarigheten till en modell av liknande storlek som Qw​en3.8 är okänt; det kan istället röra sig om modellen i klassen 125B-A6B. Båda tolkningarna är gissningar.

• Licens. Alibabas senaste Qw​en-utgåvor sträcker sig från Apache-2.0 (Qw​en3.8-27B) till den intäktsbaserade Qwen3.8-Max-licensen. Var Flash-Next hamnar avgör om den kan användas kommersiellt, och i vilka sammanhang.

• Riktmärken. Qwen-uttalandet lyfter fram agentisk kodning, långsiktiga uppgifter och multimodal intelligens, men inga siffror bifogas och det finns ingen oberoende utvärdering förrän vikterna släpps.

En familj som arbetar i en tvåveckorscykel

Den omgivande rytmen är en historia i sig. Qwen3.8-Max, flaggskeppet med 2,4 biljoner parametrar, släpptes den 3 augusti; det med öppna vikter Qwen3.8-2.4T-A95B följde den 12–13 augusti; det kostnadsfria Apache-2.0 Qw​en3.8-27B kom dagar senare; och nu, innan månaden är slut, förhandsvisas nästa generations arkitektur. Inget annat labb itererar för närvarande i denna takt. För en läsare som väljer modeller är den praktiska konsekvensen att ”den bästa Qw​en” är ett rörligt mål — och skillnaden mellan generationerna kommer snabbare än vad det omgivande ekosystemet vanligtvis hinner anpassa sig. Att köpa ett beslut snarare än en modell blir alltmer det försvarbara draget.

Vad en utvecklare bör göra nu

Planera för arkitekturen, inte bara modellen. Qwen3.8-Flash-Next kommer att vara en obeprövad förhandsversion från dag ett: inga oberoende benchmarks, en runtime-ekosystem som fortfarande hinner ikapp, och endast leverantörens påståenden om de agentiska och långsiktiga styrkor som betyder något för de arbetsbelastningar som skulle använda den. Det säkra sättet att utvärdera den är inte att koppla in den i en produktionssökväg — det är att dirigera en kopia med låg insats av en arbetsbelastning till den, jämföra utdata mot den nuvarande modellen, och låta automatisk failover absorbera de stunder när leverantören som serverar en helt ny open-weight-modell beter sig illa. På OrcaRouter är det samma endpoint och samma nyckel som du redan använder: Qwen3.8-Flash-Next och din nuvarande modell ligger bakom ett API, och routing-DSL:et kan A/B-testa förhandsversionen mot den nuvarande modellen med samma prompt innan något committas.

Prissättning, när den finns, bör läsas på samma sätt. Alibaba har inte meddelat ett API-pris för Flash-Next, och ej släppta vikter kan inte dirigeras någonstans. När en leverantör väl exponerar den, skickar OrcaRouter leverantörens listpris direkt vidare med 0% påslag — så vad Alibabas siffra än visar sig bli visas oförändrad, samma dag. Den närmaste baslinjen du faktiskt kan anropa idag är Qwen3.8-Max (qwen/qwen3.8-max), flaggskeppet som denna arkitektur så småningom kommer att ligga under: ett kontextfönster på 1 000 000 token till $2,00 per miljon inmatningstoken och $6,00 per miljon utmatningstoken, vidarebefordrat till listpris. Håll den siffran i huvudet när Flash-Nexts pris sjunker; det är kostnaden som nästa generation måste slå.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max), showing the model id, the Vision, Tools, JSON and Reasoning capability chips, a p50 time-to-first-token of 5.15 seconds, a $2.00 per 1M input and $6.00 per 1M output price passed through at list price, and a 1,000,000-token context window.

Vad du ska titta på när det släpps

Fyra saker spelar roll i det ögonblick releasetimern går ut:

• Antalet parametrar och nivån för aktiva parametrar — oavsett om detta är modellen i 125B-A6B-klassen som ryktena beskriver eller en mindre instegsmodell.

• Licensen — tillåtande som Qwen3.8-27B, eller begränsad som Max-licensen.

• Huruvida de första oberoende utvärderingarna återger leverantörens påståenden om agentisk kodning och långsiktiga horisonter — siffrorna att lita på, inte marknadsföringssnacket.

• Hur länge Alibaba väntar innan hela Qwen4-familjen följer efter förhandsvisningen.

Inget av det går att veta härifrån. Det som går att veta idag är formen på beslutet som Alibaba har fattat: man satsar på att nästa generation av dess arkitektur är värd att ge bort före flaggskeppet. Den satsningen är historien — och vikterna släpps i morgon.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

providers@orcarouter.ai

Gå med i vår community

Discordsupport@orcarouter.aiXGitHubYouTube