Ett genererat titelkort med rubriken ”Qwen 4.5 och Qwen 5: 5 till 10 biljoner parametrar”, underrubriken ”Ett vägkartespann, inte en specifikation” och tre kort som lyder ”Vägkartemål / 5–10T parametrar”, ”Leveransklart flaggskepp / Qwen3.8-Max 2.4T” och ”Releasedatum / ej annonserat”. En sidfotsrad lyder ”Enligt Alibabas pressmeddelande den 22 september 2026; inget modellkort har publicerats.” Platt vektoriell redaktionell stil på vit bakgrund med en blå-till-cyan gradientton och OrcaRouter-logotypen komponerad i nedre högra hörnet.
Guides & Insights

Qwen 4.5 och Qwen 5 siktar på 5 till 10 biljoner parametrar: vad Alibaba sade och inte sade

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Vid sin Apsara-konferens i Hangzhou den 22 september 2026 angav företaget en storlek för generationen efter nästa. De Qwen 4.5 och Qwen 5-serierna "förväntas skalas upp till 5 till 10 biljoner parametrar", enligt ordalydelsen i företagets eget engelska pressmeddelande – en roadmap-rad, inte en specifikation. Ingen av modellerna har ett releasedatum, ett modellkort, en API-identifierare, ett pris eller en publicerad benchmark-poäng, vilket innebär att ingen av dem kan anropas idag. Flaggskeppet du faktiskt kan köpa är Qwen3.8-Max, allmänt tillgängligt sedan den 3 augusti 2026, med 2,4 biljoner parametrar. Under dagarna sedan konferensen har den där roadmap-meningen i mycket av bevakningen plattats ut till ett påstående att en modell med 10 biljoner parametrar är på väg – ett starkare och enklare påstående än det företaget kom med. Avståndet mellan de två meningarna är ungefär ett års planering.

Påståendet, och den version av det som spreds

Två saker sades på scenen, och de är värda att separera eftersom de bär mycket olika mängder information. Det första är en statusuppdatering: Qwen 4 tränas, på en ny arkitektur. Det andra är en färdplan: Qwen 4.5- och Qwen 5-serierna förväntas nå ett parameterband på 5 till 10 biljoner.

Alibabas engelska pressmeddelande tillskriver båda företaget snarare än en namngiven chef. Konferensrapporteringen som går längre tillskriver färdplanen Liu Da Yiheng, som leder Qwen-projektet för stora språkmodeller på Alibaba Token Hub, och rapporterar hans inramning att skalning är en nyckelväg mot artificiell superintelligens. Den inramningen är det sammanhang som parameternumret presenterades i, och den förklarar varför numret är ett spann snarare än ett mål.

Det som då spreds var den övre delen av intervallet. De engelska rubriker som följde innehåller minst en som beskriver en modell med 10 biljoner parametrar som det har hintats om, och flera som beskriver en plan för en modell på 5 till 10 biljoner parametrar. Båda är försvarbara tolkningar av en slide. Ingen av dem är en specifikation, och skillnaden har betydelse för alla som måste planera utifrån den.

5 biljoner är en generations mål och 10 biljoner är en annans

Det enskilt mest användbara att få rätt när det gäller detta tillkännagivande är att 5 till 10 biljoner är ett intervall som sträcker sig över två generationer, inte en modell med ett brett toleransintervall. Alibabas egen mening knyter intervallet till "den kommande Qwen 4.5- och Qwen 5-modellserien" – serien, i plural, sedd som helhet.

Kinesiskspråkig rapportering från samma konferens är återigen precis i en annan riktning, med rubriker som beskriver modeller efter Qwen 4.5 som expanderar in i intervallet 5 till 10 biljoner. Den tolkningen placerar 10-biljonersänden bortom Qwen 4.5 också. Det enda påstående som alla källor är överens om är att bandet täcker spannet från Qwen 4.5 till Qwen 5. Tilldelningen av 10 biljoner specifikt till Qwen 5 är en slutsats som blev en rubrik, inte ett citat.

För att ge en uppfattning om skalan, och dessa är de enda siffrorna i den här berättelsen som är publicerade snarare än prognostiserade:

• 5 till 10 biljoner — parameterintervallet som Alibabas pressmeddelande kopplar till Qwen 4.5- och Qwen 5-serien

• 2,4 biljoner — totalt antal parametrar i Qwen3.8-Max, den lanserade flaggskeppsmodellen, enligt dess officiella modellkort

• 95 miljarder — Qwen3.8-Maxs aktiva parametrar per token, siffran som avgör vad det kostar att betjäna en token

• 10 biljoner — den övre gränsen för intervallet, och den enda delen av det som nådde de flesta engelska rubrikerna

• 0 – antalet publicerade specifikationer, utgivningsdatum, priser, kontextfönster eller benchmarkresultat för Qwen 4.5 eller Qwen 5

A generated scoreboard titled 'Shipped vs projected - the scoreboard'. Left column 'Qwen3.8-Max (shipping)' reads GA August 3, 2026; 2.4 trillion total parameters; 95 billion active parameters; 1,000,000-token context window; $2.00 in / $6.00 out; benchmarks vendor table plus AA Index 45. Right column 'Qwen 4.5 / Qwen 5 (roadmap)' reads release none given; 5 to 10 trillion series; active parameters not published; context window not published; price not published; benchmarks none published. Footer reads 'Qwen3.8-Max specs per its model card; AA Index per Artificial Analysis; Qwen 4.5 and Qwen 5 per Alibaba's September 22, 2026 roadmap.'

Det parameternummer som spelar roll är det som ingen publicerade

Totala parametrar är det antal ett labb väljer att uppge. Aktiva parametrar är det antal en köpare behöver, och färdplanen innehåller inte något sådant.

Qwen3.8-Max är en mixture-of-experts-modell med totalt 2,4 biljoner parametrar och 95 miljarder aktiva per token. Det är en aktiveringskvot på ungefär 4 procent: modellen rymmer en stor mängd kunskap i vikter som den inte läser för någon given token, och betalar beräkningskraft för en liten del av dem. Totala parametrar säger hur mycket minne saken upptar och hur stor låda du behöver. Aktiva parametrar säger vad du betalar varje gång den svarar.

Räknar man vidare på det förhållandet blir problemets form synlig. En modell med 10 biljoner parametrar byggd med samma 4 procents aktivering skulle aktivera i storleksordningen 400 miljarder parametrar per token – mer än fyra gånger vad Qwen3.8-Max aktiverar nu. Det är aritmetik utifrån ett angivet antagande, inte ett påstående om Qwen 5: öka glesheten och antalet aktiva sjunker, minska den och det stiger. Men det är aritmetiken som avgör om en modell med 10 biljoner parametrar är en driftsatt produkt eller en forskningsartefakt, och det är den beräkning som rubriken om 5 till 10 biljoner inbjuder till och sedan lämnar ogjord.

Det är också här routingekonomin slutar vara abstrakt. Hos OrcaRouter förs leverantörens listpris vidare med 0 % påslag, så en leverantörs prissänkning på en Qwen-nivå slår igenom på din nyckel samma dag i stället för vid en förnyelse. En generation vars serveringskostnad är genuint osäker är precis det fall där den prisöverföringen är värd mer än en rabatt som förhandlats fram i förväg mot en siffra som ingen har publicerat.

Chip-tillkännagivandet är den faktiska tidslinjen.

Alibaba tillkännagav modellfärdplanen och en ny accelerator i samma pressmeddelande, och de två är mer sammankopplade än vad pressmeddelandet säger.

T-Heads Zhenwu V900 är en tränings- och inferensprocessor med 216 GB minne och 1 200 GB/s i bandbredd mellan chip, inbyggt stöd för FP8 och FP4 samt uppges ha tre gånger högre prestanda än föregångaren Zhenwu M890, som släpptes i maj. Massproduktion och kommersiell lansering är planerade till första kvartalet 2027. En tillhörande supernodserver stöder kluster med upp till 500 000 kort, och T-Head uppger att Zhenwu-serien har betjänat fler än 650 kunder.

Läser man de två tillkännagivandena tillsammans blir sekvensen begriplig. Att träna och betjäna en mixture-of-experts-modell i 10 biljoners skala är ett interconnect-problem innan det är ett beräkningsproblem, eftersom expertparallelism innebär att aktiveringar ständigt flyttas mellan chip, och 1 200 GB/s i bandbredd mellan chip är talet som avgör om det är genomförbart. Kisel enligt den tidsplanen lägger det tidigaste troliga fönstret för en körning i frontier-skala av det här slaget en bra bit in i 2027 – och även då säger ett chip som levereras ingenting om att en träningskörning slutförs. Alibaba kopplade samman de två ämnena genom att lägga dem i en och samma release; själva kopplingen är vår tolkning, och den är märkt som en sådan.

Företagets egen tidshorisont ligger i linje med det. Verkställande direktören Eddie Wu satte ett mål på över 20 gigawatt global datacenterkapacitet för Alibaba Cloud till 2032 – ett kapacitetsmål, inte driftsatt kapacitet, och en horisont på fem år eller mer snarare än en för nästa kvartal.

Självförbättringspåståendena som håller färdplanen uppe

Anledningen till att en plan på 5–10 biljoner ens är diskutabel snarare än bara dyr är rekursiv självförbättring: om träningspipelinen förbättrar sig själv minskar beräkningsbehovet per generation, och fronten flyttas närmare det överkomliga. Det är det bärande påståendet bakom färdplanen, och det är också det minst verifierbara som Alibaba har sagt.

Vad företaget rapporterade: Qwen3.8-Max genomförde 33 iterativa cykler under ungefär en månad av helt automatiserat arbete som omfattade pipelinedesign, datavalidering och feldiagnos, och höjde sin Artificial Analysis-poäng från 40 till 45. I ett chipdesign-experiment ägnade modellen mer än 60 timmar åt självförbättring under en designlivscykel, gjorde fler än 10 000 anrop till verktyg för elektronisk designautomatisering och minskade chipytan med 42 procent utan prestandaförlust. En rapport från konferensen redovisar också en förbättring av inferensgenomströmningen med 96 procent genom autonom justering av en ny T-Head GPU.

Dessa uppgifter kommer från leverantören och har inte oberoende replikerats. Det är ingen formalitet – en autonom slinga som betygsätter sina egna experiment mäter sig mot sin egen bedömare, och omvärlden kan inte kontrollera bedömningskriterierna. Bevakningen av konferensen har i allmänhet sagt detta, och läsarna bör utgå från det.

Det finns en andra fälla i samma påstående, och den handlar om etiketter snarare än om ärlighet. Alibaba säger inte vilken revidering av Artificial Analysis Intelligence Index som dess rörelse från 40 till 45 mäts mot, och det indexet har byggts om sedan den här modellen lanserades. Den aktuella Artificial Analysis-sidan för Qwen3.8 Max (0902) visar 45 – en oberoende siffra, enligt den revidering som gäller i dag. Den avläsning som registrerades för samma modell i mitten av augusti, enligt den då gällande revideringen, var 56. En 45:a och en 56:a är inte samma mätning i samma enheter, och att subtrahera den ena från den andra ger ett tal som inte betyder någonting. Det som sidan inte innehåller är den 40 som Alibaba uppger att man förbättrade från: startpunkten för den skillnaden är företagets egen, och bara slutpunkten råkar ligga där den oberoende avläsningen nu ligger. Läs rörelsen som en riktning, inte som en mätning.

A screenshot of the Artificial Analysis model page for Qwen3.8 Max (0902), captured September 23 2026, showing an Artificial Analysis Intelligence Index of 45 (ranked 24 of 212, badge 'Updated'), speed of 39.2 output tokens per second (159 of 212), $2.00 per 1M input and $6.00 per 1M output tokens with an 88% cache discount and $5.41 cost per Intelligence Index task (90 of 212), verbosity of 190M output tokens (88 of 212), and a technical specification listing a 984k context window with reasoning enabled.

Vad Alibaba faktiskt lanserade på samma konferens

Om man bortser från färdplanen innehöll konferensen fortfarande riktiga lanseringar, alla multimodala:

• Qwen3.8-LiveTranslate — simultantolkning, där latensen (LAAL) har minskat med nästan 20 procent, från 2,8 sekunder till 2,3 sekunder

• Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-TTS och Qwen-Audio-3.1-Realtime — en förnyad talsvit

• Qwen-Audio-3.1-TTS-Next — filmiska ljudlandskap som blandar dialog och atmosfärljud från ett textmanus, avsedda för ljudböcker, film och tv, poddar och spel

• Qwen-Image 3.1 — bildgenerering anpassad för kreativ design och marknadsföring inom e-handel, väntas senare i år, med inbyggd generering av transparent bakgrund

Qwen Intelligence — en fullstack-agentplattform riktad till smarttelefontillverkare

Varje post på den listan är en produkt med ett leveransfönster. Frontier-scale-anspråket är den enda punkten på agendan utan datum, och kontrasten är inte en slump: att skeppa den multimodala nivån är det som finansierar ett roadmap-år, och roadmappen är det som gör nästa finansieringsrunda eller nästa molnkontrakt till en berättelse snarare än ett kalkylark. Båda sakerna är verkliga. Bara en av dem är något man kan anropa.

Vad är anropbart idag, och vad måste ändras för att det ska förändras?

Qwen 3.8-generationen utgör fortfarande hela den köpbara linjen. Qwen3.8-Max har varit allmänt tillgänglig sedan 3 augusti 2026 till $2,00 per miljon indatatoken och $6,00 per miljon utdatatoken, oförändrat över hela kontexten på 1 000 000 token utan tilläggsavgift för långa prompter. Dess vikter publicerades den 12 augusti 2026 som Qwen3.8-2.4T-A95B i BF16 och FP8 under en anpassad Qwen-licens. Dess benchmarktabell från leverantören är stark och oreviderad – Terminal-Bench 2.1 på 86,6, GPQA Diamond på 92,6, OSWorld-Verified på 86,1, alla Alibabas egna siffror – Den oberoende bilden är mindre smickrande än leverantörens: Artificial Analysis placerar Qwen3.8 Max (0902) på ett Intelligence Index på 45, 24:e av 212 modeller, till $5,41 i uppmätt kostnad per Intelligence Index-uppgift och 39,2 utdatatoken per sekund – 159:e av 212, nära den långsamma änden av fältet. Samma sida listar kontextfönstret som 984k mot 1 000 000 på vår egen modellsida, en skillnad värd att känna till innan du dimensionerar ett långkontextjobb. Frontier-klassig poäng, medelmåttig hastighet: det är den ärliga sammanfattningen av det aktuella flaggskeppet, och det är baslinjen som alla Qwen 4.5 måste slå på båda axlarna samtidigt.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max), captured September 23 2026, showing the model id, 1M-token context, text image and video input with text output, vision tools JSON and reasoning badges, a dated snapshot label of 2026-08-03, input at $2.00 and output at $6.00 per 1M tokens, p50 TTFT 3.09s and p95 TTFT 10.00s, trailing-7-day traffic of 29.4M tokens, and a Python code sample posting to the OpenAI-compatible base_url https://api.orcarouter.ai/v1.

OrcaRouter har Qwen 3.8-familjen — qwen/qwen3.8-max, qwen3.8-flash och qwen3.8-27b — på en enda OpenAI-kompatibel slutpunkt tillsammans med över 200 andra modeller, vilket innebär att en Qwen 4.5-nivå skulle vara ett byte av modell-id på en befintlig nyckel snarare än ett nytt leverantörsavtal, en ny faktura och ett nytt SDK. När en sådan lanseras är det i den katalogen den skulle dyka upp. I dag finns varken Qwen 4.5 eller Qwen 5 med där, eftersom ingen av dem har släppts — och ingen mängd press om färdplanen ändrar på det.

Den praktiska användningen av en färdplan som denna är motsatsen till en migreringsplan. Om en Qwen 4.5-nivå så småningom framstår som rimlig för din arbetsbelastning är det billiga sättet att ta reda på det att dirigera en del av verklig trafik till den bakom en automatisk reservväxling, så att en modell som visar sig vara långsam, dyr eller sämre än den befintliga kostar dig en procentandel av en arbetsbelastning i stället för en fjärdedel. Det är vad failover är till för, och en obeprövad frontier-modell som bara är några dagar gammal är det tydligaste fallet för att använda det.

Vad man bör hålla utkik efter, och vad man inte bör tro på ännu

En rad på en färdplan blir ett släpp när en liten uppsättning konkreta saker dyker upp. Ett modellkort med ett totalt antal parametrar, ett antal aktiva parametrar och ett kontextfönster. En API-identifierare som du kan skicka med i en begäran. Vikter på en modellhubb. En post på en oberoende resultattavla med ett datum angivet. Ett pris. Var och en av dessa är en signal; de flesta av dem tillsammans är en lansering.

Saker som inte är en release, hur tekniska de än ser ut: ett konferensomnämnande; en pull request i ett serveringsramverk som lägger till en arkitekturgren för en experimentell Qwen-build, vilket är motorarbete i någons inferensstack snarare än en modell som du kan anropa; ett daterat ögonblicksbilds-id för en generation som redan har släppts; och ett socialt inlägg som parafraserar ett uttalande från scenen. Signalen som gav upphov till den här artikeln var den sista av dessa, och anledningen till att den var värd att skriva om är att det underliggande påståendet går att kontrollera mot Alibabas eget pressmeddelande — vilket är varifrån spannet 5–10 biljoner, Qwen 4-statusen och RSI-siffrorna alla kommer. Signalen pekade på historien; den är inte historien.

Den kortsiktiga frågan är snävare än vad rubrikerna antyder. Alibaba har sagt att Qwen 4 är under träning, vilket placerar Qwen 4 före både 4.5 och 5 i sekvensen – så nästa sak som är värd att bevaka är inte en modell med 10 biljoner parametrar, utan om Qwen 4 kommer med ett modellkort, ett pris och en slutpunkt, och när. Tills något i den kedjan landar är den ärliga hållningen till intervallet 5 till 10 biljoner att det är en färdriktning, öppet redovisad, utan någon specifikation kopplad till den och utan datum. Planera för Qwen3.8-Max, bevaka 4.5- och 5-bandet som en skalningstes snarare än en produkt, och behandla varje parameterantal du ser för en modell utan modellkort som en prognos.