Ett hero-titelkort för 'Qwen3.8-Max vs Qwen 3.8' med underrubriken 'En 2,4T-kärna – hyrt API eller öppna vikter', badges för 0902-uppdateringen den 2 september 2026, det hostade API:t för $2/$6 per 1M tokens, och de öppna vikterna från 12 augusti, samt en sidfot med noteringen om den oberoende Code Arena WebDev #1 på 1,691 för 0902-versionen och att den öppna checkpointen ännu inte har några oberoende poäng.
Guides & Insights

Qwen3.8-Max vs Qwen 3.8: En 2.4T-kärna, hyrd eller körd — efter 0902-uppdateringen

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Den 2 september 2026 släppte Alibaba en daterad uppdatering av Qwen3.8-Max — den version som de betecknar som Qwen3.8-Max-0902 — och en oberoende kodnings-topplista placerade den nya versionen på #1 samma vecka. Den nedladdningsbara versionen av samma kärna på 2,4 biljoner parametrar, den modell som de flesta menar när de skriver "Qwen 3.8" utan suffix, befinner sig fortfarande vid sin checkpoint från 12 augusti: endast text, resonemangsläget på, och hundratals gigabyte ifrån att kunna köras på något mindre än en GPU-rack. Den klyftan mellan den värdbaserade flaggskeppsmodellen och de öppna vikterna fanns inte i augusti. Den är hela jämförelsen nu, och det är därför samma modell fortsätter att säljas till dig under två namn.

Qwen3.8-Max är Alibabas värdbaserade flaggskepp: en gles mixture-of-experts-modell med 2,4 biljoner parametrar, där ungefär 95 miljarder parametrar är aktiva per token, live på ett prissatt API sedan den 3 augusti och med ett multimodalt kontextfönster på 1 miljon token. Qwen 3.8, som fristående namn, är samma generations öppna release – mest betydelsefullt Qwen3.8-2.4T-A95B, de vikter som Alibaba publicerade den 12 augusti under en anpassad licens. De är inte ett billigare syskon och ett premiumsyskon. De är samma hjärna såld på två sätt, och en efterträningsomgång i september har börjat dra isär de två leveranserna. Den här texten reder ut vilken ”Qwen 3.8” du faktiskt tittar på, vad 0902-uppdateringen ändrade, och vilken väg – hyra API:et eller köra vikterna – du bör vara på idag.

Mötet som inte är en rivalitet

Före datumen och prislistorna kommer arkitekturen: Qwen3.8-Max och Qwen3.8-2.4T-A95B delar en finkornig MoE-design med 512 experter per lager (10 dirigerade plus en delad, per lager), 92 lager och en hybridstack där 69 av de 92 lagren använder linjär attention – Gated DeltaNet kombinerat med gated attention – med full attention invävd för arbetet med långa kontexter. Det är därför modellkortet kan göra anspråk på en kontext på en miljon token i API:et och varför den öppna versionen når en nativ 262K som med rätt serveringskonfiguration sträcker sig mot en miljon. Skillnaderna mellan de två namnen ligger inte i vikternas arkitektur; de ligger vid gränserna, och gränserna har flyttats sedan den 2 september.

• Parametrar — Qwen3.8-Max: 2,4T totalt / ~95B aktiva, MoE. Qwen3.8-2.4T-A95B: samma kärna, samma antal aktiva.

• Leverans — Qwen3.8-Max: värdbaserat API, live sedan 3 augusti, uppdaterat som Qwen3.8-Max-0902 den 2 september. Qwen3.8-2.4T-A95B: nedladdningsbara vikter, först publicerade 12 augusti, ingen nyare checkpoint sedan dess.

• Modalitet — Qwen3.8-Max: text-, bild- och videoinmatning. Qwen3.8-2.4T-A95B: endast text.

• Reasoningskontroll — Qwen3.8-Max: tankelägen, inklusive ett icke-tänkande läge. Qwen3.8-2.4T-A95B: tänkande alltid på, med endast en ratt för resoneringsinsats (låg / hög / extra hög).

• Verktyg — Qwen3.8-Max: nativa funktionsanrop, fem inbyggda verktyg och strukturerad utdata. Qwen3.8-2.4T-A95B: inget inbyggt verktygslager; vad du får beror på vilket inferensramverk du serverar den med.

Vad uppdateringen den 2 september ändrade

0902-versionen är en post-träningsomgång, inte en ny arkitektur. Alibaba riktade den mot de två saker som Qwen3.8-Max redan var känd för — kodning och ”cowork”, dess namn för långsiktigt agentiskt arbete och kontorsarbete — och de siffror som presenteras kring den är anledningen till att den här uppdateringen spelar roll. På den oberoende Code Arena: WebDev-topplistan debuterade Qwen3.8-Max-0902 med 1 691 Elo, ett hopp på 22 poäng jämfört med den tidigare versionen och tillräckligt för att ta förstaplatsen direkt. Alibaba beskriver också versionen som den modell som toppar den listans Pareto-front för kostnadsprestanda, till en blandad avgift på cirka 5 dollar per miljon tokens — listpriset på 2 och 6 dollar viktat mot den utdatatunga agentiska trafiken, ungefär en fjärdedel av vad ett jämförbart anrop till en frontier-modell kostar på andra håll. De siffrorna är en blandning som läsaren bör hålla isär: 1 691 Elo är ett oberoende arenresultat; Pareto-front-beskrivningen är Alibabas egen karaktärisering av den oberoende listan.

Alibabas interna utvärderingar för 0902-passet, leverantörsrapporterade och utan oberoende reproduktion, visar samma riktning: Terminal-Bench 3.0 stiger från 11,3 till 29,0, ProgramBench från 10,5 till 28,0, JobBench från 53,4 till 64,0 och WorkArena Elo från 1 348 till 1 468. Läs dessa som "uppdateringen flyttade de agentiska och kodningsrelaterade axlarna", inte som verifierade poäng. På den allmänna intelligenssidan har Artificial Analysis Intelligence Index Qwen3.8-Max på 56 – konkurrenskraftigt, men inte anledningen att välja den; kodnings- och agentresultaten är det.

Den del som de flesta bevakningar har missat är att 0902-postträningen, när detta skrivs, endast är tillgänglig via API. Alibaba har inte publicerat en öppen checkpoint av den uppdaterade modellen — Qwen3.8-2.4T-A95B-vikterna på Hugging Face spårar fortfarande till versionen från 12 augusti. Det innebär att den värdbaserade Qwen3.8-Max och den nedladdningsbara kärnan inte längre är samma modell som de var i mitten av augusti. API:et har september-postträningen; vikterna har den inte. Om hela anledningen till att du körde den öppna versionen var att exakt återskapa vad flaggskeppsmodellen gör, så upphörde det antagandet tyst att vara sant den 2 september.

A comparison scoreboard for Qwen3.8-Max (0902) and Qwen 3.8 (2.4T-A95B open): left column shows Hosted API with a Sep-2 build tag, Text + image + video, 1M native context, a thinking toggle including off, native tools and JSON, and $2/$6 per 1M with a $0.25 cache tag; right column shows Open weights with an Aug-12 tag, Text only, 262K native context, thinking always on, framework-level tools and JSON, and weights plus your own GPUs; the footer notes independent Code Arena WebDev 1,691 and AA Index 56 for the Max, and that the open checkpoint has no independent scores yet.

De fem punkterna där de verkligen skiljer sig åt.

Om man bortser från den gemensamma arkitekturen blir de praktiska skillnaderna tydliga. Modalitet är det första filtret: om din arbetsbelastning innehåller bilder eller video – skärmbilder, diagram, dokument med figurer, videorutor – är det bara Qwen3.8-Max som tar emot dem, och dess 1M-tokenfönster är inbyggt snarare än en utökning. De öppna vikterna är endast textbaserade. Resonemangskontroll är det andra: den värdbaserade API:n kan köras med resonemangsfunktionen avstängd, vilket är viktigt för latens- och volymkänslig extraktion där en tankekedja är ren overhead; den öppna versionen kan inte stänga av den. Verktygsstöd är det tredje: funktionsanrop, de fem inbyggda verktygen och JSON-läge ingår i den värdbaserade produkten, medan den öppna versionen beror på vad ditt serveringslager tillhandahåller.

Kontexten är mer nyanserad än vad specifikationen antyder. Båda sidorna kan nå ungefär en miljon tokens, men den värdbaserade modellen gör det inbyggt med multimodalt indata, medan den öppna byggets 262K inbyggda kontext måste utökas i konfigurationen, och varje token i det utökade fönstret är text. Även utdatagränserna skiljer sig — API:t tillåter upp till cirka 131K utdata-tokens, och den öppna bygget konfigureras vanligtvis till ett liknande tak, men det praktiska taket på den öppna sidan sätts av din serveringsstack, inte av modellen.

Vad varje rutt faktiskt kostar

Det är här som de två leveranserna slutar vara jämförbara över huvud taget. Qwen3.8-Max har ett listpris: 2,00 USD per miljon inmatningstokens, 6,00 USD per miljon utdatatokens och 0,25 USD per miljon för cachad inmatning. Eftersom OrcaRouter förmedlar leverantörernas listpriser med 0 % påslag, är det här priset du betalar, och när Alibaba ändrar priset är den nya siffran live samma dag. 0902-snapshoten är separat fastlåst som qwen/qwen3.8-max-0902 för team som vill ha reproducerbart beteende — samma pris, samma funktioner, men en fast checkpoint istället för den rullande modellen. I OrcaRouters trafik är 7-dagarsmedianen för tid till första token för Qwen3.8-Max ungefär 2–4 sekunder, och Artificial Analysis mäter runt 45–48 utdatatokens per sekund: inte långsam, men mångordig, vilket är anledningen till att agentiska uppgifter på den här modellen kan förbruka förvånansvärt många tokens trots det billiga priset.

A screenshot of the OrcaRouter model page for Qwen3.8-Max (qwen/qwen3.8-max), showing the flagship description, the price card at $2.00 per 1M input and $6.00 per 1M output tokens, a 1,000,000-token context window, and 7-day median time-to-first-token and traffic figures.

Qwen3.8-2.4T-A95B har inget listpris, eftersom priset är din infrastruktur. BF16-vikterna uppgår till ungefär 4,9 TB och till och med den officiella FP8-versionen är cirka 2,4 TB, så detta är hårdvara i rackskala: de minsta dokumenterade serveringskonfigurationerna börjar kring åtta B300- eller GB300-GPU:er, och ett komplett GB300 NVL72-rack är referensdistributionen. Aggressiv kvantisering ändrar golvet — en NVFP4-version får plats i ungefär 1,3 TB, och Unsloths 1-bitars skiktade kvantisering komprimerar modellen till cirka 397 GB, vilket slutligen gör en enda välutrustad nod genomförbar — men var och en av dessa vägar förutsätter att du driver GPU:er i datacenterskala. Tredjepartsvärdar som betjänar den öppna checkpointen säljer dig tokens under Max' pris per token, men du avstår från multimodal inmatning, icke-tänkande-läget, de inbyggda verktygen och 0902-postträningen i processen, och ingen oberoende benchmark av den nedladdningsbara checkpointen i sig har publicerats ännu. Alibabas eget modellkort är uppriktigt om förhållandet: det beskriver Qwen3.8-Max som den officiella versionen byggd på Qwen3.8-2.4T-A95B, som lägger till visuell inmatning, stöd för icke-tänkande, ett standardsammanhang på 1M och inbyggda verktyg ovanpå den öppna kärnan.

A screenshot of the Hugging Face model card for Qwen/Qwen3.8-2.4T-A95B, showing the Text Generation and Transformers tags and the card text explaining that Qwen3.8-Max is the official version built on Qwen3.8-2.4T-A95B with vision input, non-thinking support, a 1M default context, and built-in tools.

Oberoende siffror jämfört med leverantörers påståenden

Källhänvisningens ärlighet betyder mer här än i de flesta jämförelser, eftersom de två sidornas bevis har väldigt olika ålder. Qwen3.8-Max har oberoende poängsatts: Code Arena: WebDev 1,691-resultatet för 0902-bygget och Artificial Analysis' Intelligence Index på 56 är tredjepartsmätningar, och prissättningen som gör påståendet om Pareto-fronten intressant är en publicerad prislista. Qwen3.8-2.4T-A95B har ännu inte det — den benchmarktabell Alibaba publicerat beskriver Max-klassens kärna, inte en oberoende körning av den nedladdningsbara checkpointen, så den öppna sidan av denna jämförelse är fortfarande till stor del ”leverantören säger att kärnan presterar så här.” Om du väljer mellan dem utifrån kapacitet, behandla de öppna vikternas rubriksiffror som påståenden tills en tredje part kör dem.

Vem ska välja vilken

Beslutet framgår av listan ovan. Sök dig till den hostade Qwen3.8-Max — idag, specifikt 0902-bygget — när du behöver efterträningen från september, bild- eller videoinmatning, ett icke-tänkande läge, inbyggda verktyg och strukturerad utdata, eller ett fönster på en miljon tokens utan att sätta upp infrastruktur. Det är frontpositionen för kodning och agentiska förmågor, och till $2/$6 med $0.25 cachad inmatning är det aggressivt prissatt för vad det är.

Välj Qwen3.8-2.4T-A95B när kontroll väger tyngre än bekvämlighet: du behöver vikterna på egen hårdvara eller hos en leverantör du redan driver, du vill ha en fast checkpoint som du kan granska och reproducera, eller din kontinuerliga volym gör kostnaden per token till den dominerande posten och du är beredd att köra en 2.4T MoE. Acceptera avvägningslistan — endast text, tänkande alltid på, inget inbyggt verktygsstöd, ingen 0902-efterträning ännu — och kontrollera licensvillkoren för din intäktsklass, eftersom den anpassade Qwen3.8-Max-licensen inte är Apache 2.0 och lägger till villkor för stora kommersiella operatörer.

Om din arbetsbelastning har hög volym, sker på en enda GPU eller är latenskänslig, är kanske ingen av dessa rätt väg — generationens syskonmodell med 27 miljarder parametrar, Qwen3.8-27B, är den som är rätt dimensionerad för det, och den behandlas separat i vår jämförelse Qwen3.8-27B vs Qwen3.8-Max.

Så här provar du båda utan att satsa hela stacken

Det rena sättet att göra den här bedömningen är att köra båda sidorna på dina egna prompts, och det är här ett routinglager kommer till sin rätt snarare än att det skruvas på i efterhand. Qwen3.8-Max och den fastlåsta snapshoten Qwen3.8-Max-0902 ligger båda bakom en OpenAI-kompatibel endpoint på OrcaRouter, så att växla mellan den rullande flaggskeppsmodellen och den reproducerbara checkpointen är ett model-id-byte, inte en ny driftsättning. När ett team bestämmer sig för att ta de öppna vikterna i egen drift kan routing-DSL:en stå framför en självhostad vLLM- eller SGLang-endpoint som serverar Qwen3.8-2.4T-A95B och placera den i samma anropsgraf — bulktrafik går till din egen driftsättning, medan svåra prompts och multimodala förfrågningar slussas till den hostade Qwen3.8-Max, med automatisk failover mellan dem. Att på det sättet prova en ny checkpoint innebär en konfigurationsändring snarare än en migrering, vilket är precis vad du vill ha när de två sidorna i den här jämförelsen fortfarande rör sig i olika takt.

Slutsatsen

Qwen3.8-Max och Qwen 3.8 är inte två modeller som tävlar om samma uppgift. De är en enda kärna på 2,4 biljoner parametrar som levereras som en hyrd API och som nedladdningsbara vikter, och uppdateringen den 2 september gjorde att de två leveranserna betyder olika saker. Hyr du API:t får du 0902-efterträningen som tog ledningen i Code Arena: WebDev, tillsammans med vision, ett icke-tänkande läge, nativa verktyg och ett nativt fönster på en miljon tokens, till priset $2/$6 med $0,25 för cachad indata. Kör du de öppna vikterna får du samma arkitektur frusen i sitt tillstånd från 12 augusti — enbart text, resonemang alltid på — utan några oberoende poäng ännu och en nota för datacenterhårdvara. Om septemberförbättringarna inom kodning och agentiska förmågor betyder något för dig, är det bara en av de två namnen som har dem idag. Om reproducerbar kontroll betyder mer, är det bara en av de två namnen som är din att behålla.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen