
Qwen3.8-Max vs Qwen3.7-Max: Två Max-nivåer, 16 indexpoäng och en kampanj som vänder på priset
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 495 tok/s
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 186 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
För fyra dagar sedan berättade leverantören för oss att Qwen3.8-Max inte är den modell som den levererade i augusti. I ett pressmeddelande daterat den 22 september 2026, från Apsara Conference i Hangzhou, avslöjade företaget att dess flaggskepp genomförde 33 iterativa cykler av helt automatiserat tränings- och efterträningsarbete under mer än en månad, och att den resulterande versionen höjde sitt Artificial Analysis Intelligence Index från 40 till 45. Modell-ID:t ändrades aldrig. Siffran bakom gjorde det.
Det spelar störst roll på en specifik plats: jämförelsen mellan Qwen3.8-Max och Qwen3.7-Max, Max-nivån den ersatte. Qwen3.8-Max nådde allmän tillgänglighet den 3 augusti 2026; Qwen3.7-Max lanserades i maj. På papper ser detta ut som ett enkelt generationsval – nyare flaggskepp, högre poäng, gå vidare. Siffrorna säger något mer besvärligt. Den äldre nivån är tre till fyra gånger snabbare, ungefär fem gånger billigare per slutförd uppgift och identisk med den nyare på rena kunskapsbenchmark. Den nyare nivån är multimodal, dramatiskt bättre på agentiskt arbete och billigare på den internationella prislistan. Vilken du bör anropa beror på en fråga som de flesta jämförelser hoppar över: om du köper kunskap eller köper verktygsanrop.
Vad Apsara-avslöjandet faktiskt påstår
Redogörelsen är ett leverantörsuttalande, publicerat av Alibaba på företagets egen presswebbplats, och den bör läsas som ett sådant. Det som sägs är specifikt: under mer än en månad av helt automatiserade körningar som omfattade pipeline-design, datavalidering, iterativ experimentering och feldiagnos, slutförde Qwen3.8-Max 33 cykler, och autonom träningsoptimering plus efterträningsmetoder producerade poängförändringen. Alibaba beskrev också ett andra experiment inom chipdesign, där modellen genomförde mer än 60 timmars självförbättring under en designlivscykel, gjorde över 10 000 anrop till EDA-verktyg och producerade produktionsklara chipbussmoduler samtidigt som chipytan minskades med 42 % utan någon angiven prestandakompromiss. Allt detta är Alibabas redogörelse för sin egen modell, utan att någon utanför företaget har reproducerat den.
Själva poängförflyttningen är dock inte ett leverantörspåstående. Indexet tillhör Artificial Analysis, och 45:an finns på den tredje partens sida för Qwen3.8 Max (0902). 40:an som den flyttades från finns på samma organisations sida för versionen från 3 augusti, som nu är markerad som föråldrad och pekar framåt mot den nuvarande. Så deltat är en leverantörsrapporterad orsak kopplad till en oberoende bedömd effekt, vilket är en starkare position än någon av halvorna var för sig. Det är också, i skrivande stund, det mest konkreta offentliga beviset någon har på att ett frontlinjelabb flyttade sitt flaggskepps uppmätta förmåga utan att släppa ett nytt versionsnummer.
Två andra saker med lanseringen är lätta att missa och båda är bärande. För det första bekräftade Alibaba att Qwen 4 är under träning, med Qwen 4.5- och Qwen 5-serierna som förväntas skala till 5–10 biljoner parametrar. För det andra finns det en daterad ögonblicksbild av den uppdaterade modellen. Alibaba fäste den eftertränade versionen som qwen3.8-max-0902 den 2 september, och den är separat routbar. Den pinnade versionen är det praktiska svaret på allt som RSI-avslöjandet innebär, och vi återkommer till den.
Resultattavlan
Sex dimensioner, båda sidor, med källhanteringsdisciplinen explicit redovisad eftersom de två kolumnerna inte är lika väl verifierade.
• Kontextfönster — Qwen3.8-Max 1 000 000 tokens vs Qwen3.7-Max 1 000 000 tokens (identiska)
• Max utdata — 131 072 tokens mot 131 072 tokens enligt Alibabas egna modellsidor (identiska; notera att vår katalogsida för Qwen3.7-Max anger 64 000, en avvikelse vi flaggar i stället för att sopa under mattan)
• Inmatningsmodalitet — text, bild och video kontra enbart text
• Internationellt listpris per 1 miljon tokens – $2,00 in / $6,00 ut jämfört med $2,50 in / $7,50 ut; samma prislista debiterar redan båda modellerna $1,65 / $4,951 i Peking, Frankfurt och Virginia
• Artificial Analysis Intelligence Index — 45 mot 29
• Oberoende utdatahastighet — 39,7 tokens/sek mot 211,3 tokens/sek, mätt mot samma jämförelseklass med 211 modeller, där Artificial Analysis betygsätter den nyare nivån som märkbart långsam och den äldre som märkbart snabb
De två sista raderna är hela artikeln. Inom samma indexfamilj ligger den nyare nivån 16 poäng före. När det gäller hastighet ligger den mer än fem gånger efter.

Varifrån de 16 punkterna kommer — och varifrån de inte kommer
Dela upp Indexet i dess delar, och uppgraderingens form blir tydlig, och det är inte den form som marknadsföringen antyder.
När det gäller kunskap och resonemang är de två modellerna i praktiken likvärdiga. GPQA Diamond: 92,8 mot 92,3. Humanity's Last Exam: 43,1 mot 40,5. Återkallning i lång kontext: 80,33 mot 79. SciCode: 52,1 mot 49,5. Om din arbetsbelastning är frågebesvarande över en stor korpus är generationshoppet ett avrundningsfel. Att betala ett flerfaldigt pris för det skulle vara svårt att motivera.
Inom agentiskt arbete och kodningsarbete vidgas gapet kraftigt. Terminal-Bench 2.1: 88,76 vs 74,53. Kodindex från Artificial Analysis: 76,2 vs 66. Och den största avvikelsen i uppsättningen är bankuppgiften för verktygsanvändning, där Qwen3.8-Max uppnår 47,84 mot Qwen3.7-Max 11,75 — ett fyrfaldigt gap i precis den förmåga som RSI-beskrivningen säger att de automatiserade cyklerna optimerade: pipeline-design, datavalidering, iterativ experimentering, felsökning. En modell som lägger en månad på att förbättra sin egen träningsloop är en modell som blev bättre på loopar.
Ett ärligt förbehåll om de enskilda raderna. Båda modellsidorna tillhör samma revisionsfamilj för Intelligence Index (v4.3 och v4.3.2), vilket gör rubrikjämförelsen 45 mot 29 rättvis. Raderna per benchmark tillhör inte samma kohort: Qwen3.7-Max siffror på uppgiftsnivå är från utvärderingsfönstret i maj, medan Qwen3.8-Max kommer från septemberserien. Läs färdriktningen, inte den tredje signifikanta siffran.
Prisfrågan är två frågor
På Alibabas internationella prislista är den nyare Max billigare än den version den ersatte: $2.00 / $6.00 för Qwen3.8-Max mot $2.50 / $7.50 för Qwen3.7-Max, per miljon tokens. En sänkning med 20 % i båda riktningarna i takt med att generationen utvecklas är ovanlig och värd att notera i sig. Även cache-ekonomin gynnar den nyare nivån – implicit cache på $0.25 mot $0.50, explicit cacheläsning på $0.17 mot $0.25.
Det är den första frågan, och den har ett regionalt svar som den mesta bevakningen slätar över. Alibaba tar betalt för båda modellerna 1,65 USD indata / 4,951 USD utdata i Peking, Frankfurt och Virginia. Gapet på 20 % finns bara på det internationella Singapore-kortet. Om din trafik hamnar i de andra tre regionerna kostar indata- och utdatatokens lika mycket för båda Max-nivåerna i dag, och beslutet kokar ner till ren förmåga – då vinner den nyare modellen på allt utom genomströmning, och det finns ingen aritmetik kvar att göra.
Den andra frågan är fällan. Qwen3.7-Max kostar för närvarande inte $2.50 / $7.50. Den erbjuds till $1.25 / $3.75 — halva listpriset, ett kampanjpris. Det gör den tidigare generationen till det billigare alternativet idag, med bred marginal. Det innebär också att priset du kan mäta denna vecka inte är det pris du skulle binda dig till. Alibabas egen modellsida säger klart att den publicerade tabellen visar ursprungliga priser "exklusive eventuella tidsbegränsade kampanjer" och hänvisar dig till konsolen för aktuella erbjudanden. En kampanj är till sin natur ett pris som kan upphöra. Om den gör det blir Qwen3.7-Max inte bara dyrare än den är idag; den blir 25 % dyrare än den modell som överträffar den.
Vi förmedlar leverantörens pris vidare utan påslag (0 %), så både listpriset och kampanjen är uppdaterade hos oss samma dag som de ändras – vilket är bekvämt för en jämförelse och inte till någon hjälp om du försöker budgetera. Bygg modellen utifrån listkortet och behandla kampanjpriset som en uppsida.

Siffran som vänder på kostnadsargumentet
Tokenpris är inte vad en uppgift kostar. Artificial Analysis publicerar ett nyckeltal för kostnad per uppgift som väger in cache-ekonomi, resonemangsvolym och svarslängd, och enligt det måttet inverteras rangordningen helt: $5,41 per uppgift i Intelligence Index för Qwen3.8-Max mot $1,15 för Qwen3.7-Max. En premie på 4,7×, mot ett tokenpris som antingen är 20 % billigare eller identiskt beroende på din region.
Skillnaden består mest av mångordighet. I samma utvärdering genererade den nyare modellen 190M utdatatoken mot den äldre modellens 120M, och den resonerar länge för att komma fram till sina svar. Om du betalar per utdatatoken för en arbetsbelastning med hög volym och måttlig svårighetsgrad är den nyare Max inte den billigare modellen till något tokenpris på någon av de båda prislistorna. Den är den dyrare, och listpriset per token är fel instrument för att avgöra det.
Hastighet, och vad vår egen trafik visar
Genomströmningsgapet är tillräckligt stort för att förändra arkitekturer. Artificial Analysis placerar Qwen3.8-Max på 39,7 tokens per sekund – deras sammanfattning kallar modellen anmärkningsvärt långsam – mot 211,3 för Qwen3.7-Max, som de kallar anmärkningsvärt snabb. Det är skillnaden mellan en modell som du sätter bakom en interaktiv yta och en som du sätter bakom en kö – och på Qwen3.8-Max är det det första som vår egen statistikpanel visar dig.
Vår egen playground-telemetri under de sju dagarna fram till den 25 september berättar en något mer nyanserad historia om latens, och den kommer med en varning: det här är våra mätningar på vår routing, inte ett kontrollerat benchmark. Qwen3.8-Max visade en median på 2 611 ms till första svar vid 54,7 tokens per sekund med en felfrekvens på 2,45 %; det pinnade 0902-bygget visade en median på 3 360 ms vid 46,2 tokens per sekund med en märkbart renare felfrekvens på 0,66 %. Qwen3.7-Max låg på en median på 4 509 ms men 169,8 tokens per sekund med en felfrekvens på 3,80 %. Så den äldre nivån svarar långsammare initialt och strömmar sedan tre gånger snabbare, samtidigt som den misslyckas oftare. Om din arbetsbelastning är burstig är den där skillnaden i felfrekvens värd mer uppmärksamhet än medianen.
Båda nivåerna är aktiva på en och samma OrcaRouter-nyckel tillsammans med den fastnålade ögonblicksbilden, med automatisk failover mellan leverantörer. För en jämförelse som denna är det den praktiska poängen: att mäta dina egna prompter mot båda Max-generationerna är en konfigurationsändring, inte ett andra avtal.

Reproducerbarhet är nu den avgörande faktorn
Här är den del av Apsara-avslöjandet som ingen har prissatt. Ett aktivt modell-ID vars uppmätta kapacitet förändrades från 40 till 45 under loppet av en månad, utan versionsändring och utan tillkännagivande vid tidpunkten, är en reproducerbarhetsrisk. Om ditt produktbeteende är en funktion av ett rörligt ID har du en modell som kan förbättras — eller förskjutas — under en fryst utvärderingssvit, ett cachelagrat promptbibliotek eller en godkänd regressionsuppsättning.
Båda generationerna erbjuder daterade ögonblicksbilder, och det är riskbegränsningen. Qwen3.7-Max dokumenteras av Alibaba som funktionellt likvärdig med qwen3.7-max-2026-05-20, med ytterligare daterade byggen vid 2026-05-17 och 2026-06-08. Qwen3.8-Max har qwen3.8-max-0902, det eftertränade septemberbygget, vilket är vad 45 syftar på. Om du levererar något som behöver kunna reproduceras, lås det daterade ID:t och behandla det flytande ID:t som ett stagingmål. RSI-cyklerna är en egenskap hos det flytande ID:t; låsningen är hur du väljer bort dem.
En detalj om namngivning som är värd att känna till så att du inte misstolkar katalogen. Alibaba listar en tredje daterad form, qwen3.8-max-2026-09-02, vid sidan av aliaset 0902; de avser samma build. Den ursprungliga versionen från 3 augusti går inte längre att routa hos oss – vi tillhandahåller Qwen3.8-Max, dess 0902-pin, och Qwen3.7-Max.
Vem ska välja vilken
Beslutet avgörs inte av vilken modell som är bättre. Det avgörs av vad du köper.
Stanna kvar på Qwen3.7-Max om din arbetsbelastning är enbart textbaserad, kunskapstung snarare än verktygstung och känslig för genomströmning – högvolymklassificering, extrahering, långkontextsökning, batchsammanfattning. På GPQA Diamond och långkontextåterkallning ligger den inom en poäng från den nyare modellen, den strömmar tre till fyra gånger snabbare och kostar 1,15 USD per uppgift mot 5,41 USD. Det är också rätt svar för alla som vill ha en billig andra åsikt i en fusion- eller routingkonfiguration, eftersom den till sitt kampanjpris tillhör en helt annan prisklass. Två förbehåll: kampanjen är en kampanj, och Artificial Analysis har redan flaggat modellen som utfasad, ersatt av Qwen3.8-Max. Inled inte ett flerårigt åtagande baserat på den.
Byt till Qwen3.8-Max om något av följande stämmer: du behöver bild- eller videoinmatning, vilket Qwen3.7-Max inte accepterar alls; din arbetsbelastning är agentisk, med långa verktygsanropskedjor eller kodningsloopar i flera steg, där 88,76 mot 74,53 på Terminal-Bench 2.1 och den fyrdubbla skillnaden i verktygsanvändning är skillnaden mellan att leverera och inte; eller du skriver mot Singapores internationella prislista, där den nyare modellen helt enkelt är 20 % billigare och det finns inget avvägande att göra. Fäst qwen3.8-max-0902 om du behöver att beteendet håller sig stilla.
Om du befinner dig i Peking, Frankfurt eller Virginia är valet enklare än någon jämförelse antyder: båda Max-nivåerna kostar $1.65 / $4.951 per miljon tokens. Identiskt. Till dessa priser är att inte betala något extra för multimodala indata, ett 16 punkter högre Index och en fyra gånger bättre poäng för verktygsanvändning inte ett beslut, det är gratis – och den enda anledningen att stanna kvar på Qwen3.7-Max blir rå genomströmning.
Två frågor värda att besvara direkt
Innebär träningskörningen på 33 cykler att modellen förändrades under befintlig API-trafik? Det är vad avslöjandet antyder, och det är därför den daterade pinningen finns. Alibaba beskriver den förbättrade modellen som "den uppdaterade Qwen3.8-Max", vilket är det flytande ID:t, inte ett nytt. Om du hade arbetsbelastningar på det flytande ID:t under september betjänades de av en modell vars uppmätta förmåga förändrades under det fönstret. Alibaba har inte publicerat någon ändringslogg för de mellanliggande byggena, så det enda tillförlitliga sättet att veta vilket beteende du har är att pinna.
Är RSI-påståendet oberoende verifierat? Poängen den producerade är det – Indexet tillhör Artificial Analysis, och 45:an står på deras sida. Mekanismen bakom det är Alibabas egen beskrivning av sin egen träningsprocess, utan extern replikering, utan publicerat utvärderingsprotokoll och utan någon tredje part som observerar de 33 cyklerna. Betrakta "33 iterativa cykler" som ett leverantörspåstående och "45 efter 40" som ett uppmätt par. De är inte samma typ av påstående, och skillnaden är anledningen till att rubriken är värd att läsas noggrant i stället för att upprepas.
Nästa sak att hålla utkik efter är inte Qwen 4. Det är huruvida halvpriskampanjen för Qwen3.7-Max överlever ankomsten av modellen som är tänkt att ersätta den. Om den inte gör det kommer väldigt många team att upptäcka att de jämförde ett listpris mot en rabatt, och att den äldre av två syskon hela tiden var den dyrare.
