
Qwen3.8-Max-recension: Alibabas 2.4T-flaggskepp till $2/$6 — 0902-builden toppar Code Arena WebDev
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0240Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligens69Kodning
Alibaba Qwen förhandsvisade Qwen3.8-Max på World AI Conference i Shanghai den 19 juli 2026, och i två veckor var det den mest omtalade modellen som ingen egentligen kunde prissätta. Det fanns ingen prislista, ingen benchmark-tabell, inget modellkort, ingen licens och inget antal aktiva parametrar – bara en rubrik om 2,4 biljoner parametrar och ett påstående om att modellen låg ”näst efter Claude Fable 5.”
Den 3 augusti 2026 ändrades det. Qwen3.8-Max är allmänt tillgänglig: en publicerad prislista på 2 dollar per miljon inmatningstokens och 6 dollar per miljon utmatningstokens, en OpenAI- och DashScope-kompatibel slutpunkt, en fullständig benchmarktabell och öppna vikter som släpptes den 12 augusti. En vecka senare, den 14 augusti, lanserades den på DigitalOcean Serverless Inference som Alibabas "Day 0-lanseringspartner" – det första stora västerländska molnet att erbjuda den. Den 2 september levererade Alibaba en namngiven uppdatering, Qwen3.8-Max-0902, ytterligare eftertränad på Coding och Cowork, vilket enligt Qwen stärker prestandan i komplexa företags- och vetenskapliga arbeten. Denna recension är skriven utifrån GA-fakta, med den där dag-noll-lanseringen och 0902-versionen inbakade, och den besvarar den fråga som team faktiskt har nu när modellen går att köpa: är Qwen3.8-Max redo att ta emot produktionstrafik, eller är den fortfarande en modell att bevaka?
Det korta svaret är att den nådde längre än de flesta förväntade sig – särskilt prissättningen är aggressiv på ett sätt som sätter en ny prispunkt för frontlinjen, och den 2 september-uppdateringen satsar dubbelt på de två saker som modellen redan var bra på – kodning och samarbete. Den oberoende utvärderingen som sedan dess publicerats är genuint bra, men den innehåller en brasklapp som är värd att läsa innan du skickar trafik till den.
TL;DR. Qwen3.8-Max is now GA at $2 / $6 per 1M tokens, flat across the entire 1M-token context with no long-prompt surcharge — undercutting Kimi K3 ($3/$15) and Claude Opus 5 ($5/$25) on output, the cost driver for reasoning work. Alibaba published a strong benchmark table (Terminal-Bench 2.1 86.6, GPQA Diamond 92.6, OSWorld-Verified 86.1) and the coding jump over its predecessor is dramatic: FrontierSWE 73.5 versus 40.7. But the quality table is Alibaba's own, and the first independent referee — the Artificial Analysis Intelligence Index — has now weighed in: Qwen3.8-Max scores 56 at $1.14 per task, on par with Claude Opus 4.8 (56) and one point behind open-weights leader Kimi K3 (57) at a 25% higher cost per task. The active-parameter count is no longer a question mark: 95B activated out of 2.4T total, confirmed on the official model card, which at last lets outsiders reason about serving economics. Since this review first went up, a second managed path opened too: Qwen3.8-Max went live on DigitalOcean Serverless Inference on August 14 as Alibaba's Day 0 partner, with DigitalOcean-published serving numbers — prefill scaling to ~16,000 tokens/sec and ~1,937 output tokens/sec at 256 concurrent requests with zero errors — that are the first hard latency data from a provider other than Alibaba. On September 2, Alibaba refreshed the flagship as Qwen3.8-Max-0902, further post-trained on Coding and Cowork; Qwen says the new snapshot is stronger on complex enterprise and scientific workloads — a vendor claim with no independent numbers yet on enterprise or scientific work. The 0902 build's coding side now has an independent arena result of its own: Qwen3.8-Max-0902 debuted at #1 on the Code Arena: WebDev board at 1,691 points — up 22 from the previous build and ahead of Claude Opus 5 and Kimi K3 — per Alibaba, citing the live third-party arena listing. The agentic-commerce story gained a scoreboard the same week: on CommerceAgentBench, a new benchmark from Alibaba's Accio team built on stateful replicas of real commerce software, Qwen3.8-Max posts the strongest open-weight result — 156 aggregate passes across three harnesses, two ahead of DeepSeek V4 Pro — a vendor-run table, not an independent referee. Verdict: genuinely buyable now, and cheap enough to justify a real evaluation — but route it deliberately, not wholesale.
Viktiga slutsatser
• GA sedan 3 augusti 2026. Eran med förhandsvisningar och kreditkampanjer är över; det finns en riktig prislista och en riktig slutpunkt.
• $2 / $6 per 1M tokens, en enda fast prisnivå över 1M kontext. De flesta konkurrenter tar extra betalt för långa prompter. Alibaba gör det inte, vilket spelar enormt stor roll för arbete med långa dokument och stora repon.
• Alibabas benchmarktabell är stark men inte oberoende verifierad: Terminal-Bench 2.1 86.6, GPQA Diamond 92.6, PaperBench 93.0, IFBench 82.8, OSWorld-Verified 86.1, OmniDocBench 1.5 92.1.
• Den egentliga nyheten är kodgenerationssprånget: FrontierSWE 73.5 (från 40.7) och DeepSWE 1.1 56.6 (från 21.6) — nästan en fördubbling för båda.
• Det första oberoende resultatet är inne: Qwen3.8-Max får 56 på AA Intelligence Index för $1.14 per uppgift — ett hopp på tio poäng över Qwen3.7-Max (46), i paritet med Claude Opus 4.8 (56), en poäng efter Kimi K3 (57). LMArenas allmänna leaderboard har fortfarande ingen offentlig poäng.
Aktiva parametrar bekräftade till 95B — det officiella modellkortet anger 2,4T totalt och 95B aktiverade, vilket stänger den största öppna frågan i beräkningen av serveringskostnaderna.
Öppna vikter finns nu ute — {{1}}Qwen3.8-2.4T-A95B (BF16){{/1}} och {{2}}Qwen3.8-2.4T-A95B-FP8{{/2}} publicerades på Hugging Face den 12 augusti under en anpassad Qwen3.8-Max-licens, inte Apache 2.0. Qwen3.8-27B-vägen för lokal drifttogs i drift den 14 augusti under Apache 2.0.
• En andra hanterad sökväg öppnades den 14 augusti. Qwen3.8-Max är live på DigitalOcean Serverless Inference som Alibabas "Day 0-lanseringspartner" — NVFP4 på NVIDIA HGX B300, $2/$6 med $0.20 cachad input, serverad med den öppna checkpointens inbyggda 262K-kontext. DigitalOceans uppmätta siffror (prefill ~16K token/sek, noll fel vid 256 samtidiga anrop) är de första serveringsprestandadata på en hanterad plattform utanför Alibaba.
• Uppdatering den 2 september: Qwen3.8-Max-0902. Alibaba fortsatte att post-träna flaggskeppsmodellen på Coding och Cowork och serverar den på QwenCloud till samma $2/$6 och 1M-kontext. Qwen säger att prestandan för företag och vetenskap är starkare — fortfarande leverantörspåståenden — medan kodningssidan samma dag fick ett oberoende arenaresultat: bygget debuterade som #1 på Code Arena: WebDev med 1 691 (Code Arena-punkten nedan).
• CommerceAgentBench: ledare bland open-weight-modeller, leverantörsdriven. Alibabas Accio-team släppte CommerceAgentBench den här veckan — 107 uppgifter med lång tidshorisont i statefulla repliker av verklig handels- och affärsprogramvara, bedömda tillståndsbaserat i Accio-, OpenClaw- och Pi-ramverken. Qwen3.8-Max leder open-weight-modellerna med 156 sammanlagda godkända körningar, två före DeepSeek V4 Pro; den stängda modellen Claude Opus 5 leder totalt med 191, och tabellen är Alibabas egen, inte en oberoende domare.
• Code Arena: WebDev #1 — 0902-buildens oberoende resultat i arenan. Qwen3.8-Max-0902 debuterade överst på topplistan i Code Arena: WebDev med 1 691 poäng — en ökning med 22 från den tidigare builden och före Claude Opus 5 och Kimi K3 — och den leder Paretofronten för kostnadsprestanda på denna topplista vid ett blandat pris på ~5 USD/MToken, ungefär en fjärdedel av Claude Opus 5:s blandade pris. Qwens officiella QwenCloud-konto bekräftade placeringen. Till skillnad från CommerceAgentBench är denna topplista från tredje part: en blind arena där människor röstar, inte en Alibaba-tabell, även om uttalandet ’att debutera som #1’ är Alibabas tillkännagivande av en topplacering som gäller vid en specifik tidpunkt.
Accuracy note: the Qwen3.8-Max benchmark table in this review is Alibaba-reported and has not been independently replicated. The Artificial Analysis Intelligence Index score (56 at $1.14/task) is independently measured by AA on Alibaba's official API — the model's first independent referee. Pricing is from Alibaba Model Studio's GA rate card. The open-weights repositories (Qwen3.8-2.4T-A95B and Qwen3.8-2.4T-A95B-FP8), the 95B-active figure, and the license text are first-party: they come from Qwen's own Hugging Face organization, verified August 13, 2026. The DigitalOcean availability, its rate card, the serving-performance measurements, and the GPQA spot-check of 88 on the quantized build come from DigitalOcean's own docs and community tutorial, published alongside the August 14 announcement; the "Day 0 launch partner" characterization is Alibaba's announcement language. Where we cite competitor numbers they come from Artificial Analysis or the vendor named inline. The Qwen3.8-Max-0902 refresh announced September 2 is vendor-stated throughout: its specs, its Coding-and-Cowork post-training description, and the claimed enterprise and scientific gains all come from Qwen's own announcement and its QwenCloud model page, and none of its numbers have been independently reproduced. The Code Arena: WebDev position covered in the benchmark section is the one exception: that board is a third-party, blind-vote arena rather than an Alibaba table — though 'debuting at #1 with 1,691' is Alibaba's announcement of a point-in-time listing, and arena scores keep moving as votes accrue. The CommerceAgentBench result covered below is in the same category: the benchmark was built and published by Accio, Alibaba International's team, so its tables are Alibaba-reported — an open-source benchmark, but not an independent referee in the way Artificial Analysis is. Vendor benchmark tables run optimistic as a rule — treat these as a hypothesis to test on your own workload, not a settled ranking.

Vad är Qwen3.8-Max?
Qwen3.8-Max är flaggskeppet i Alibabas Qwen-familj: en gles Mixture-of-Experts-modell med 2,4 biljoner totala parametrar, ett kontextfönster på 1M tokens och nativ multimodal indata. Den tar emot text, bilder och video och returnerar text. Den stöder tankeläge, funktionsanrop, inbyggda verktyg och strukturerad utdata, och den serveras via en OpenAI-kompatibel /v1/chat/completions-endpoint, vilket innebär att de flesta befintliga integrationer bara behöver ändra base-URL:en snarare än att skriva om. Den nuvarande produktionsversionen, som släpptes den 2 september, är Qwen3.8-Max-0902, ytterligare eftertränad på Coding och Cowork.
De praktiska kontextsiffrorna är något mer specifika än marknadsföringens "1M." Alibabas molnmetadata listar ett fönster på 983 616 tokens med tänkande aktiverat, en maximal inmatning på cirka 991K tokens, och en maximal utdata på 131 072 tokens. Detta tak för utdata är ovanligt generöst och spelar roll för uppgifter som kodgenerering för hela filer eller utkast till långa rapporter, där lägre tak tvingar dig att dela upp och sy ihop. Den öppna checkpointen som DigitalOcean nu erbjuder är en annan konfiguration: dess modellkort listar 262 144 tokens inbyggt, utökningsbart till cirka 1 010 000, så tredjepartsservrar som kör den öppna basen landar vanligtvis på det mindre inbyggda antalet.
Antalet aktiva parametrar är nu offentligt, och repo-namnet bär det: A95B betyder 95 miljarder aktiva. Det officiella modellkortet för Qwen3.8-2.4T-A95B anger ”2.4T totalt och 95B aktiverade”, en finkornig mixture-of-experts med 512 experter, varav 10 routade plus en delad är aktiva per token. Den siffran betyder mer än 2.4T-siffran i rubriken. För en tät modell säger totala parametrar ungefär vad inferens kostar; för en MoE-modell säger de nästan ingenting – bara antalet aktiva gör det, eftersom det är det som faktiskt körs per token. En 2.4T-modell som aktiverar 30B beter sig helt annorlunda, i latens och driftsekonomi, än en som aktiverar 200B. Med 95B aktiva hamnar beräkningsarbetet per token i samma storleksordning som en tät modell runt 90B-märket – en bråkdel av vad en tät 2.4T skulle kräva – vilket är den siffra som slutligen gör självhostningsfrågan nedan möjlig att besvara.
Uppdateringen den 2 september: Qwen3.8-Max-0902
On September 2, 2026, Qwen shipped its first named production refresh. Qwen3.8-Max-0902 keeps the same 2.4T-parameter sparse-MoE architecture, the same 95B active parameters, and the same 1M-token context window, but it has been further post-trained on two capabilities — Coding and Cowork — and it is live on QwenCloud's API as qwen3.8-max-0902 (also listed as qwen3.8-max-2026-09-02). It is the current recommended build rather than a side branch: Alibaba's undated qwen3.8-max endpoint now serves the 0902 snapshot, so a call to the standard model name lands on the refresh, while the dated id is there for teams that want to pin the exact build. From September 3 the snapshot has also been listed as its own routable model id on third-party managed APIs. The rate card did not move: $2 per 1M input, $6 per 1M output, with the same cache rates.
Prestandapåståendena är Qwens. Tillkännagivandet och QwenCloud-modellsidan beskriver en kodningsförmåga som ”bryter ny mark” inom projekt i ingenjörsskala och autonom utveckling över långa tidshorisonter, en ”avsevärt förbättrad” samarbetsupplevelse för agenter vid orkestrering av flera verktyg och leverans av uppgifter från början till slut, samt – som företaget uttrycker det – starkare prestanda för komplexa företagsuppgifter, vetenskaplig forskning och långcykliska arbetsflöden. Den första oberoende kontrollen kom samma dag. Qwen3.8-Max-0902 debuterade som #1 på listan Code Arena: WebDev – en tredjepartsarena med anonym röstning för agentbaserad webbutveckling, det projekt som tidigare kallades WebDev Arena – med 1 691 poäng, 22 fler än föregående version och före Claude Opus 5 och Kimi K3, enligt Alibaba som hänvisade till den liveuppdaterade listan – en placering som Qwens officiella konto bekräftade samma dag, med hänvisning till QwenCloud API. Vad detta bevisar och inte bevisar bryts ner i benchmarkavsnittet nedan. Modelluppdateringens återstående påståenden – enterprise-resonemang, vetenskapligt arbete och allmän långsiktig autonomi – bygger fortfarande bara på leverantörens uppgifter, så tillämpa samma disciplin som för augustitabellen: betrakta dem som hypoteser tills en Artificial Analysis-genomgång eller en verklig arbetsbelastning bekräftar dem.
Vad "Cowork" innebär i praktiken är där uppdateringen blir intressant. GA-erans Qwen3.8-Max lutade sig redan mot långsiktig autonomi – det 16 dagar långa oh-my-cli-bygget, den virtuella verksamheten med över 2 000 rundor – och 0902-bygget är Alibaba som satsar ännu hårdare på den axeln: agenter som orkestrerar flera verktyg och levererar en uppgift från början till slut i stället för engångssvar. Samma vecka publicerade Alibabas Accio-team CommerceAgentBench, ett benchmark byggt för att mäta just den axeln direkt: 107 långsiktiga uppgifter i stateful-repliker av verklig handels- och affärsprogramvara, där Qwen3.8-Max leder bland open-weight-modellerna – detaljerat i benchmark-avsnittet nedan. För team som utvärderar modellen för företagsarbete är det det påstående man bör testa först, eftersom det också är det svåraste att verifiera från en benchmark-tabell.
Prissättning: det mest aggressiva med den här lanseringen.
Alibaba Model Studio listar Qwen3.8-Max till $2.00 per 1M inmatningstokens och $6.00 per 1M utdatatokens. Utdata inkluderar tanketokens, vilket är viktigt eftersom resonemangstunga konfigurationer debiterar sitt interna tänkande till utdatapriset. Cache-ekonomi: cachade inmatningsträffar kostar $0.25 per 1M, explicit cache-skapande $2.50, och explicit cache-läsningar $0.17.
Det strukturellt intressanta är inte huvudnumret, det är den platta prisnivån. Alibaba tar ut samma $2/$6 oavsett om din prompt är 5 000 tokens eller 900 000. De flesta konkurrenter tillämpar ett påslag för lång kontext just eftersom det är dyrt att betjäna en prompt på nästan en miljon tokens. Att Alibaba absorberar detta är en medveten marknadserövring som riktar sig precis mot de arbetsbelastningar där lång kontext är poängen: kodgranskning av hela kodbasen, analys av avtal och inlämnade dokument, samt forskningssyntes över flera dokument.
Genomarbetat exempel. Säg att du kör en repo-analysagent: 200 000 inmatningstokens av kodkontext och 8 000 utmatningstokens per anrop.
• Per anrop: 0,2M × $2 = $0,40 indata, plus 0,008M × $6 = $0,048 utdata. ≈ $0,45 per anrop.
• Vid 1,000 samtal/dag: ≈ $448/dag, eller cirka $13,400/månad.
• Samma anrop mot Claude Opus 5 till $5/$25: $1.00 + $0.20 = $1.20 — ungefär 2,7× mer.
• Med prompt-cachning i en stabil kodkontext sänker en cachad inmatning på $0.25 inmatningssidan från $0.40 till $0.05, vilket gör att anropet kostar ≈ $0.10 — en nästan 4.5× minskning för upprepad trafik.
Den cacheskillnaden är där den verkliga budgeten ligger. Om din agent läser om en i stort sett oförändrad kontext vid varje steg — vilket beskriver de flesta kodnings- och supportagenter — är det effektiva priset mycket närmare $0,25/$6 än $2/$6. Team som hoppar över cachekonfiguration överbetalar rutinmässigt 3–4× för den här modellen.
För jämförelse vid listpriser: Qwen3.8-Max $2/$6; dess egen föregångare Qwen3.7-Max $2.50/$7.50; Kimi K3 $3/$15; GPT-5.6 Terra $2/$12; Claude Opus 5 $5/$25. När det gäller input är Qwen bara konkurrenskraftig. På utdata — den sida som dominerar utgifterna i resonerande och agentiskt arbete — är den billigaste modellen med frontier-anspråk på den listan.
Artificial Analysis oberoende mätning blottar baksidan av de billiga token. På sitt Intelligence Index kostar Qwen3.8-Max $1.14 per uppgift — mer än dubbelt så mycket som föregångarens $0.53, och 25 % högre än Kimi K3:s $0.86 trots att Kimi K3 listas till $3/$15 per token. Skillnaden är beteendemässig, inte en prishöjning: modellen låg i genomsnitt på 64 steg per GDPval-AA-uppgift jämfört med 14 för Qwen3.7-Max, och eftersom testmiljön skickar om hela konversationen vid varje steg, växte inmatningstoken med ungefär 15× och utmatningstoken med ~45 %. Billiga token är inte detsamma som billiga agenter — den mångordighet som förhandstestarna påpekade har nu en uppmätt prislapp. Eftersom OrcaRouter vidarebefordrar listpriserna med 0 % påslag via en OpenAI-kompatibel endpoint, är den där $1.14-mot-$0.86-frågan något du kan mäta med identiska prompts utan ett andra avtal.

Benchmarktabellen och vad varje siffra faktiskt mäter.
Vid GA publicerade Alibaba tabellen som man höll inne vid förhandsvisningen. Rapporterade poäng:
• Terminal-Bench 2.1 — 86.6. Mäter om en modell kan använda ett riktigt skal till fullo: köra kommandon, läsa utdata, återhämta sig från fel. Detta är den närmaste motsvarigheten till "kan den fungera som en kodningsagent snarare än en kodföreslåare."
• GPQA Diamond — 92.6. Frågor på forskarnivå inom fysik, kemi och biologi, skrivna för att vara svåra att slå upp. Ett högt resultat indikerar äkta vetenskapligt resonemang snarare än minneskunskap. 92.6 är i toppen av det nuvarande fältet.
• PaperBench — 93.0. Reproducera resultat från forskningsartiklar — läsa en metodik och implementera om den. Belönar ihållande förståelse över flera steg.
• IFBench — 82.8. Instruktionsföljning under begränsningar: format, längd och negativa instruktioner. Anmärkningsvärt nog är resultatet det lägsta i Alibabas egen tabell, vilket överensstämmer med klagomålet från förhandsversionseran om att modellen är så grundlig att den ignorerar omfattningsbegränsningar.
• OSWorld-Verified — 86.1. Datoranvändning: att styra ett riktigt skrivbords-GUI för att slutföra uppgifter. Stark här stödjer den agentiska positioneringen.
• OmniDocBench 1.5 — 92.1. Dokumenttolkning — tabeller, layout, blandad text och figurer. Tillsammans med 1M-kontexten till fast pris blir det ett verkligt argument för dokumentpipelines.
• FrontierSWE — 73.5, upp från en föregångares 40.7. DeepSWE 1.1 — 56.6, upp från 21.6.
De två sista förtjänar att betonas. Nästan fördubblingar på tuffa programvarutekniska riktmärken inom en generation är inte normala stegvisa förbättringar, och de överensstämmer med Alibabas beslut att marknadsföra denna modell mot utvecklare snarare än chattanvändare. Om FrontierSWE-siffran överlever oberoende replikering är Qwen3.8-Max en seriös kodningsmodell och inte bara en stor sådan.
Förbehållet från förhandsversionen har krympt men inte försvunnit. Alibaba tog fram tabellen ovan på sin egen testmiljö, under förhållanden som ingen annan kan granska. Leverantörstabeller väljs ut, inte samplas – labben publicerar de riktmärken där de presterar bra. Men från och med den 6 augusti finns nu en verkligt oberoende domare: Artificial Analysis har gett Qwen3.8-Max 56 på Intelligence Index för 1,14 dollar per uppgift, mätt på Alibabas officiella API – ett hopp på 10 poäng från föregångarens 46, i nivå med Claude Opus 4.8 (56), och en poäng bakom Kimi K3 (57). På AA:s agentiska GDPval-AA-ledartavla når modellen 1 739 Elo, och passerar därmed Kimi K3 (1 685) och GPT-5.6 Sol (1 730), med endast Claude Opus 5 (1 852) före. AA:s egna förbehåll förtjänar lika stor vikt: en tidigare körning gav 53 innan problemen med slutpunkten åtgärdades och omtestet via det officiella API:t gav 56; AA-Omniscience tappade 10 poäng på en hallucinationsfrekvens som steg från 23 % till 40 %; och kostnaden per uppgift är hög just eftersom modellen arbetar sig igenom betydligt fler steg. LMArenas allmänna ledartavla har fortfarande inget offentligt resultat.
DigitalOcean-lanseringen tillförde en tredje datapunkt, denna på den kvantiserade versionen snarare än flaggskeppet. DigitalOceans egen interna stickprovskontroll av de NVFP4-vikter den serverar fick 88 på GPQA Diamond, mot Alibabas publicerade 92,6 för det okvantiserade flaggskeppet. DigitalOcean själv kallar jämförelsen för "en indikativ datapunkt snarare än en kontrollerad jämförelse" — skillnaderna löper längs tre axlar (bas med öppna vikter snarare än det värdbaserade flaggskeppet, NVFP4 snarare än BF16, och en annan utvärderingsstack) — men det är den första oberoende kontrollen av en verklig serveringsdistribution av dessa vikter, och en påminnelse om att den öppna kontrollpunkten inte är byte-för-byte samma siffra som i Alibabas tabell.
CommerceAgentBench: resultattavlan för agentisk e-handel
I samband med uppdateringen släppte Alibaba Internationals Accio-team CommerceAgentBench, ett riktmärke byggt för att mäta just det långsiktiga arbete som Qwen ständigt marknadsför. En agent påbörjar varje uppgift i en ny container i en av 14 offline-repliker av verklig handels- och företagsprogramvara — produktpublicering, fraktbokning, butikshantering, betalningsoperationer, leverantörsanalys — och poängsättningen är tillståndsbaserad: en uppgift godkänns endast när de underliggande mock-tjänsterna och genererade filerna faktiskt ändras, så en agent som beskriver ett trovärdigt arbetsflöde utan att ändra tillstånd får noll poäng. Sviten kör 107 uppgifter över CLI-, webbläsar-, fil-/dokument- och API/MCP-gränssnitt, utförda genom tre testmiljöer — Accio, OpenClaw och Pi — och koden för testmiljöerna (Apache 2.0) och uppgiftsdata (CC BY 4.0) är öppna för granskning eller nya körningar.
På de publicerade tabellerna uppvisar Qwen3.8-Max det starkaste resultatet bland öppna modeller: 56 av 107 uppgifter i Accio-harnessen, 47 i OpenClaw och 53 i Pi — totalt 156 godkända, två fler än DeepSeek V4 Pro:s 154. Hela försprånget bland öppna modeller kommer från Accio-harnessen; de två modellerna ligger lika i OpenClaw och Pi. Ledare bland öppna modeller är inte total ledare: den stängda modellen Claude Opus 5 rensar fältet med 191 totalt godkända, 35 fler. Och tabellen är Alibabas egen — Accio är Alibabas team, och själva repot flaggar granskningsbegränsningarna: Accio-harnessen är endast referens och kan inte reproduceras från en utcheckning (OpenClaw är den körbara vägen), resultat på uppgiftsnivå saknar oföränderliga publika checksummor, och Qwens rader förlitade sig på ett protokoll för uppspelning av resonemangsinnehåll för att förbli jämförbara. Betrakta det som en leverantörsangiven datapunkt på samma agentiska axel som OSWorld-Verified och AA:s GDPval-AA-metod belyser från olika vinklar — värt att pröva mot dina egna arbetsflöden, inte en fastställd rangordning.
Code Arena WebDev: 0902-byggets oberoende domare
Code Arena är den oberoende bevisbit som uppdateringen saknade. Det är en tredjepartsleaderboard för agentisk webbutveckling – projektet som tidigare hette WebDev Arena – där blinda, parvisa röster från människor om vilken modells resultat en användare hellre skulle skicka iväg omvandlas till en Elo-liknande rating. På sin WebDev-board debuterade Qwen3.8-Max-0902 i topp med 1 691 poäng, 22 fler än föregående bygge och före Claude Opus 5 och Kimi K3. Placeringen har också en kostnadseffektivitetsfördel: till ett blandat pris på ~5 dollar per miljon tokens – listpriset på 2/6 dollar viktat mot den utdatatunga blandning som webbappgenerering faktiskt producerar – är 0902-bygget den modell på boardens Pareto-front som får högst poäng, och kostar ungefär en fjärdedel av Claude Opus 5:s blandade pris på ~20 dollar/M och klart under Kimi K3:s ~12 dollar/M, vilket är anledningen till att dessa två ligger utanför fronten trots att de rankas #2 och #3 i poäng. Alibaba tillkännagav positionen den 2 september och Qwens officiella konto bekräftade det och hänvisade användare till QwenCloud; mätningen är inte Alibabas: till skillnad från benchmarktabellen ovan eller CommerceAgentBench-körningen alldeles ovanför produceras detta resultat av en tredjepartsarena utifrån mänskliga preferensröster.
Två förbehåll håller det ärligt. För det första är arenabetygen ögonblicksbilder: 1 691 är var listan stod när Alibaba tillkännagav debuten, och den kommer att förändras allteftersom röster ackumuleras, så läs det som en stark signal för webbutvecklingskodning snarare än en permanent krona. För det andra täcker det bara den ena axeln. Uppdateringens påståenden om företags-, vetenskaps- och allmänna långsiktiga uppgifter har fortfarande ingen oberoende granskare, vilket är anledningen till att leverantörstabellen och AA Index 56 på basmodellen förblir referenspunkterna för allt utanför agentiskt frontend-arbete. För det tredje är frontpriset ett modelleringsval, inte en ny prislista: siffran på cirka 5 USD/MToken blandar den oförändrade listan på 2/6 USD med ett antagande om tunga utdata, så behandla det som en kostnadseffektivitetsrankning på arenans egna villkor snarare än en omprissättning från Alibaba.

Öppna vikter, Qwen3.8-27B, och frågan om on-premise
Alibabas löfte om öppen vikt är nu infriat. Den 12 augusti 2026 publicerade Qwen två arkiv på Hugging Face — Qwen3.8-2.4T-A95B i BF16 och Qwen3.8-2.4T-A95B-FP8 — vardera med 213 viktfiler. Licensen är en anpassad Qwen3.8-Max-licens, inte Apache 2.0; Hugging Faces licensfält anger "other." Villkoren tillåter användning, modifiering, distribution och finjustering, inklusive kommersiell användning, med attribution, plus två skalbara gränser: produkter med över 100 miljoner aktiva användare per månad eller 20 miljoner dollar i månatlig intäkt måste visa modellnamnet tydligt, och Model-as-a-Service- eller AI-Work-Assistant-verksamheter med över 50 miljoner dollar i sammanlagd rullande tolvmånadersintäkt behöver en separat licens från Qwen. De flesta team ligger inom dessa gränser; om ditt företag passerar dem, läs licenstexten innan du bygger på den. Nedladdningsräknarna bekräftar färskheten — 978 på BF16-arkivet och 3 851 på FP8-arkivet när detta skrivs, lågt för en frontsläppning och förenligt med ett arkiv som skapades den 8 augusti och gjordes offentligt först den 12 augusti, inte ett som legat synligt i en vecka. Ännu en ärlighetsnotis: den öppna checkpointen är basmodellen, textbaserad med tänkande alltid på, medan den värdbaserade Qwen3.8-Max API:n lägger till bildinmatning, ett valfritt icke-tänkande läge och den fulla 1M-kontexten — att ladda ner vikterna ger dig modellen, inte alla API-funktioner.
{{1}}Att självhosta flaggskeppsmodellen är fortfarande utom räckhåll för de flesta team, men nu är det utom räckhåll med känd matematik.{{/1}} {{2}}Den fullständiga viktuppsättningen med 2,4T parametrar är ungefär 4,9TB i BF16 och cirka 2,4TB i FP8, eftersom varje expert måste finnas i minnet även om bara 95B aktiveras per token.{{/2}} {{3}}Med 4-bitars kvantisering handlar det om 1,2TB mot cirka 141GB per H200, så du behöver åtta eller fler toppmoderna acceleratorer innan du kan servera en enda token.{{/3}} {{4}}Det som den nu offentliga aktiva räkningen tillför är genomströmningssidan:{{/4}} {{5}}med 95B aktiverade per token är beräkningen per token jämförbar med en tät modell i klassen ~90B — en bråkdel av kostnaden som en tät 2,4T-modell skulle innebära — så när väl vikterna finns i minnet är kostnaden per token inte den mardröm som det totala parameterantalet antyder.{{/5}} {{6}}Den kombinationen av ett stort minnesfotavtryck och måttlig beräkning per token är exakt varför Alibaba kan prissätta utdata till $6/1M, och den pekar självhostande team mot multi-GPU-noder som kör FP8-checkpoints snarare än något med enkel GPU.{{/6}}
{{1}}DigitalOceans servingval är ett fungerande exempel på den matematiken i produktion.{{/1}} {{2}}Den kör den NVFP4-kvantiserade modellen på NVIDIA HGX B300 GPU:er specifikt så att 2,4T-vikterna får plats på en enda nod, vilket undviker expertroutning mellan noder — en live-driftsättning av 4-bitars-ekonomin som detta avsnitt har behandlat på papper.{{/2}} {{3}}Avvägningen är exakt den som GPQA-stickprovet ovan kvantifierar: ett mindre fotavtryck, till en mätbar kostnad i kvalitet jämfört med det okvantiserade flaggskeppet.{{/3}}
Det är detta som gör Qwen3.8-27B till den mer betydelsefulla releasen för de flesta läsare – och till skillnad från flaggskeppsmodellen kom dess vikter i tid. Den 14 augusti 2026 publicerade Qwen Qwen/Qwen3.8-27B på Hugging Face och ModelScope under Apache 2.0: en tät 27B-modell, inbyggt multimodal, med ett inbyggt kontextfönster på 262K token som kan utökas till 1M och ett konfigurerbart reasoning_effort-läge. Unsloths Daniel Han hade uppskattat att den skulle kunna köras i ungefär 17 GB VRAM – ett enda prosumer-kort – och det går nu att testa: det officiella arkivet levererar BF16-safetensors (cirka 55,6 GB över 18 shards), med GGUF-kvantiseringar som följer i community-arkiv. Så generationens releasemönster är nu komplett: flaggskeppsmodellens vikter (2,4T) kom först den 12 augusti, och den lilla modellen för lokal drift lanserades två dagar senare. Vi följde releasen i vårt inlägg om releasedatumet för Qwen3.8-27B.
Var Qwen3.8-Max passar: fyra scenarier
1. Analys av långa dokument och avtal.Detta är den starkaste matchningen. Det fasta priset över 1M tokens tillsammans med OmniDocBench 92.1 innebär att du kan skicka en 400-sidig handling genom ett enda anrop utan extra avgift och utan uppdelning. Konkurrenter som tar ut premier för lång kontext gör samma jobb betydligt dyrare. På DigitalOcean-sökvägen, kom ihåg att den sökvägen betjänar den öppna basen med 262K tokens kontext – fortfarande en stor handling, men inte hela miljonen.
2. Kodagenter i reposkala.Terminal-Bench 86.6 och FrontierSWE 73.5 stödjer detta, och cacheprissättningen gör iterativt arbete på en stabil kodbas billigt. Det första du bör testa är latens under din egen samtidighet, eftersom granskare under preview-eran fann modellen grundlig men långsam på långa agentiska körningar, och GA-servering är en annan sak än preview-servering. AA:s GDPval-AA-resultat — en ledande 1 739 Elo till priset av 64 steg per uppgift — är den oberoende bekräftelsen på båda sidorna av den avvägningen. DigitalOceans mätningar från 12 augusti — aggregerad genomströmning som skalar nästan linjärt till ~1 937 utdatatokens/sekund vid 256 samtidiga förfrågningar med noll fel och utan mättnad — är den första datapunkten från en hanterad plattform i den frågan, även om det är DigitalOceans egna siffror på sin egen servering, inte en direkt jämförelse mot Alibabas.
3. Dokument- och skärmbildspipelines. Video- och bildinmatning plus OSWorld-Verified 86.1 gör det trovärdigt för arbetsflöden som läser skärmar — QA-automatisering, supporttriage från skärmbilder, RPA-nära uppgifter. Återigen är multimodal inmatning en funktion i det hostade API:t; DigitalOceans öppna basväg är endast text.
4. Där vi ännu inte skulle placera den. Latenskritisk interaktiv UX och alla reglerade arbetsbelastningar som kräver reproducerbar utvärdering. För det första vill du ha uppmätt genomströmning som du kontrollerar. För det andra har reproducerbarhet nu ett modellkort och en licens att citera, men Alibabas benchmark-tabell är fortfarande inte replikerad – och AAs Omniscience-regression (hallucinationsfrekvens upp till 40 %) är en påminnelse om att det oberoende resultatet skär åt båda hållen.

Hur man kommer åt Qwen3.8-Max
There are several practical paths. Direct via Alibaba Model Studio / DashScope — or Qwen's own QwenCloud API — gets you the rate card above and the earliest access to new dated snapshots — the September 2 Qwen3.8-Max-0902 build appeared there first before rolling out across other endpoints — at the cost of onboarding a new vendor and managing another key. Qwen Chat and the Qwen App are the fastest way to eyeball behavior before writing code. Downloading the open weights from Hugging Face is a fourth path for teams that want to run their own infrastructure — with the size and license caveats above. Through a router is the option most production teams should consider, because it removes the migration decision from the evaluation decision.
Sedan den 14 augusti 2026 finns det ett verkligt nytt alternativ: Qwen3.8-Max är live på DigitalOcean Serverless Inference, som Alibaba tillkännagav som sin "Day 0-lanseringspartner" — Alibabas egen formulering, även om listningen är DigitalOceans och står på egna ben. DigitalOcean serverar open-weights-checkpunkten (plattformsmodell-ID qwen3.8-max), NVFP4-kvantiserad på NVIDIA HGX B300 GPU:er i ett tekniskt samarbete med Inferact, som ett fullt hanterat serverless API: en endpoint, användningsbaserad prissättning, ingen infrastruktur att hantera. Dess prislista matchar Alibabas lista — $2.00 input / $6.00 output per 1M, med cachad input på $0.20 — och den serverar den öppna basmodellens inbyggda 262K kontext med tankeläget alltid påslaget, snarare än den hostade flaggskeppsmodellens ~1M-token multimodala läge. Den kontextgränsen spelar roll om din arbetsbelastning lutar mot den långa änden: det fulla miljon-token-läget förblir endast tillgängligt via Alibaba-API.
Vad DigitalOcean-vägen tillför utöver geografin är de första hårda servingdata från en annan leverantör än Alibaba. DigitalOceans egna mätningar mot sin produktionsslutpunkt, gjorda den 12 augusti, visar att prefill skalar linjärt med ungefär 16,000 tokens/sec — tumregeln TTFT ≈ (input ÷ 16,000) + 0.7s, så ~1.1s vid ~1,080 tokens och ~15.8s vid ~254K — och den sammanlagda genomströmningen når ~1,937 output tokens/sec vid 256 samtidiga förfrågningar med noll fel och ingen mättnadspunkt hittad. Det är DigitalOceans siffror från sin egen driftsättning, inte en kontrollerad bake-off, men de är de första latens- och konkurrensdata för den här modellen utanför Alibabas moln, och de adresserar direkt oron över "grundlig men långsam" från previeweran.
Qwen3.8-Max is live on OrcaRouter as qwen/qwen3.8-max, and the September 2 refresh is routable under its own dated id — qwen/qwen3.8-max-0902 — both at the same $2.00 / $6.00 list rate. OrcaRouter applies 0% markup and passes provider pricing straight through, so either route costs the same as going direct. Our own serving telemetry currently shows a p50 time-to-first-token of 1.64 seconds over a 7-day window. That is a first-party latency measurement rather than a vendor claim, and it is worth weighing against the preview-era "slowest model I've used" reports: those came from a single reviewer running hour-long agentic builds on preview infrastructure, and they should be re-tested against GA serving rather than repeated as current fact.
Det praktiska värdet med routervägen är att Qwen3.8-Max ligger bakom samma OpenAI-kompatibla endpoint som de modeller du redan kör, så en utvärdering är bara en ändring av modellsträngen. Du kan skicka 5 % av produktionstrafiken till den, jämföra med din nuvarande modell på identiska uppmaningar och ha en fallback — vilket är exakt den hållning som en modell med en oreplikerad leverantörstabell förtjänar. Samma hållning är rätt sätt att testa DigitalOcean-distributionen: kör en delmängd mot den med en fallback på plats, snarare än att satsa en produktionssökväg på en två veckor gammal serveringsstack.

Begränsningar och ärliga risker
• Leverantörstabellen är fortfarande inte granskad. Det oberoende resultatet har kommit in (AA Index 56), men Alibabas egen benchmark-tabell förblir inte replikerad, och AA:s mätning flaggar en Omniscience-regression med en hallucinationstakt på upp till 40%. Oberoende poängsättning hjälper; den gör inte leverantörstabellen granskningsbar.
• DigitalOcean-vägen är den öppna basen, inte flaggskeppet. Den betjänar checkpointen vid 262K kontext, endast text, tänkande alltid på, NVFP4-kvantiserad — och DigitalOceans egna stickprovsresultat som uppnår 88 på GPQA Diamond jämfört med Alibabas publicerade 92,6, en skillnad DigitalOcean kallar indikativ snarare än kontrollerad. Om du behöver det fulla multimodala API:et med en miljon tokens, är det fortfarande Alibaba som är värd.
• Qwen3.8-27B har släppts, men numreringen är leverantörens egen. 27B:ns vikter släpptes den 14 augusti under Apache 2.0, vilket sluter on-premise-luckan — men dess benchmark-påståenden är Alibaba-rapporterade och ej replikerade, och communityns kvantiseringar höll fortfarande på att rullas ut vid denna uppdatering.
• Anpassad licens, inte Apache 2.0. Qwen3.8-Max-licensen tillåter kommersiellt bruk med attribution men har två skaltrösklar – framträdande visning av modellnamn över 100M MAU eller $20M i månatlig intäkt, samt en separat licens för MaaS/AI-Work-Assistant-företag med över $50M i rullande tolvmånadersintäkt. Läs den innan du skalar förbi trösklarna.
• Verbositet och instruktionsdrift. IFBench 82.8 är den svagaste siffran i Alibabas egen tabell, och förhandstestare såg upprepade gånger hur modellen överskred sin omfattning – genom att lägga till oönskade funktioner. AA:s egna siffror sätter nu en siffra på det: 64 steg per GDPval-AA-uppgift är det som driver kostnaden till $1.14, 25% högre än Kimi K3. Charmigt i en demo, dyrt när utdata faktureras till $6/1M och destabiliserande när du behöver exakta format.
• Innehållsrestriktioner. Liksom andra kinesiskt värdbaserade frontmodeller är svaren på politiskt känsliga ämnen begränsade. Relevant om din produkt hanterar öppna frågor.
• Tänkande tokens debiteras som utdata.Med resonemang aktiverat överstiger de faktiska kostnaderna naiva uppskattningar. Mät med resonemang konfigurerat på det sätt du faktiskt kommer att leverera det.

FAQ
Är Qwen3.8-Max tillgänglig nu?
Yes. It reached general availability on August 3, 2026, with a published rate card and an OpenAI- and DashScope-compatible API. The current production snapshot — Qwen3.8-Max-0902, shipped September 2 — is live on QwenCloud's API and is what the standard qwen3.8-max endpoint now serves. This is a change from its July 19 preview status, when access was limited to Qwen Chat, the Qwen App, and Qoder's credits campaign.
Vad är Qwen3.8-Max-0902?
Qwen3.8-Max-0902 är produktionsuppdateringen av Qwen3.8-Max den 2 september 2026: samma flaggskepp med 2,4 biljoner parametrar och sparse-MoE samt 1M-tokens kontext, ytterligare posttränad på Coding och Cowork, och live på QwenClouds API till samma $2/$6. Qwen uppger att den nya ögonblicksbilden är starkare på komplexa företags- och vetenskapliga uppgifter — ett leverantörspåstående som ännu inte oberoende benchmarkats — medan den på kodningsaxeln redan har ett oberoende resultat: #1 på Code Arena: WebDev-topplistan med 1 691 poäng och toppen av sin kostnadsprestanda-Paretofront vid ett blandat ~$5/MToken, enligt Alibabas tillkännagivande om live-arenalistningen, bekräftat av Qwens eget QwenCloud-konto.
Hur mycket kostar Qwen3.8-Max?
$2,00 per 1M inmatningstokens och $6,00 per 1M utmatningstokens, fast över hela kontexten på 1M-token utan extra avgift för långa prompts. Cachade inmatningsträffar är $0,25 per 1M, explicit cacheskapande $2,50 och cacheläsningar $0,17. Tanketokens debiteras enligt utmatningspriset. På Artificial Analysis Intelligence Index är modellens uppmätta kostnad $1,14 per uppgift — se prissektionen för varför det ligger över tokenberäkningen. DigitalOceans serverless-väg listar samma $2/$6 med cachad inmatning på $0,20.
Hur många parametrar har Qwen3.8-Max?
Totalt 2,4 biljoner, i en gles Mixture-of-Experts-konfiguration. Antalet aktiva parametrar — den siffra som faktiskt avgör serveringskostnad och latens — är nu bekräftat till 95 miljarder aktiverade, enligt det officiella modellkortet för Qwen3.8-2.4T-A95B (512 experter; 10 routade plus en delad aktiv per token).
Är Qwen3.8-Max-vikterna öppna?
Ja — sedan den 12 augusti 2026. Qwen publicerade Qwen3.8-2.4T-A95B (BF16) och Qwen3.8-2.4T-A95B-FP8 på Hugging Face, var och en med 213 viktfiler. Licensen är en anpassad Qwen3.8-Max-licens (Hugging Face listar den som "other"), inte Apache 2.0: den tillåter kommersiell användning med attribution och har två skalbaserade spärrar. Den öppna checkpointen är textbaserad med tänkande alltid på; den värdbaserade API:n lägger till vision, ett valfritt icke-tänkande-läge och hela 1M-kontexten.
Har Qwen3.8-Max oberoende benchmarkats?
Ja — från och med den 6 augusti 2026. Artificial Analysis ger den 56 på sitt Intelligence Index till 1,14 USD per uppgift, mätt på Alibabas officiella API: ett hopp på 10 poäng över Qwen3.7-Max (46), i nivå med Claude Opus 4.8 (56) och en poäng bakom Kimi K3 (57). Benchmarktabellen ovan är dock fortfarande rapporterad av Alibaba och har inte replikerats oberoende, och LMArenas allmänna topplista saknar fortfarande ett publikt resultat. Bilden på de oberoende arenorna förändrades den 2 september: 0902-uppdateringen debuterade som #1 på Code Arena: WebDev-topplistan på samma plattform med 1 691 poäng — ett tredjepartsresultat genom blindomröstning, inte en Alibabatabell — och Code Arenas kostnadsprestanda-frontier listar den som det högst poängsatta värdet på topplistan till en blandad kostnad på ~5 USD/MToken. DigitalOceans stickprovskontroll av dess kvantiserade bygge (88 på GPQA Diamond) är den första tredjepartskontrollen av en deployment i produktion, och den är uttryckligen indikativ snarare än kontrollerad. En varning för kolumnen "oberoende": CommerceAgentBench, där Qwen3.8-Max leder bland modellerna med öppna vikter, är inte en andra oberoende granskare — Accio, som byggde och publicerade det, är Alibabas eget team.
Är Qwen3.8-Max bättre än Qwen3.7-Max?
Enligt Alibabas egna siffror är förbättringen avsevärd — FrontierSWE 73.5 mot 40.7 och DeepSWE 1.1 56.6 mot 21.6 är nästan fördubblingar på svåra mjukvarutekniska uppgifter. Den är också billigare än föregångarens $2.50/$7.50. Separat sätter AA generationshoppet till 10 punkter på sitt Intelligence Index (56 mot 46). Båda leverantörernas påståenden bör fortfarande verifieras på din arbetsbelastning.
Kan jag självhosta Qwen3.8-Max?
Inte praktiskt. Hela viktuppsättningen på 2.4T är ungefär 4.9TB i BF16 och cirka 2.4TB i FP8, runt 1.2TB i 4-bitars — mot ungefär 141GB per H200, det vill säga åtta eller fler toppmoderna GPU:er. Med 95B aktiva per token är beräkningsarbetet per token förhållandevis blygsamt, men minnesfotavtrycket är den begränsande faktorn. DigitalOceans NVFP4-baserade servering på B300:or är det praktiska beviset på att modellen i 4-bitarsformat ryms på en enda nod. Qwen3.8-27B — enligt uppgift ~17GB VRAM — är det realistiska alternativet för lokal drift, och dess vikter släpptes den 14 augusti 2026 under Apache 2.0 — nu nedladdningsbara snarare än ett löfte.
Vad är Qwen3.8-27B?
En betydligt mindre modell som presenterades tillsammans med flaggskeppsmodellen, positionerad som den praktiska vägen för lokal driftsättning. Det är en tät 27B-modell, native multimodal, med ett native kontextfönster på 262K token som kan utökas till 1M, och den släpps under Apache 2.0. Vikterna publicerades på Hugging Face och ModelScope den 14 augusti 2026; Unsloths Daniel Han rapporterar att den körs i cirka 17 GB VRAM – ett enda högkvalitativt konsumentkort. Dess benchmark-påståenden är rapporterade av Alibaba och har inte oberoende verifierats.
Är Qwen3.8-Max multimodal?
Ja — den tar emot text-, bild- och videoindata och returnerar text. Den stöder även tankeläge, funktionsanrop, inbyggda verktyg och strukturerade utdata. Checkpointen med öppna vikter är enbart textbaserad; multimodal indata är en funktion i det värdbaserade API:et, vilket är just det som DigitalOcean-vägen inte inkluderar.
Är Qwen3.8-Max tillgänglig på DigitalOcean?
Ja — sedan den 14 augusti 2026. DigitalOcean Serverless Inference serverar open-weights-checkpointen (NVFP4 på NVIDIA HGX B300) för 2,00/6,00 dollar per 1M med 0,20 dollar för cachad inmatning, en kontext på 262K-token, endast text, tänkande alltid på. Alibaba kallar DigitalOcean för sin "Day 0 launch partner"; själva listningen är DigitalOceans och oberoende av den formuleringen. DigitalOceans uppmätta siffror: prefill ~16K token/sek och ~1 937 utdata-token/sek vid 256 samtidiga förfrågningar med noll fel.
Kan jag använda Qwen3.8-Max via OrcaRouter?
Yes. It is live as qwen/qwen3.8-max, and the September 2 snapshot as its own dated id — qwen/qwen3.8-max-0902 — at the same $2.00/$6.00 list pricing, with 0% markup. Routing costs the same as going direct, behind the OpenAI-compatible endpoint you already use. Our 7-day telemetry shows a p50 time-to-first-token of 1.64 seconds.
Bör jag flytta produktionstrafiken till det idag?
Inte i sin helhet. Priset och det första oberoende testresultatet gör en seriös utvärdering billig och värd att göra nu, men med en kostnad per uppgift som är 25 % högre än Kimi K3:s, är det disciplinerade draget en trafikdelning mot din nuvarande leverantör på identiska uppmaningar, med en fallback på plats — inte en migrering. DigitalOcean-vägen lägger till en andra hanterad driftsättning att testa mot, vilket gör utvärderingen ännu billigare.
Slutsats
Qwen3.8-Max tillbringade två veckor som den mest intressanta modellen ingen kunde köpa. Vid GA är det en genuint annorlunda produkt: $2/$6 fast pris över en miljon tokens är aggressiv prissättning, cacheregerna gör iterativt agentarbete billigt, och generationshoppet på FrontierSWE och DeepSWE – om det replikeras – gör detta till en riktig kodningsmodell snarare än en skalflex. De öppna vikterna som släpps under en riktig licens den 12 augusti förvandlade "öppna vikter kommer" från ett löfte till ett faktum, och DigitalOcean-vägen från dag ett, som annonserades den 14 augusti – med uppmätta serveringssiffror och en cacheread på $0,20 – stärker argumentet "prova det billigt" och ger team en hanterad tredjepartsdistribution att jämföra med Alibabas eget API. Uppdateringen Qwen3.8-Max-0902 den 2 september behåller den tesen intakt: samma $2/$6 och 1M-kontext, med mer post-träning på det kodnings- och samarbetsarbete som modellen redan var positionerad för. Uppdateringen lade också till en oberoende, människopreferensbaserad resultattavla för det kodningsargumentet: Qwen3.8-Max-0902 debuterade på #1 på Code Arenas WebDev-tavla med 1 691 poäng, före Claude Opus 5 och Kimi K3, och till ett blandat pris på ~$5/MToken är den den högst poängsatta modellen på tavlans kostnadsprestanda-Pareto-front. CommerceAgentBench-resultatet som Alibabas Accio-team publicerade samma vecka – Qwen3.8-Max leder det öppna viktfältet på ett benchmark byggt på verkliga commerce-arbetsflöden – ger den samarbetsinriktade tesen en egen konkret resultattavla, om än en leverantörsdriven sådan.
Det som har förändrats är att både domaren och vikterna har landat — och domen är mestadels god, med verkliga asterisker. AA ger Qwen3.8-Max 56 på Intelligence Index, ett äkta generationssprång som landar i nivå med Claude Opus 4.8, även om samma resultatkort visar Kimi K3 en poäng före till 25 % lägre kostnad per uppgift och flaggar ett tiopoängsfall i Omniscience i samband med en stigande hallucinationstakt. Frågan om aktiva parametrar är avgjord — 95B aktiverade, bekräftat på modellkortet — och licensen är publicerad, en egen licens snarare än Apache 2.0. Det som inte har förändrats: Alibabas egen benchmarktabell har fortfarande inte replikerats oberoende, kostnaden per uppgift är fortfarande hög eftersom modellen maler sig igenom så många steg, den öppna basen som serveras på DigitalOcean är en något annorlunda modell jämfört med flaggskeppets toppsiffror (262K kontext, NVFP4, GPQA-stickprov 88 mot 92,6), och Qwen3.8-27B:s benchmarkanspråk är leverantörsrapporterade trots att dess vikter har släppts. Den kombinationen gör inte Qwen3.8-Max till en dålig satsning — till det här priset är den i det närmaste ett obligatoriskt experiment — men den innebär att rätt hållning är att utvärdera aggressivt, dirigera medvetet och ha en fallback. Det som nu återstår att se är huruvida antalet agentsteg bakom kostnaden på 1,14 USD per uppgift är något din arbetsbelastning kan absorbera, huruvida 0902-byggets försprång i Code Arena: WebDev håller i takt med att rösterna ackumuleras, huruvida dess vinster inom Coding och Cowork replikeras på verkliga arbetsbelastningar, huruvida öppenviktsledningen i CommerceAgentBench — två aggregerade genomkörningar på Alibabas egen testbänk — överlever en oberoende körning, huruvida 27B:ns benchmarkanspråk håller, och huruvida den uppmätta genomströmningen för DigitalOcean-distributionen håller under verklig trafik — det kommer att avgöra om ”näst efter Fable 5” var positionering eller profetia.

Jämförda i den här artikeln3
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
