
Qwen3.8-27B vs Qwen 3.8: Samma generation, en GPU mot ett rack
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0240Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligens69Kodning
Den här veckan placerade Alibaba Qwen3.8-27B på Cerebras snabba inferensbana – första gången den densa 27B-modellen har ett genuint snabbt hostat alternativ – och Artificial Analysis indexerade till slut båda sidorna av den här jämförelsen. Qwen3.8-27B får 34 poäng på AA Intelligence Index. Qwen 3.8, det vill säga den öppna kärnan som de flesta menar när de skriver namnet utan suffix, får 40. De två siffrorna nollställer en jämförelse som bevakningen av augustilanseringen helt och hållet hade tvingats bygga på leverantörens ord.
Modellen bakom "Qwen 3.8" som fristående namn är Qwen3.8-2.4T-A95B: de 2,4 biljoner parametrar tunga mixture-of-experts-vikterna som Alibaba publicerade under en anpassad licens. Qwen3.8-27B är samma generations täta medlem – cirka 27 miljarder parametrar, Apache 2.0, dimensionerad för en enda GPU. De delar familjenamn, den inbyggda kontextlängden på 262K och ett lanseringsfönster. Allt annat hos dem är en studie i motsatser: den ena kan du äga, den andra kan du bara hyra. Här är vad var och en faktiskt är till för nu när båda har oberoende siffror.
Samma generation, motsatta former
Qwen3.8-27B är en dense modell — 27B parametrar (28B om man räknar med visionskodaren), 64 lager, en hybridstack för attention med 48 Gated DeltaNet-lager för linjär attention mot 16 full-attention-lager. Den hybriden är anledningen till att en 27B kan rymma 262 144 tokens i inbyggd kontext. Qwen3.8-2.4T-A95B är flaggskeppsarkitekturen: 2,4T parametrar totalt, cirka 95B aktiva per token, 92 lager med 512 experter per lager, och 69 av dessa 92 lager använder linjär attention. Samma knep, nittio gånger så stort fotavtryck.
• Arkitektur — Qwen3.8-27B: 27B tät, varje token aktiverar hela modellen. Qwen3.8-2.4T-A95B: 2,4T totalt / ~95B aktiva MoE.
• Kontext — båda 262K inbyggt; 27B:ns 1M-förlängning är endast värdbaserad, 2.4T når ~984K uppmätt.
• Indata – Qwen3.8-27B: text, bild och video. Qwen3.8-2.4T-A95B: endast text, tänkande låst i på-läge.
• Licens — Qwen3.8-27B: Apache 2.0. Qwen3.8-2.4T-A95B: anpassad Qwen3.8-Max-licens.
• Vikter — Qwen3.8-27B: 55,6 GB BF16, kvantiseras till en Q4-version på ~16 GB. Qwen3.8-2.4T-A95B: ~2,4 TB BF16, ett GPU-rack, inte en stationär dator.
• Var du stöter på dem — Qwen3.8-27B: självhostad eller hyrd billigt. Qwen3.8-2.4T-A95B: hyrd, för ingen vettig människa äger racket.
Oberoende nummer, äntligen
Varje August vs-artikel om Qwen3.8-27B hade samma förbehåll: ”inga oberoende poäng ännu.” Det stämmer inte längre. Artificial Analysis har båda modellerna uppmätta från och med den här veckan, och formen på datan är genuint intressant.
På Intelligence Index får Qwen3.8-2.4T-A95B 40 poäng och rankas på 4:e plats av 113 i sin klass. Qwen3.8-27B får 34 poäng – vilket placerar den på första plats av 140 modeller i sin storleksklass för öppna vikter på 4–40B, en verkligt stark prestation för en dense 27B-modell. Båda är långsamma enligt oberoende mätning: 39,0 utdatatokens per sekund för 27B och 38,1 för 2.4T, mot en klassmedian på omkring 90. Båda är mångordiga, där 27B genererar ungefär 200M utdatatokens över indexkörningarna jämfört med en klassmedian på 68M. Ingen av dem är någon uppmärksammad frontiärmodell; båda är arbetshästar, och indexet säger att 2.4T är den starkare arbetshästen med tydlig marginal.

Priserna på den oberoende sidan berättar samma historia i dollar. Artificial Analysis prissätter 27B till $0,50 per miljon input och $3,00 per miljon output på Qwen Clouds hostade version (90 % cacherabatt), och 2.4T till $2,00 / $6,00 (88 % cacherabatt). Kostnad per Intelligence Index-uppgift: $0,82 för 27B mot $2,16 för 2.4T. Den mindre modellen är billigare att köra per enhet intelligens — och båda är dyra i förhållande till sin hastighetsklass eftersom båda är resonemangsmodeller som förbrukar utdatatokens.
Allt annat – SWE-bench Pro 61,7, DeepSWE 1.1 42,2, LiveCodeBench v6 90,3 för 27B; 2,4T-modellens 86,6 på Terminal-Bench 2.1 och 67,7 på SWE-bench Pro – förblir leverantörsrapporterat, oreproducerat och märks som sådant genomgående i den här artikeln. AA-indexen ovan är det oberoende golvet under allt detta.
Vad Cerebras börsnotering förändrar
Den 12 september 2026 meddelade Qwen-kontot att Qwen3.8-27B nu körs på Cerebras, med sin katalogpost live under bannern "Qwen 3.8 27B finns nu tillgänglig på Cerebras PayGo". Cerebras listar den till $0,99 per miljon input och $1,49 per miljon output på hårdvaran i WSE-klass som gjorde företaget känt för sin snabbhet. Det ger 27B något som 2,4T-kärnan aldrig har haft: en snabbfil.

Det här spelar roll eftersom långsam och mångordig var den enda verkliga invändningen mot 27B från dag ett. I den oberoende testbänken klarar den 39 t/s; i vår egen serveringstelemetri har den legat på ~154 utdatatoken per sekund med en p50-latens för första token på 4,48 s — och nu konkurrerar en andra leverantör på samma axel. 2.4T har däremot ingen snabbfil alls: vid 38 t/s betalar du frontier-priser för en hastighet i mitten av fältet, och det enda sättet att komma runt det är ett hyrt GPU-kluster där du kör de öppna vikterna själv.
Tre banor för 27B, en för 2,4T
Från och med i dag kan den täta 27B:n hyras på tre sätt, och prisspridningen är värd att läsa innan du väljer:
• Egenhostat spår — Qwen3.8-27B är live på OrcaRouter för $0.33 / $2.40 per miljon, körs på vår egen infrastruktur. Billigaste inputen på marknaden för den, ~154 tok/s utdata, 262K kontext.
• Leverantörsspår — Qwen Clouds hostade build, 0,50 $ / 3,00 $ per miljon med 1M-tokenskontext och en cacherebatt på 90 %.
• Snabbspår — Cerebras PayGo, 0,99 / 1,49 USD per miljon, med fokus på hastighet snarare än pris.

2.4T:s öppna kärna har ingen motsvarande prisskillnad. Det flaggskepps-API som betjänar samma arkitektur – Qwen3.8-Max – kostar $2.00 / $6.00 per miljon, och det är siffran som gäller oavsett om du kallar den Max eller den öppna kärnan. Kör du i stället vikterna vänder ekonomin mot hårdvara: 2.4T behöver ~2.4TB BF16-vikter och en multi-GPU-nod, ett kapitalbeslut som ingen fattar lättvindigt. En 24GB-GPU kör 27B:s Q4-bygge till en marginalkostnad som avrundas till noll.
Det räkneexempel som avgör för de flesta team: 100M indatatokens och 20M utdatatokens per dag. Med 2.4T:s taxa på $2/$6 blir det cirka $320 per dag, ~$117 000 per år. Med 27B till vårt pris på $0.33/$2.40 blir det cirka $81 per dag — och på den egenhostade kopian är det elpriset. 2.4T ger dig en verklig kvalitetsfördel, AA 40 mot 34. Huruvida den fördelen är värd en femsiffrig månadskostnad är hela frågan som den här kombinationen ställer.
Där de verkligen skiljer sig åt
Utöver indexet avgör tre praktiska skillnader vilken som passar en given arbetsbelastning.
Multimodal inmatning är det renaste filtret. Qwen3.8-27B läser text, bilder och video – skärmbilder, diagram, dokument med figurer och videobildrutor hamnar alla i samma 262K-fönster. Qwen3.8-2.4T-A95B är aggressivt begränsad till enbart text. Om din inmatning innehåller något visuellt diskvalificeras 2.4T oavsett dess högre index.
Tankestyrning kommer på andra plats. 27B:s resonemangsläge kan stängas av per begäran, vilket är viktigt för latenskänslig extrahering där en tankekedja är ren overhead; det exponerar även reasoning_effort. 2.4T-kärnan kan inte stänga av tänkandet – varje svar inleds med ett think>-block, och du betalar för dessa tokens oavsett om du ville ha dem eller inte. Flaggskepps-API:et åtgärdar detta, men den öppna kärnan gör det inte.
Licensiering kommer på tredje plats, och det har i tysthet betydelse när man skalar upp. Apache 2.0 på 27B är den tillåtande standarden: modifiera, vidaredistribuera, kommersialisera, patentlicens ingår. 2.4T levereras under en anpassad Qwen3.8-Max-licens – tillåtande till sin anda, men det är Alibabas villkor, inte en standard från communityn, och det är värt att läsa filen innan du bygger en produkt på den.
Dirigera beslutet
Båda sidorna av den här matchen nås via en enda OrcaRouter-nyckel, och det är just det som gör frågan "vilken ska jag välja" billig att besvara empiriskt. Qwen3.8-27B är live som qwen/qwen3.8-27b till leverantörens listpris utan påslag, och det flaggskepps-API som bygger på samma 2,4T-kärna är live som qwen/qwen3.8-max för $2.00 / $6.00 per miljon — Alibabas egen taxa, vidarebefordrad rakt igenom, så eventuella prisändringar från leverantören slår igenom här samma dag.
Samma 2,4T-arkitektur som nedladdningsbara vikter är inte något vi tillhandahåller – om du vill ha den öppna kärnan via ett API idag är flaggskeppsspåret det praktiska sättet att nå den, och qwen/qwen3.8 är förkonfigurerad att slås på i samma stund som en leverantör tillhandahåller de öppna vikterna. En routningsregel som skickar den visuella och latenskänsliga trafiken till qwen/qwen3.8-27b och den tunga resonemangstrafiken till qwen/qwen3.8-max kostar inget att ställa in och växlar automatiskt över mellan leverantörer. En nyckel, inget andra avtal, och uppdelningen är en konfigurationsändring snarare än att arkitekturen görs om – det billigaste sättet att testa om 2,4T:s extra sex indexpoäng är värda 5,67 USD per miljon utdatatoken för dig.
Vem ska välja vilken
• Välj Qwen3.8-27B om din indata innehåller bilder eller video, om du vill ha tänkande som du kan stänga av, om du äger en 24GB GPU eller planerar att skaffa en, eller om din kostnad per token når en sådan volym att $0.33/$2.40 kontra $2.00/$6.00 är hela argumentet.
Välj Qwen 3.8 (2,4T-kärnan) om du enbart arbetar med text, vill ha det starkaste oberoende resonemangsresultatet i familjen (AA 40), och priset på $2/$6 – eller kostnaden för att köra en GPU-nod – med god marginal ryms inom din budget.
• Välj båda om din trafik spänner över de två profilerna: routa via gatewayen, låt routern dela upp efter modalitet och svårighetsgrad, och ändra dig när endera modellens nästa checkpoint eller pris landar.
Domen
Namnet Qwen 3.8 har alltid varit två produkter som låtsades vara en familj, och nu har båda egna siffror att bråka om. Qwen3.8-2.4T-A95B är den starkare hjärnan, endast text, dyr och otvivelaktigt lönsam vid $2/$6. Qwen3.8-27B är den driftsättbara varianten – multimodal, Apache 2.0, självhostbar, och sedan den här veckan har den äntligen en snabbväg också. Indexgapet är verkligt: 40 mot 34. Detsamma gäller prisskillnaden: ungefär fem gånger kostnaden per token när du kör 2.4T som ett API. För de flesta team handlar beslutet inte om de sex indexpunkterna. Det handlar om huruvida du köper tokens eller köper hårdvara – och 27B är den enda av de två som låter dig köpa hårdvaran.
