Qwen 3.8 vs GPT-5.6: Nu när båda har prislappar, vilken vinner?
Guides & Insights

Qwen 3.8 vs GPT-5.6: Nu när båda har prislappar, vilken vinner?

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

När Alibaba förhandsvisade Qwen3.8-Max i Shanghai den 19 juli 2026 var communityns reaktion omedelbar: denna modell med 2,4 biljoner parametrar var "enligt uppgift före GPT-5.6 och bara något efter Fable 5." OpenAI:s GPT-5.6 i sin flaggskepps-Sol-konfiguration ligger #2 på det oberoende Artificial Analysis Intelligence Index, en poäng under Fable 5, så det var ett stort påstående att göra utan publicerade siffror bakom sig.

Två saker har förändrats sedan dess. Qwen3.8-Max blev allmänt tillgänglig den 3 augusti 2026 med en verklig prislista och en verklig benchmark-tabell. Och den 31 juli sänkte OpenAI priserna inom GPT-5.6-familjen — Terra till $2 / $12, Luna till $0.20 / $1.20, med Sol oförändrad på premiumnivån. Så denna matchning är inte längre ett påstående mot en leaderboard; det är två prissatta, dokumenterade modeller som faktiskt kan jämföras.

En notis för byggare — det snabbaste sättet att avgöra ett sådant påstående är att köra båda på egna prompts. OrcaRouter frontar 200+ modeller bakom en OpenAI-kompatibel endpoint, så du kan ställa Qwen 3.8 Max mot GPT-5.6 på samma uppgift utan att koppla ihop två SDK:er.

TL;DR-omdöme. Qwen3.8-Max vid GA har ett aggressivt pris — $2 / $6 per 1M, enhetligt över 1M tokens — vilket ger samma inputpris som GPT-5.6 Terra men halva Terras outputkostnad, och långt under Sol. Dess egna rapporterade siffror är starka (GPQA Diamond 92.6, Terminal-Bench 2.1 86.6). Men GPT-5.6 Sol vinner fortfarande på de två saker som avgör produktionsanvändning: den är granskad #2 på Artificial Analysis Intelligence Index (~59) och den är snabb — upp till 750 tokens/sek på Cerebras hårdvara. Qwen3.8-Max har ännu inte poängsatts av någon oberoende utvärderare. Så Qwen kan mycket väl matcha GPT-5.6 i engångskvalitet och den slår tydligt Terra på outputpris; GPT-5.6 vinner på granskade bevis och på genomströmning, vilket ofta är hela poängen.

Viktiga slutsatser

Qwen3.8-Max har varit GA sedan den 3 augusti 2026 med publicerat pris på $2 / $6 per 1M tokens, fast över hela 1M-tokens-kontexten.

Mot GPT-5.6 Terra ($2 / $12 efter OpenAIs prissänkning den 31 juli) matchar Qwen på input och halverar priset för output. Mot Sol är Qwen dramatiskt billigare.

GPT-5.6 Sol är granskad #2 på AA Intelligence Index (~59), och Artificial Analysis noterar att den leder på de svåraste STEM-problemen. Qwen3.8-Max är ännu inte poängsatt av AA och LMArena.

Hastighet är den skarpaste kontrasten. GPT-5.6 når upp till 750 tokens/sekund på Cerebras. Qwen var den långsammaste modellen i praktisk testning av förhandsversionen — ett resultat som föregår GA-släppet och behöver testas om.

Qwens leverantörstabell är trovärdig men inte referentgranskad: GPQA Diamond 92,6, PaperBench 93,0, Terminal-Bench 2.1 86,6, OSWorld-Verified 86,1, FrontierSWE 73,5 (upp från en föregångares 40,7).

Öppenhet splittrar dem permanent: Qwen lovar öppna vikter inom en vecka plus en ~17GB-VRAM Qwen3.8-27B; GPT-5.6 är stängd och endast API.

Not om noggrannhet: alla kvalitetssiffror för Qwen3.8-Max är rapporterade av Alibaba och inte verifierade av tredje part. Siffrorna för GPT-5.6 kommer från Artificial Analysis och kan skilja sig från OpenAIs egen rapportering. Prissättningen för GPT-5.6-familjen återspeglar OpenAIs prissänkning den 31 juli 2026. Qwen-prissättningen följer GA-prislistan och ersätter förhandsversionsrabatten från juli.

Specarna och priset, sida vid sida

Här är de hårda uppgifterna, varje siffra med angiven källa.

• Tillverkare / status — Qwen3.8-Max: Alibaba; GA (3 augusti 2026); GPT-5.6 Sol: OpenAI; sluten flaggskeppsmodell (varianter Sol / Terra / Luna)

• Arkitektur — Qwen3.8-Max: ~2,4T totalt, gles MoE (aktiva parametrar fortfarande ej offentliggjorda); GPT-5.6 Sol: Sluten; arkitektur ej offentliggjord

• Kontextfönster — Qwen3.8-Max: 1M tokens (983 616 med tänkande; max utdata 131 072); GPT-5.6 Sol: flaggskepp för lång kontext

• AA Intelligence Index — Qwen3.8-Max: Ännu ej poängsatt; GPT-5.6 Sol: ~59 — #2 (Artificial Analysis)

• Granskade styrkor — Qwen3.8-Max: Inga tredjeparts; GPT-5.6 Sol: Leder de svåraste STEM-problemen (Artificial Analysis)

• Leverantörsrapporterade styrkor — Qwen3.8-Max: GPQA Diamond 92.6, Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1 (rapporterat av Alibaba); GPT-5.6 Sol: n/a

• Hastighet — Qwen3.8-Max: p50 TTFT 1.64s (OrcaRouter 7-dagars-telemetri); långsammaste modellen i praktiska förhandstester; GPT-5.6 Sol: Upp till 750 tok/s på Cerebras (Artificial Analysis)

• Prissättning (in / ut) — Qwen3.8-Max: $2.00 / $6.00 per 1M, fast; cachad input $0.25; GPT-5.6: Terra $2 / $12, Luna $0.20 / $1.20, Sol premium (~1/3 av Fables kostnad per AA)

• Öppna vikter — Qwen3.8-Max: Utlovat inom veckan (ingen licens ännu); GPT-5.6: Nej — stängd / endast API

Två saker inramar denna jämförelse, och båda är nya sedan juli.

Först, prishistorien blev verkligen intressant snarare än bara billig. I juli var Qwens fördel en rabatt som inte kunde budgeteras. Nu är jämförelsen konkret och den delas upp i nivåer. Mot Terra för $2 / $12, Qwen matchar inmatningspriset exakt och halverar utmatningspriset — en verklig fördel för resonemangstunga arbetsuppgifter där utmatning dominerar kostnaden. Mot Luna för $0.20 / $1.20, Qwen är 10× dyrare, och Luna är det bättre valet för högvolymiga enkla uppgifter. Mot Sol, Qwen är mycket billigare. Så "vilken är billigare" har nu tre olika svar beroende på vilken GPT-5.6 du menar — och den ärliga beskrivningen är att OpenAIs sänkning den 31 juli minskade gapet avsevärt.

För det andra, hastighetsraden är fortfarande där dessa två skiljer sig mest åt, och den gynnar fortfarande OpenAI. Artificial Analysis mäter GPT-5.6 Sol till upp till 750 tokens/sekund på Cerebras hårdvara. Ingenting i Alibabas GA-material tyder på att Qwen3.8-Max är konstruerad för den typen av genomströmning, och den recensent som under preview-eran kallade den för den långsammaste modellen han hade använt mätte exakt de långa agentiska körningarna där genomströmningen ackumuleras. Om din arbetsbelastning är interaktiv, agentisk eller högvolym, kan det gapet avgöra matchen innan kvalitet kommer in i bilden.

Bevis: vad GA-benchmark-tabellen fastställer och inte fastställer.

Alibabas beslut att publicera siffror vid GA är en verklig förbättring jämfört med förhandsversionen, där communityns uttalande "före GPT-5.6" vilade på ingenting publicerat alls. Tabellen är stark: GPQA Diamond 92.6 inom vetenskap på forskarnivå, PaperBench 93.0 på att reproducera forskningsresultat, Terminal-Bench 2.1 86.6 på att hantera ett verkligt skal, OSWorld-Verified 86.1 på att styra ett skrivbords-GUI. Det generationsmässiga hoppet inom kodning är höjdpunkten — FrontierSWE 73.5 jämfört med föregångarens 40.7, och DeepSWE 1.1 56.6 jämfört med 21.6.

Det tabellen inte gör är att avgöra jämförelsen med GPT-5.6, av två anledningar.

Det första är ursprunget. Varje siffra togs fram av Alibaba på en egen testbänk. Leverantörstabeller är utvalda, inte samplade – ett labb publicerar de riktmärken där det ser bra ut och utelämnar resten. OpenAI:s #2-placering i Intelligence Index å andra sidan tilldelades av en utvärderare utan egenintresse i resultatet. Noterbart krediterar Artificial Analysis specifikt GPT-5.6 Sol för att leda de svåraste STEM-problemen, vilket är precis det territorium som Qwens GPQA Diamond 92.6 är tänkt att göra anspråk på. En av dessa påståenden har kontrollerats.

Det andra är att Alibabas egen svagaste siffra är talande. IFBench 82.8 — instruktionsföljning under begränsning — är den lägsta poängen i dess tabell, och den stämmer exakt överens med den mest konsekventa kritiken från förhandsvisningseran: modellen levererar för mycket, överskrider omfattningen och lägger till saker som ingen har bett om. Det är charmigt i en demo och dyrt när utdata faktureras till $6 per miljon tokens och du behöver ett exakt format. För agentiska pipelines där efterföljande steg parsar utdata, betyder disciplin i instruktionsföljning mer än en GPQA-poäng.

För att förankra: föregångaren Qwen3.7-Max fick 46 på AA Intelligence Index mot GPT-5.6 Sols ~59. Att ta in tretton poäng på en generation skulle vara ett extraordinärt språng. Möjligt — Alibabas egen FrontierSWE nästan fördubblades, vilket tyder på verkliga framsteg — men tills en domare publicerar en siffra förblir "före GPT-5.6" ett obevisat påstående snarare än ett resultat.

Kostnad i praktiken: ett räkneexempel över nivåerna.

Ta en resonerande agent som skickar 100 000 tokens av kontext och genererar 10 000 tokens av utdata per anrop — en form som är typisk för dokumentanalys eller flerstegsplanering.

Qwen3.8-Max: 0,1M × $2 = $0,20, plus 0,01M × $6 = $0,06. ≈ $0,26 per anrop.

GPT-5.6 Terra: 0.1M × $2 = $0.20, plus 0.01M × $12 = $0.12. ≈ $0.32 per anrop.

GPT-5.6 Luna: 0.1M × $0.20 = $0.02, plus 0.01M × $1.20 = $0.012. ≈ $0.03 per anrop.

• Vid 5,000 anrop/dag: Qwen ≈ $1,300, Terra ≈ $1,600, Luna ≈ $160.

Två lärdomar framträder. Mot Terra är Qwens besparing verklig men blygsam — ungefär 19% på denna form — och långt ifrån den storleksordningsfördel som Qwen åtnjuter mot premiummodeller som Fable 5 eller Sol. Den som antog att OpenAI var strukturellt dyr bör uppdatera sig: sänkningen den 31 juli gjorde det mesta av arbetet med att neutralisera Qwens prisberättelse i mellansegmentet.

Där Qwen drar ifrån rejält är lång kontext och cachelagring. Eftersom priset på $2/$6 är platt över hela fönstret på 1M-token, kostar en prompt på 900 000 token lika mycket per token som en kort sådan, medan många konkurrenter tar extra betalt för långa inmatningar. Och cachad inmatning till $0.25 per 1M minskar inmatningssidan med 8× vid upprepade kontextarbetsbelastningar: anropet ovan sjunker från $0.26 till ungefär $0.09 när kontexten är cachad. Om din agent läser om en nästan oförändrad kontext varje omgång, är det där den varaktiga fördelen ligger – inte i rubrikpriset.

Öppenhet och 27B-syskonet

GPT-5.6 kommer aldrig att kunna vara självhostbar. Qwen3.8-Max kanske kan det – Alibaba säger nu att vikterna kommer inom veckan – men flaggskeppet är inget praktiskt mål: ungefär 1,2 TB i 4-bit jämfört med cirka 141 GB per H200 innebär åtta eller fler toppacceleratorer, och med antalet aktiva parametrar fortfarande inte offentliggjort kan du inte ens modellera den genomströmning det ger. Det finns inte heller någon licenstext ännu, vilket gör att kommersiell användbarhet formellt sett är obestämd.

Den samtidigt tillkännagivna Qwen3.8-27B är den mer betydelsefulla lanseringen för den som är intresserad av Qwen för kontroll snarare än rå kapacitet. Även med öppna vikter rapporteras den köra i ungefär 17 GB VRAM — ett enda avancerat konsumentkort — vilket gör det till ett genuint lokalt alternativ på ett sätt som 2.4T-flaggskeppet aldrig kommer att vara. Om du väger Qwen mot GPT-5.6 för att du behöver dataresidens, är 27B den modell du bör utvärdera.

Vanliga frågor

Är Qwen 3.8 bättre än GPT-5.6?

Inte på den bevisning som finns. Alibabas GA-tabell är stark (GPQA Diamond 92.6, Terminal-Bench 2.1 86.6) men helt självrapporterad, och ingen oberoende utvärderare har poängsatt modellen. GPT-5.6 Sol innehar en reviderad #2-placering på Intelligence Index (~59), leder de svåraste STEM-problemen enligt Artificial Analysis, och kör upp till 750 tokens/sekund. GPT-5.6 vinner på bevis och hastighet.

Är påståendet "Qwen 3.8 är före GPT-5.6" sant?

Det började som en community-uppfattning och är fortfarande overifierat. GA tog med Alibabas eget benchmark-diagram men inget tredjepartsresultat — Artificial Analysis och LMArena förblir utan poäng. Föregångaren Qwen3.7-Max fick 46 mot Sols ~59, så påståendet kräver ett mycket stort generationshopp för att hålla bokstavligen.

Vilken är billigare, Qwen 3.8 eller GPT-5.6?

Det beror på nivån, och svaret ändrades den 31 juli när OpenAI sänkte priserna. Qwen3.8-Max är $2 / $6 per 1M. GPT-5.6 Terra är $2 / $12 — samma input, dubbel output, så Qwen vinner där. Luna är $0.20 / $1.20, vilket gör den ungefär 10× billigare än Qwen. Sol är premium, så Qwen är mycket billigare än Sol.

Vilken är snabbare?

GPT-5.6, avgjort när det gäller genomströmning. Artificial Analysis rapporterar upp till 750 tokens/sekund på Cerebras-hårdvara. Qwen3.8-Max visar en p50-tid till första token på 1,64 sekunder i OrcaRouters 7-dagarstelemetri, men testare under förhandsversionen fann att den var mycket långsam på långa agentiska byggen – det resultatet föregår GA-servingen och förtjänar att testas om.

Har Qwen 3.8 Max lämnat förhandsversionen?

Ja, den 3 augusti 2026. Den har nu en publicerad prislista och en OpenAI- och DashScope-kompatibel slutpunkt, så juli-beskrivningen av en Qoder-kreditkampanj med 90 % rabatt beskriver inte längre hur den säljs.

Kan jag självhosta Qwen 3.8 för att undvika OpenAIs priser?

Inte flaggskeppet, realistiskt sett. Vikterna utlovas inom veckan men ingen licens har publicerats, och vid ~1,2 TB i 4-bit skulle du behöva åtta eller fler GPU:er av H200-klass. Det samtidigt annonserade Qwen3.8-27B, som enligt uppgift kräver ~17 GB VRAM, är det praktiska alternativet.

Vilken ska jag använda idag?

GPT-5.6 Sol för allt som är känsligt för latens, interaktivt eller kritiskt för resonemang där granskad kvalitet spelar roll. Luna för enkla uppgifter med hög volym, där det är överlägset billigast med bred marginal. Qwen3.8-Max där lång kontext och prompt-cachning dominerar din faktura – dess fasta 1M-tokenpris och $0,25 för cachad indata är de starkaste delarna av erbjudandet.

Slutsats

Qwen 3.8 mot GPT-5.6är en jämnare match än vad den var i juli, och något mindre ensidig prismässigt än vad Qwens fans förväntade sig. Qwen3.8-Max lanserades vid GA med verklig prissättning, en trovärdig självrapporterad benchmarktabell och ett fast 1M-token-pris plus billig cachning som gör den genuint attraktiv för arbete med långa kontexter. Det är strukturella fördelar, inte marknadsföringsmässiga sådana.

Men OpenAIs prissänkning den 31 juli dämpade kostnadsargumentet i mellansegmentet — Terra matchar nu Qwen på input — och GPT-5.6 äger fortfarande de två avgörande egenskaperna: en granskad #2-placering från en utvärderare utan egenintresse av resultatet, och genomströmning på upp till 750 tokens/sek som Qwen inte visat några tecken på att närma sig. Håll utkik efter två händelser: det första oberoende Intelligence Index-resultatet för Qwen3.8-Max, och att vikterna släpps med en licens. Tills dess, välj utifrån form — GPT-5.6 när hastighet och bevis spelar roll, Qwen när kontextlängd och cache-träffar dominerar notan — och verifiera på dina egna prompts.

Jämförda i den här artikeln2

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen