
GPT-6 Luna vs Qwen3.8-Max: Den billigaste modellen i den här jämförelsen är också den enda som tittar på video
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Den uppenbara vinklingen för den här parkopplingen är fel. Qwen3.8-Max listas till $2,00 per miljon indatatoken och $6,00 per miljon utdata med cacheläsningar på $0,25. GPT-6 Luna listas till $0,10 och $0,50 med cacheläsningar på en cent. Tjugo gånger på indata, tolv gånger på utdata, femtio gånger på cachad indata — en prisskillnad så stor att jämförelsen verkar avgjord innan den ens har börjat.
Det är inte avgjort, eftersom de två modellerna inte konkurrerar om samma förfrågan. Qwen3.8-Max accepterar text, bild och video, och dess tak för utdata på 131 072 token ligger något över GPT-6 Lunas 128 000. GPT-6 Luna accepterar endast text och bild. Alibabas modell får 58 på det oberoende Intelligence Index — först i sin klass på den agentiska resultattavlan — och GPT-6 Luna får 37 vid maximal ansträngning, 29 vid standardinställning. Den ena är en flaggskeppsmodell med en härstamning av öppna vikter och en videoinmatningsmodalitet. Den andra är en volymnivå med en hastighetssiffra och en cache-kostnad på en cent. Prisskillnaden är inte en rabatt på samma sak; den är en beskrivning av två olika saker.
Vad var och en av dessa två är
Qwen3.8-Max är Alibabas flaggskepp i 3.8-generationen, en checkpoint i Max-klassen vars underliggande modell – Qwen3.8-2.4T-A95B – släpptes offentligt under en anpassad licens den 12 augusti 2026, vilket gör den till den första Qwen i Max-klassen som överhuvudtaget har öppna vikter. Själva den hostade flaggskeppsmodellen listas fortfarande av den oberoende nämnden som proprietär. Den har ett kontextfönster på 1 000 000 token, ett tak för utdata på 131 072 token, text, bild och video som indata, och resonemangsansträngning som kan väljas på låg, medel och extra hög. En fastnålad Qwen3.8-Max-0902-revision finns tillgänglig till samma pris, vilket är en liten detalj med verkligt operativt värde.
GPT-6 Luna är OpenAI:s effektivitetsklass från den 22 september 2026, placerad under GPT-6 Sol vid $2.00/$10.00 och flaggskeppet GPT-6 Astra vid $10.00/$50.00. Text och bild in, text ut, ett 1,050,000-tokenfönster med 922,000 maximal indata, ett utdatatak på 128,000 token och effort från none till low, medium, high, xhigh och max med medium som standard. Stängd, en enda identifierare, tillgänglig för alla med en API-nyckel.
Den ena accepterar video och kan laddas ner i sin grundform. Den andra accepterar bilder och är snabb. Båda är prissatta för att användas i volym. Överlappningen mellan dessa två påståenden är mindre än vad prisförhållandet antyder.
Korten, rad för rad
En rad per dimension, båda sidorna på varje:
• Indata per 1M — GPT-6 Luna 0,10 $ mot Qwen3.8-Max 2,00 $
• Utdata per 1M — GPT-6 Luna $0.50 vs Qwen3.8-Max $6.00
• Cachad indata per 1M — GPT-6 Luna $0.01 vs Qwen3.8-Max $0.25 för implicita cacheläsningar, med en explicit cacheläsning på $0.17 och en explicit cacheskrivning på $2.50
• Klausul för lång kontext — GPT-6 Luna fördubblar indata och cache samt höjer utdata 1,5× över 272 000 indata-tokens, tillämpat på hela begäran, jämfört med Qwen3.8-Max som har en enhetlig nivå över hela fönstret, vilket är den enda platsen där Qwen-kortet är strukturellt bättre i stället för marginellt billigare
• Kontextfönster — GPT-6 Luna 1 050 000 tokens vs Qwen3.8-Max 1 000 000 tokens
• Maximal utdata — GPT-6 Luna 128 000 tokens vs Qwen3.8-Max 131 072 tokens
• Inmatningsmodaliteter — GPT-6 Luna text och bild vs Qwen3.8-Max text, bild och video
• Resonemangsinsats — GPT-6 Luna ingen, låg, medel (standard), hög, xhigh, max vs Qwen3.8-Max låg, medel och extra hög
• Intelligensindex, oberoende — GPT-6 Luna 37 vid maximal ansträngning vs Qwen3.8-Max 58
• Agentic Index, oberoende — Qwen3.8-Max 58, först i sin klass; ingen jämförbar GPT-6 Luna-siffra publicerad
• Poäng för standardansträngning — GPT-6 Luna 29 vid sin standardinställning medium jämfört med Qwen3.8-Max mätt vid sin högsta inställning
• Kostnad per Index-uppgift, oberoende — GPT-6 Luna cirka 0,07 $ jämfört med Qwen3.8-Max 5,41 $
• GDPval, oberoende — Qwen3.8-Max 1 739 Elo vid 64 turer per uppgift, vilket motsvarar ungefär 1,14 USD per slutförd uppgift i den utvärderingen; ingen jämförbar körning med GPT-6 Luna har publicerats
• Hallucinationsfrekvens på AA-Omniscience — Qwen3.8-Max 40 %, en försämring från 23 % i föregående generation; GPT-6 Luna 77 %, ned från 93 %
• Daterad ögonblicksbild — GPT-6 Luna en enda rullande identifierare vs Qwen3.8-Max-0902 tillgänglig som en pinnad revision från 2 september 2026 till samma pris
• Vikter — GPT-6 Luna sluten, endast API vs Qwen3.8-Max bas-checkpointen Qwen3.8-2.4T-A95B offentlig under en anpassad licens sedan 12 augusti 2026, medan den hostade flaggskeppsmodellen listas som proprietär
• På OrcaRouter — GPT-6 Luna finns inte i vår katalog vs Qwen3.8-Max som är routbar till Alibabas listpris

Video är inte en funktionslinje, det är en annan arbetsbelastning
Modalitetsraden är den som avgör fler verkliga jämförelser än prisraden, och den läses vanligtvis som en kryssruta.
Qwen3.8-Max tar emot video. GPT-6 Luna gör det inte. Om din pipeline behöver resonera kring en skärminspelning, en produktdemo, en föreläsningsinspelning, ett segment från en övervakningskamera eller en UI-genomgång, slutar jämförelsen vid den raden och den tjugofaldiga prisskillnaden blir irrelevant — du väljer inte mellan ett dyrt alternativ och ett billigt, du väljer mellan ett alternativ och inget alternativ. Att extrahera bildrutor och skicka dem som bilder är en workaround, inte en likvärdig lösning, och alla som har byggt en vet skillnaden i både kostnad och kvalitet.
Om din pipeline består av text och bilder är modalitetsraden tyst och prisraden talar. Det är den ärliga uppdelningen, och det är värt att vara tydlig med vilken sida av den du står på innan du läser något annat på den här sidan.
Det agentiska gapet är verkligt och det är den dyra halvan av prisskillnaden
Qwen3.8-Max får 58 poäng på det oberoende Intelligence Index. GPT-6 Luna får 37 vid maximal ansträngning och 29 vid sin förvalda medium-inställning. Tjugoen poäng vid matchade inställningar, tjugonio vid förvalda inställningar — i ett sammansatt index där en enda poäng ligger inom bruset för en omkörning är en sådan skillnad inte brus.
Positionen för Qwen3.8-Max är koncentrerad till agentiskt arbete. Det får 58 poäng på det oberoende Agentic Index, först i sin klass, och 1 739 Elo på GDPval vid 64 turer per uppgift. Den sista siffran är den informativa, eftersom den är en mätning av en modell som håller ihop en uppgift över sextiofyra sekventiella beslut, och den kommer med en prislapp: ungefär 1,14 dollar per slutförd uppgift i den utvärderingen. Jämför det med GPT-6 Lunas kostnad per indexuppgift på cirka 0,07 dollar, och det ärliga påståendet är inte att Qwen är dyr. Det är att Qwen ombeds göra en mycket svårare sak, och gör det.
Korollariet är att GPT-6 Lunas underskott på tjugoen poäng inte heller är jämnt fördelat över din arbetsbelastning. På en kort, välspecificerad uppgift som konsumeras av program — extrahera detta fält, klassificera detta ärende, routa denna begäran — kommer båda modellerna nästan alltid att producera samma användbara svar, och indexgapet kommer att vara osynligt i din utvärdering. På en uppgift som kräver sextiofyra sekventiella åtgärder med en kontrollpunkt i slutet är gapet skillnaden mellan att slutföra och att tyst stanna halvvägs, och det är uppgiften som Qwen3.8-Max byggdes för, men inte GPT-6 Luna.
En siffra pekar i motsatt riktning och förtjänar att nämnas snarare än att begravas. Qwen3.8-Maxs hallucineringsfrekvens på allvetenhetstavlan är 40 %, upp från 23 % i föregående generation – en betydande försämring, och den sort som visar sig som självsäkra felaktiga svar i produktion snarare än som en rad i ett benchmark. GPT-6 Lunas är 77 %, ned från 93 %. Båda siffrorna är höga i absoluta tal, och den billigare modellen är fortfarande den sämre av de två i detta avseende. Ingen av siffrorna är ett skäl att föredra den ena modellen; båda är skäl att hålla en människa eller en verifierare i loopen i allt där ett fabricerat faktum är dyrt.
Klausulen om lång kontext är den enda punkten där Qwen vinner på struktur
GPT-6 Luna har en klausul som Qwen3.8-Max inte har: förfrågningar över 272 000 indatatoken faktureras med dubbla indata- och cache-priserna och 1,5× utdata-priset, tillämpat på hela förfrågan i stället för den del som ligger över gränsen. Ett anrop på 300 000 tokens med GPT-6 Luna faktureras med 0,20 USD per miljon indatatoken för alla 300 000 tokens eftersom det gick över med 28 000. Dela upp samma dokument i två anrop, och kostnaden halveras utan att prompten ändras.
Qwen3.8-Max är platt över sitt fulla fönster på 1 000 000 tokens. För verkligt enorma enskilda förfrågningar gör det att den tolvfaldiga skillnaden i utpris ser mindre ut än den är och kan till och med vändas: över 272 000 indata-tokens fördubblas GPT-6 Lunas effektiva indata-pris till $0,20, och dess utpris stiger till $0,75, mot Qwens platta $2,00 och $6,00. Gapet minskar från tjugo gånger till tio på indata och från tolv till åtta på utdata. Fortfarande stort – men de arbetsbelastningar som mest sannolikt har en arbetskontext på 300 000 tokens är just de agentiska som båda leverantörerna säljer in sig på, och de team som kör dem är de team som kommer att lägga märke till det.
Den andra strukturella raden är den låsta versionen. Qwen3.8-Max-0902 finns till samma pris som den rullande identifieraren, vilket innebär att ett team som behöver reproducerbart beteende över en modelluppdatering kan få det utan att betala ett premium. GPT-6 Luna erbjuder ingen motsvarighet. Det är en liten rad i en prislista och en stor rad i en efteranalys.
Kör en av dem, eller båda
Qwen3.8-Max finns på OrcaRouter till Alibabas listpris, under vidarefakturerad prissättning, vilket innebär att en ändring av leverantörens pris slår igenom på vår sida samma dag. Två saker hos vårt routinglager förtjänar sin plats för just den här modellen: automatisk failover, eftersom en hostad flaggskeppsmodell med en publicerad bas med öppna vikter har fler uppströmmar än en sluten modell från en enda leverantör och fler sätt för en av dem att försämras; och hanteringen av fästa revisioner, som gör att en rutt kan hålla Qwen3.8-Max-0902 explicit i stället för att ärva vad den rullande identifieraren än löser upp till nästa vecka.
GPT-6 Luna finns inte i vår katalog i skrivande stund och nås via OpenAIs eget API, så ett team som vill ha båda kör en nyckel för Qwen3.8-Max vid sidan av vad det än redan använder för OpenAI. Det här är också den kombination där routing-DSL:en är värd mer än en statisk uppdelning, eftersom gränsen mellan de två modellerna är en modalitetskontroll och en längdkontroll snarare än en preferens: förfrågningar som innehåller video går till Qwen3.8-Max eftersom inget annat kan hantera dem, förfrågningar över 272 000 indatatoken går till Qwen3.8-Max eftersom den andra modellens prisklippa gör dem dyrare där, och allt annat går till modellen som kostar en tjugondel av priset. Det är en regel, och den hör hemma i konfigurationen snarare än i en programgren.

Vilken, och när?
Välj Qwen3.8-Max om något av följande stämmer. Din pipeline behöver video som indata. Dina förfrågningar överstiger rutinmässigt 272 000 indatatoken, där dess fasta prisnivå slår GPT-6 Lunas omprissättning. Din utdata överstiger 128 000 token. Ditt arbete är agentisk exekvering över lång horisont med en verifierbar slutpunkt, där dess 58 på den agentiska resultattavlan och 1 739 Elo på GDPval vid 64 turer per uppgift är beviset som spelar roll. Eller så behöver du en pinnad revision för reproducerbarhet och är villig att betala för den – vilket, till samma pris som den rullande identifieraren, innebär att du inte är det.
Välj GPT-6 Luna om inget av dessa gäller och din arbetsbelastning är högvolym, programkonsumerad, text- och bildbaserad samt kort. Klassificering, extrahering, routning, massammanfattning, den inre loopen hos en agent som behöver ett snabbt svar snarare än ett noggrant. Med $0.10/$0.50, en cachad läsning på en cent och en kostnad per slutförd uppgift på ungefär en femtondel av Qwen3.8-Max, är matematiken inte ens nära. Ställ in parametern effort explicit — standardvärdet är medium och rubriksiffran 37 är en siffra för maximal ansträngning — och håll långa anrop på rätt sida om 272 000-token-gränsen.
Misstaget som den här jämförelsen inbjuder till är att läsa det tjugofaldiga priset för indata som en dom. Det är en dom om en typ av arbetsbelastning, och den säger ingenting om de tre raderna som avgör den andra: om begäran innehåller video, om den passerar 272 000 tokens och om svaret måste överleva sextiofyra sekventiella steg.

Jämförda i den här artikeln3
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
