
GPT-6 Sol vs Qwen3.8-Max: Den enda linjen där den slutna modellen inte kan konkurrera
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Nästan varje jämförelse mellan GPT-6 Sol och Qwen3.8-Max kommer att avgöras av kostnaden, och nästan varenda en av dem kommer att räkna fel på kostnaden åt samma håll. Qwen3.8-Max, leverantörens hostade flaggskeppsmodell, har prissatts till 2,00 USD per miljon indatatokens och 6,00 USD per miljon utdatatokens sedan den blev allmänt tillgänglig den 3 augusti 2026, med den datummärkta Qwen3.8-Max-0902-snapshoten som släpps den 2 september. GPT-6 Sol blev allmänt tillgänglig den 22 september 2026 till 2,00 USD för indata och 10,00 USD för utdata. Identiskt indatapris, och 40 % billigare utdata enligt prislistan för Qwen3.8-Max – och, i det oberoende testramverket, ungefär fem gånger kostnaden för att slutföra en uppgift.
Men det finns en andra, renare skillnad som kostnadsargumentet ständigt begraver, och det är den som faktiskt avgör vissa arbetsbelastningar. Qwen3.8-Max tar emot video. GPT-6 Sol gör det inte. Det är inte en prisuppgift eller en benchmark-siffra; det är en förmåga som en av dessa modeller har och den andra inte kan approximera, och det är den enda delen av den här duellen som inte kan åtgärdas, hur mycket arbete med token-effektivitet som än läggs ned.

Två flaggskepp, två olika former
Qwen3.8-Max är en gles mixture-of-experts-modell med 2,4 biljoner parametrar, varav ungefär 95 miljarder är aktiva per fråga — den näst största värdbaserade modellen i produktion efter Kimi K3. Dess kontextfönster är en miljon tokens med en utdatagräns på 131 072 tokens, dess indatamodaliteter är text, bild och video, och den stöder resonemangsansträngning över låg, medel och extra hög med strukturerade utdata och verktygsanrop. Den värdbaserade flaggskeppsmodellen har inte öppna vikter; den nedladdningsbara artefakten av samma generation är en separat utgåva med sina egna begränsningar.
GPT-6 Sol tar in text och bild och ger text ut. Dess kontextfönster är 1 050 000 tokens med en maximal indata på 922 000 tokens och ett tak för utdata på 128 000 tokens, med ett fast pris på $2.00 och $10.00, en cachad läsning på $0.20 och cacheskrivningar på $2.50, vilket omprissätter hela begäran över 272 000 indatatokens till $4.00 och $15.00. Den är stängd, med en enda identifierare, och OpenAI har beskrivit priserna som permanenta snarare än kampanjpriser.
Fönstersiffrorna ligger inom cirka 7 % från varandra, och utdatataken ligger i samma intervall. Modalitetslistan är den enda strukturella luckan – och den går bara åt ena hållet.
Rad för rad
• Indata — GPT-6 Sol $2.00 per miljon tokens mot Qwen3.8-Max $2.00 per miljon tokens; rubriksiffran är identisk
• Utdata — GPT-6 Sol 10,00 USD per miljon tokens mot Qwen3.8-Max 6,00 USD per miljon tokens; Alibabas pris är 40 % lägre
• Cachad indata — GPT-6 Sol $0.20 per miljon tokens mot Qwen3.8-Max $0.25 per miljon tokens för implicita cacheläsningar, med en explicit cacheläsning på $0.17 och en explicit cacheskrivning på $2.50
• Kontextfönster — GPT-6 Sol 1 050 000 tokens mot Qwen3.8-Max 1 000 000 tokens
• Maximal utdata — GPT-6 Sol 128 000 tokens mot Qwen3.8-Max 131 072 tokens
• Inmatningsmodaliteter – GPT-6 Sol text och bild mot Qwen3.8-Max text, bild och video
• Hantering av långa kontexter – GPT-6 Sol prissätter om hela begäran över 272 000 indatatoken till 2× indata- och cachepriser samt 1,5× utdatapriser, jämfört med Qwen3.8-Max som har en enhetlig nivå över hela fönstret, vilket är den enda punkten där Qwens prislista är strukturellt bättre snarare än marginellt billigare
• Resonemangsinsats — GPT-6 Sol ingen, låg, medel (standard), hög, xhigh, max vs Qwen3.8-Max låg, medel och extra hög
• Kunskapsgräns – GPT-6 Sol 20 april 2026 vs. Qwen3.8-Max inte publicerad som ett enskilt datum
• Daterad ögonblicksbild — GPT-6 Sol: en enda rullande identifierare mot Qwen3.8-Max-0902, tillgänglig som en fastnålad revision daterad 2 september 2026 till samma pris
Long context-raden förtjänar mer uppmärksamhet än den vanligtvis får. Tilläggsavgiften för GPT-6 Sol är ett steg som tillämpas på hela begäran, så en agentkörning på 900 000 token faktureras med $4.00 och $15.00 per token. Qwen3.8-Max debiterar en enda nivå över hela fönstret. För en arbetsbelastning som ligger över 272 000 token slutar de två prislistorna att vara jämförbara över huvud taget – den modell som är billigare i rubriken är den dyrare med bred marginal, och gapets riktning beror helt på var din kontext befinner sig.

Prislistan säger 40 % billigare. Testramverket säger fem gånger notan.
Artificial Analysis uppmätte Qwen3.8-Max-0902 till en poäng på 45 i Intelligence Index, med en kostnad på 5,41 dollar per slutförd indexuppgift, efter att ha genererat 190 miljoner utdatatokens under körningen. Dess sammanfattning beskriver modellen som "anmärkningsvärt långsam och mycket ordrik". GPT-6 Sol fick 48 poäng till en kostnad av 1,06 dollar per uppgift med 77 miljoner utdatatokens.
Läs de tre paren tillsammans och uppgörelsens form framträder. Qwen ligger tre indexpunkter efter, genererade två och en halv gånger så många tokens och kostade ungefär fem gånger så mycket per slutförd uppgift – på ett prisblad där dess output är 40 % billigare. Mekanismen är inte subtil. Vid 6,00 $ per miljon output-tokens kostar 190 miljoner tokens 1,14 $ per indexkörning enbart i output innan input räknas med; vid 10,00 $ per miljon kostar Sols 77 miljoner 0,77 $. Den billigare taxan köper fler tokens, inte en mindre räkning.
Detta är samma mönster som dyker upp i septemberfältet, och det är värt att formulera som en regel snarare än ett faktum om dessa två modeller: på en prislista per token är en 40 % rabatt på utdata värd ingenting om modellen avger två och en halv gånger så många tokens. Kostnad per slutförd uppgift är den enda siffran som överlever.
Vad Alibaba publicerade, och problemet med att ställa in ansträngningen
Alibabas egen benchmarktabell är den längsta i den här jämförelsen och den minst jämförbara. Leverantörsrapporterade siffror placerar Qwen3.8-Max före på PaperBench och IFBench men efter på SWE-bench Pro och Humanity's Last Exam, med en skala för resonemangsansträngning – låg, medel, extra hög – som inte har någon direkt motsvarighet i OpenAIs sexnivåskala. En poäng publicerad vid extra hög är inte samma produkt som en poäng publicerad vid medel, och ingen av leverantörerna anger vilken nivå som gav en viss siffra i ett jämförelsediagram.
Det är den ärliga anledningen till att inte luta sig mot någon av leverantörernas tabell här. Alibabas siffror körs i Alibabas testramverk med Alibabas effort-inställning; OpenAIs körs i OpenAIs. Siffrorna från Artificial Analysis finns just för att båda dessa är oanvändbara som en direkt jämförelse, och det är de som används ovan.
Reproducerbarhet är en riktig funktion, och den är prissatt till noll.
Den daterade ögonblicksbilden är den mest underskattade raden i den här jämförelsen. Qwen3.8-Max-0902 är en pinnad revision från den 2 september 2026 som Alibaba uppger har samma förmågor och prissättning som basmodellen. Att pinna den innebär att modellen bakom din endpoint inte ändras under dig mellan en tisdag och en torsdag.
GPT-6 Sol har ingen motsvarighet. Det är en enda rullande identifierare — samma modellsida har en standardsnapshot och inga daterade varianter — vilket innebär att det du benchmarkade i september inte är garanterat att vara det du anropar i november. För de flesta team är det okej. För en reglerad pipeline som måste kunna visa vad som producerade en utdata är det en verklig skillnad, och det är en som Alibaba ger bort gratis medan OpenAI inte erbjuder det alls.
Videolinjen är den som bestämmer
Allt ovanstående är en jämförelse. Den här delen är det inte. Om din indata innehåller video – skärminspelningar, inspektionsmaterial, föreläsningsinspelningar, allt där informationen rör sig snarare än finns i en stillbild – tar Qwen3.8-Max emot det inbyggt och GPT-6 Sol har ingen väg till det. Du kan inte prompta dig runt en modalitet. Du kan inte förbehandla en video till bilder och få samma resultat, eftersom tidsinformationen är själva poängen, och hur många indexpoäng som helst på ett textbenchmark kan inte ersätta den indata som din uppgift faktiskt kräver.
Det omvända fallet är också värt att nämna, eftersom det är där jämförelsen slutar vara snedvriden. Om din indata är text och bilder är Sol billigare per uppgift, fyra poäng före på den neutrala tavlan och billigare vid cachade läsningar. Videoförmågan är inte ett avgörande till din fördel; den är helt enkelt oanvänd.
Routning av ett beslut som har två separata svar

Det här är en matchning där den rätta arkitekturen verkligen är två modeller, inte en, och anledningen är att uppdelningen sker efter indatamodalitet snarare än efter svårighetsgrad. En pipeline som tar in video och resonerar över text behöver båda, och routningsregeln är en egenskap hos begäran snarare än en bedömningsfråga.
Qwen3.8-Max finns i OrcaRouters katalog — den daterade snapshoten qwen/qwen3.8-max-0902 är routbar till Alibabas listpris enligt pass-through-modellen, vilket innebär att en prisförändring från Alibaba är live hos oss samma dag i stället för efter att en återförsäljare har omförhandlat. GPT-6 Sol finns inte i vår katalog när detta skrivs och nås via OpenAIs eget API. Routing-DSL:en är delen som passar detta specifika fall: en regel som skickar videobärande förfrågningar åt ena hållet och allt annat åt det andra är precis vad den är till för, och automatisk failover innebär att modalitetsförgreningen inte blir den enda felpunkten.
Där var och en vinner
• Video in, text ut — Qwen3.8-Max, och det finns ingen tävling att beskriva.
• Text och bild som indata, kostnad per slutförd uppgift som mått — GPT-6 Sol, med ungefär fem gånger i den oberoende testbänken.
• Cache-prefix-arbete — GPT-6 Sol. Dess cachade läsning är marginellt billigare och dess tokenvolym är mindre än hälften.
• Förfrågningar över 272 000 indatatoken – Qwen3.8-Max. Sols omprissättning av hela förfrågan är den enskilt största kostnadsskillnaden i den här jämförelsen, och den syns inte i de officiella priserna.
• Reproducerbar fastlåsning — Qwen3.8-Max-0902, som inte kostar något extra och är den enda fastlåsta revisionen av de två.
• Om du fick se ett diagram där Qwen ligger före på SWE-bench Pro – kontrollera vems utvärderingsramverk som producerade det och vid vilken ansträngningsnivå. Den oberoende resultattavlan placerar Qwen tre poäng efter på det sammansatta måttet, och leverantörstabellerna är inte på samma skala som varandra.
Jämförda i den här artikeln3
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
