Ett hero-titelkort för en artikel som jämför GPT-6 Sol med Qwen3.8-Max, med texten 'GPT-6 Sol vs Qwen3.8-Max' och underrubriken 'Den enda raden där den slutna modellen inte kan konkurrera', som visar GPT-6 Sol som text- och bildindata och Qwen3.8-Max som text-, bild- och videoindata.
Guides & Insights

GPT-6 Sol vs Qwen3.8-Max: Den enda linjen där den slutna modellen inte kan konkurrera

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Nästan varje jämförelse mellan GPT-6 Sol och Qwen3.8-Max kommer att avgöras av kostnaden, och nästan varenda en av dem kommer att räkna fel på kostnaden åt samma håll. Qwen3.8-Max, leverantörens hostade flaggskeppsmodell, har prissatts till 2,00 USD per miljon indatatokens och 6,00 USD per miljon utdatatokens sedan den blev allmänt tillgänglig den 3 augusti 2026, med den datummärkta Qwen3.8-Max-0902-snapshoten som släpps den 2 september. GPT-6 Sol blev allmänt tillgänglig den 22 september 2026 till 2,00 USD för indata och 10,00 USD för utdata. Identiskt indatapris, och 40 % billigare utdata enligt prislistan för Qwen3.8-Max – och, i det oberoende testramverket, ungefär fem gånger kostnaden för att slutföra en uppgift.

Men det finns en andra, renare skillnad som kostnadsargumentet ständigt begraver, och det är den som faktiskt avgör vissa arbetsbelastningar. Qwen3.8-Max tar emot video. GPT-6 Sol gör det inte. Det är inte en prisuppgift eller en benchmark-siffra; det är en förmåga som en av dessa modeller har och den andra inte kan approximera, och det är den enda delen av den här duellen som inte kan åtgärdas, hur mycket arbete med token-effektivitet som än läggs ned.

A six-row scoreboard card titled 'GPT-6 Sol vs Qwen3.8-Max - the scoreboard', comparing the two models on output price, Intelligence Index, cost per task, input modality, maximum output and long-context handling. The left column lists GPT-6 Sol at $10.00 output, an Index of 48, $1.06 per task, text and image input, a 128,000-token maximum output and whole-request repricing above 272K; the right column lists Qwen3.8-Max at $6.00 output, an Index of 45, $5.41 per task, text, image and video input, a 131,072-token maximum output and a flat tier above 272K. A footer reads 'Vendor list rates; Index per Artificial Analysis.'

Två flaggskepp, två olika former

Qwen3.8-Max är en gles mixture-of-experts-modell med 2,4 biljoner parametrar, varav ungefär 95 miljarder är aktiva per fråga — den näst största värdbaserade modellen i produktion efter Kimi K3. Dess kontextfönster är en miljon tokens med en utdatagräns på 131 072 tokens, dess indatamodaliteter är text, bild och video, och den stöder resonemangsansträngning över låg, medel och extra hög med strukturerade utdata och verktygsanrop. Den värdbaserade flaggskeppsmodellen har inte öppna vikter; den nedladdningsbara artefakten av samma generation är en separat utgåva med sina egna begränsningar.

GPT-6 Sol tar in text och bild och ger text ut. Dess kontextfönster är 1 050 000 tokens med en maximal indata på 922 000 tokens och ett tak för utdata på 128 000 tokens, med ett fast pris på $2.00 och $10.00, en cachad läsning på $0.20 och cacheskrivningar på $2.50, vilket omprissätter hela begäran över 272 000 indatatokens till $4.00 och $15.00. Den är stängd, med en enda identifierare, och OpenAI har beskrivit priserna som permanenta snarare än kampanjpriser.

Fönstersiffrorna ligger inom cirka 7 % från varandra, och utdatataken ligger i samma intervall. Modalitetslistan är den enda strukturella luckan – och den går bara åt ena hållet.

Rad för rad

• Indata — GPT-6 Sol $2.00 per miljon tokens mot Qwen3.8-Max $2.00 per miljon tokens; rubriksiffran är identisk

• Utdata — GPT-6 Sol 10,00 USD per miljon tokens mot Qwen3.8-Max 6,00 USD per miljon tokens; Alibabas pris är 40 % lägre

• Cachad indata — GPT-6 Sol $0.20 per miljon tokens mot Qwen3.8-Max $0.25 per miljon tokens för implicita cacheläsningar, med en explicit cacheläsning på $0.17 och en explicit cacheskrivning på $2.50

• Kontextfönster — GPT-6 Sol 1 050 000 tokens mot Qwen3.8-Max 1 000 000 tokens

• Maximal utdata — GPT-6 Sol 128 000 tokens mot Qwen3.8-Max 131 072 tokens

• Inmatningsmodaliteter – GPT-6 Sol text och bild mot Qwen3.8-Max text, bild och video

• Hantering av långa kontexter – GPT-6 Sol prissätter om hela begäran över 272 000 indatatoken till 2× indata- och cachepriser samt 1,5× utdatapriser, jämfört med Qwen3.8-Max som har en enhetlig nivå över hela fönstret, vilket är den enda punkten där Qwens prislista är strukturellt bättre snarare än marginellt billigare

• Resonemangsinsats — GPT-6 Sol ingen, låg, medel (standard), hög, xhigh, max vs Qwen3.8-Max låg, medel och extra hög

• Kunskapsgräns – GPT-6 Sol 20 april 2026 vs. Qwen3.8-Max inte publicerad som ett enskilt datum

• Daterad ögonblicksbild — GPT-6 Sol: en enda rullande identifierare mot Qwen3.8-Max-0902, tillgänglig som en fastnålad revision daterad 2 september 2026 till samma pris

Long context-raden förtjänar mer uppmärksamhet än den vanligtvis får. Tilläggsavgiften för GPT-6 Sol är ett steg som tillämpas på hela begäran, så en agentkörning på 900 000 token faktureras med $4.00 och $15.00 per token. Qwen3.8-Max debiterar en enda nivå över hela fönstret. För en arbetsbelastning som ligger över 272 000 token slutar de två prislistorna att vara jämförbara över huvud taget – den modell som är billigare i rubriken är den dyrare med bred marginal, och gapets riktning beror helt på var din kontext befinner sig.

Screenshot of the Artificial Analysis model page for Qwen3.8 Max (0902), captured 23 September 2026, showing an Intelligence Index score of 45, list pricing of $2.00 per million input tokens and $6.00 per million output tokens, a cost of $5.41 per Intelligence Index task, 190 million output tokens generated during the index run, a 984,000-token context window and 39.2 output tokens per second.

Prislistan säger 40 % billigare. Testramverket säger fem gånger notan.

Artificial Analysis uppmätte Qwen3.8-Max-0902 till en poäng på 45 i Intelligence Index, med en kostnad på 5,41 dollar per slutförd indexuppgift, efter att ha genererat 190 miljoner utdatatokens under körningen. Dess sammanfattning beskriver modellen som "anmärkningsvärt långsam och mycket ordrik". GPT-6 Sol fick 48 poäng till en kostnad av 1,06 dollar per uppgift med 77 miljoner utdatatokens.

Läs de tre paren tillsammans och uppgörelsens form framträder. Qwen ligger tre indexpunkter efter, genererade två och en halv gånger så många tokens och kostade ungefär fem gånger så mycket per slutförd uppgift – på ett prisblad där dess output är 40 % billigare. Mekanismen är inte subtil. Vid 6,00 $ per miljon output-tokens kostar 190 miljoner tokens 1,14 $ per indexkörning enbart i output innan input räknas med; vid 10,00 $ per miljon kostar Sols 77 miljoner 0,77 $. Den billigare taxan köper fler tokens, inte en mindre räkning.

Detta är samma mönster som dyker upp i septemberfältet, och det är värt att formulera som en regel snarare än ett faktum om dessa två modeller: på en prislista per token är en 40 % rabatt på utdata värd ingenting om modellen avger två och en halv gånger så många tokens. Kostnad per slutförd uppgift är den enda siffran som överlever.

Vad Alibaba publicerade, och problemet med att ställa in ansträngningen

Alibabas egen benchmarktabell är den längsta i den här jämförelsen och den minst jämförbara. Leverantörsrapporterade siffror placerar Qwen3.8-Max före på PaperBench och IFBench men efter på SWE-bench Pro och Humanity's Last Exam, med en skala för resonemangsansträngning – låg, medel, extra hög – som inte har någon direkt motsvarighet i OpenAIs sexnivåskala. En poäng publicerad vid extra hög är inte samma produkt som en poäng publicerad vid medel, och ingen av leverantörerna anger vilken nivå som gav en viss siffra i ett jämförelsediagram.

Det är den ärliga anledningen till att inte luta sig mot någon av leverantörernas tabell här. Alibabas siffror körs i Alibabas testramverk med Alibabas effort-inställning; OpenAIs körs i OpenAIs. Siffrorna från Artificial Analysis finns just för att båda dessa är oanvändbara som en direkt jämförelse, och det är de som används ovan.

Reproducerbarhet är en riktig funktion, och den är prissatt till noll.

Den daterade ögonblicksbilden är den mest underskattade raden i den här jämförelsen. Qwen3.8-Max-0902 är en pinnad revision från den 2 september 2026 som Alibaba uppger har samma förmågor och prissättning som basmodellen. Att pinna den innebär att modellen bakom din endpoint inte ändras under dig mellan en tisdag och en torsdag.

GPT-6 Sol har ingen motsvarighet. Det är en enda rullande identifierare — samma modellsida har en standardsnapshot och inga daterade varianter — vilket innebär att det du benchmarkade i september inte är garanterat att vara det du anropar i november. För de flesta team är det okej. För en reglerad pipeline som måste kunna visa vad som producerade en utdata är det en verklig skillnad, och det är en som Alibaba ger bort gratis medan OpenAI inte erbjuder det alls.

Videolinjen är den som bestämmer

Allt ovanstående är en jämförelse. Den här delen är det inte. Om din indata innehåller video – skärminspelningar, inspektionsmaterial, föreläsningsinspelningar, allt där informationen rör sig snarare än finns i en stillbild – tar Qwen3.8-Max emot det inbyggt och GPT-6 Sol har ingen väg till det. Du kan inte prompta dig runt en modalitet. Du kan inte förbehandla en video till bilder och få samma resultat, eftersom tidsinformationen är själva poängen, och hur många indexpoäng som helst på ett textbenchmark kan inte ersätta den indata som din uppgift faktiskt kräver.

Det omvända fallet är också värt att nämna, eftersom det är där jämförelsen slutar vara snedvriden. Om din indata är text och bilder är Sol billigare per uppgift, fyra poäng före på den neutrala tavlan och billigare vid cachade läsningar. Videoförmågan är inte ett avgörande till din fördel; den är helt enkelt oanvänd.

Routning av ett beslut som har två separata svar

Screenshot of OrcaRouter's model page for Qwen3.8 Max (0902), captured 23 September 2026, showing the model id qwen/qwen3.8-max-0902 from provider Qwen, a 1M-token context window with a 131k-token maximum output, text, image and video input with text output, list pricing of $2.00 per million input tokens and $6.00 per million output tokens, and a p50 time to first token of 3.50 seconds.

Det här är en matchning där den rätta arkitekturen verkligen är två modeller, inte en, och anledningen är att uppdelningen sker efter indatamodalitet snarare än efter svårighetsgrad. En pipeline som tar in video och resonerar över text behöver båda, och routningsregeln är en egenskap hos begäran snarare än en bedömningsfråga.

Qwen3.8-Max finns i OrcaRouters katalog — den daterade snapshoten qwen/qwen3.8-max-0902 är routbar till Alibabas listpris enligt pass-through-modellen, vilket innebär att en prisförändring från Alibaba är live hos oss samma dag i stället för efter att en återförsäljare har omförhandlat. GPT-6 Sol finns inte i vår katalog när detta skrivs och nås via OpenAIs eget API. Routing-DSL:en är delen som passar detta specifika fall: en regel som skickar videobärande förfrågningar åt ena hållet och allt annat åt det andra är precis vad den är till för, och automatisk failover innebär att modalitetsförgreningen inte blir den enda felpunkten.

Där var och en vinner

• Video in, text ut — Qwen3.8-Max, och det finns ingen tävling att beskriva.

• Text och bild som indata, kostnad per slutförd uppgift som mått — GPT-6 Sol, med ungefär fem gånger i den oberoende testbänken.

• Cache-prefix-arbete — GPT-6 Sol. Dess cachade läsning är marginellt billigare och dess tokenvolym är mindre än hälften.

• Förfrågningar över 272 000 indatatoken – Qwen3.8-Max. Sols omprissättning av hela förfrågan är den enskilt största kostnadsskillnaden i den här jämförelsen, och den syns inte i de officiella priserna.

• Reproducerbar fastlåsning — Qwen3.8-Max-0902, som inte kostar något extra och är den enda fastlåsta revisionen av de två.

• Om du fick se ett diagram där Qwen ligger före på SWE-bench Pro – kontrollera vems utvärderingsramverk som producerade det och vid vilken ansträngningsnivå. Den oberoende resultattavlan placerar Qwen tre poäng efter på det sammansatta måttet, och leverantörstabellerna är inte på samma skala som varandra.

Jämförda i den här artikeln3

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen