Ett genererat hero-kort med titeln "GPT-6.1 Sol vs Qwen3.8-Max" med två paneler med rundade hörn: till vänster "GPT-6.1 Sol" som listar "OpenAI – släppt 29 sep 2026", "$2,00 in / $10,00 ut per 1M", "$0,72 per uppgift" och "AA Index 51,8"; till höger "Qwen3.8-Max" som listar "Alibaba – släppt 3 aug 2026", "$2,00 in / $6,00 ut per 1M", "$5,41 per uppgift" och "AA Index 45,4"; nedanför dem remsan "Samma indatapris. 7,5x fakturan."; sidfot "Siffror: Artificial Analysis v4.3.2." och OrcaRouter-logotypen längst ner till höger.
Guides & Insights

GPT-6.1 Sol vs Qwen3.8-Max: Fakturan, inte prislistan

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Ta ett nattligt underhållsjobb för kodförrådet, kör det en gång per natt i en månad och sätt GPT-6.1 Sol och Qwen3.8-Max på det växelvis. Enligt siffrorna per uppgift från Artificial Analysis v4.3.2 kostar GPT-6.1 Sol $21,72 för dessa trettio nätter och Qwen3.8-Max kostar $162,27 — en skillnad på $140,55 i månaden, ungefär $1 690 om året, för ett jobb vars prislista per token anger $2,00 in och $10,00 ut mot $2,00 in och $6,00 ut. Priserna per miljon ligger inom ett avrundningsfel från varandra för input, och den kinesiska modellen är 40 % billigare för output, ändå skiljer sig fakturan med en faktor på 7,5. Leverantören släppte GPT-6.1 Sol den 29 september 2026; Qwen3.8-Max har varit tillgänglig sedan den 3 augusti 2026.

Det gapet är inte ett pristrick och inte en benchmark-artefakt – det är hela budskapet i den här jämförelsen, och det kommer från en enda siffra som ingen prislista visar dig.

Vad varje modell är

GPT-6.1 Sol är OpenAI:s nuvarande flaggskepp för resonemang och kodning, lanserat en vecka efter GPT-6 Sol som det ersätter, till samma listpris på $2.00 / $10.00, med ett pris för cachad indata på $0.10 och ett kontextfönster på 1 050 000 token. Det säljs för agentiskt arbete: dess best-for-taggar på vårt eget modellkort lyder resonemang, kodning och agentiskt, och det har högsta kvalitetsbetyget.

Qwen3.8-Max är Alibabas agentiska flaggskepp – en sluten modell som endast är tillgänglig via API, tar text-, bild- och videoindata och har ett kontextfönster på 1 000 000 tokens. Till skillnad från de mindre Qwen-utgåvorna har denna inga publicerade vikter. I Artificial Analysis ligger den på 45,42 i Intelligence Index, på 17:e plats av 147 modeller, med ett kodningsindex på 76,2 som placerar sig på nionde plats inom det området. Det är inte en svag modell. Den är helt enkelt dyr att låta tänka.

Numret som inte står på prislistan

A generated two-column scoreboard titled 'GPT-6.1 Sol vs Qwen3.8-Max - the scoreboard'. Left column 'GPT-6.1 Sol': Output tokens 38,128, Reasoning tokens 25,190, Cost per task $0.72, AA Index 51.8, Time per task 640 s, Context 1.05M. Right column 'Qwen3.8-Max': Output tokens 107,730, Reasoning tokens 70,830, Cost per task $5.41, AA Index 45.4, Time per task 2,152 s, Context 1M. Footer: 'Both columns Artificial Analysis v4.3.2.' OrcaRouter logo bottom-right.

Artificial Analysis noterar 107 730 uttoken per uppgift för Qwen3.8-Max, varav 70 830 är resonemangstoken. GPT-6.1 Sol producerar 38 128 uttoken, varav 25 190 är resonemangstoken. Den kinesiska modellen skriver 2,8 gånger så många token för att svara på samma fråga, och den skriver dem till 40 % lägre kostnad per token.

• Utdatatokens per uppgift — 38 128 vs 107 730; Qwen skriver 2,8× mer

• Varav resonemang — 25 190 vs 70 830

• Kostnad per uppgift — $0.724 mot $5.409; Qwen kostar 7,5× mer

• Tid per uppgift — 640 s vs 2 152 s; cirka 11 minuter vs cirka 36

• Tid till första svarstoken — 332,0 s mot 55,1 s

• Intelligence Index — 51,83 vs 45,42

• Kontextfönster — 1 050 000 mot 1 000 000 tokens

• Indata som accepteras — text, bild och fil vs text, bild och video

Gör multiplikationen, och rabatten försvinner. En modell som genererar nästan tre gånger så många tokens till en 40 % lägre kostnad kostar inte mindre – den kostar omkring 1,7 gånger så mycket enbart i utdata, och den uppmätta siffran per uppgift visar att den verkliga multipeln är 7,5 när man räknar in input, cachade läsningar och längden på det produktiva svaret.

Notera fjärde och femte raden, för de pekar i motsatta riktningar och tillsammans förklarar de vad Qwen3.8-Max är. Den returnerar sin första token på 55 sekunder där GPT-6.1 Sol tar fem och en halv minut, och spenderar sedan trettiosex minuter på att slutföra uppgiften där OpenAI-modellen är klar på elva. Det är en modell som börjar prata omedelbart och tänker i mycket stor utsträckning. För ett chattgränssnitt med ett strömmande svar uppfattas det som responsivitet. För ett obevakat nattligt jobb är det väggklockstid du också betalar för.

Tre områden där Qwen3.8-Max verkligen ligger före

Indexgapet är 6,4 punkter i hela sviten, vilket är den sorts siffra som citeras som om den vore enhetlig. Det är den inte, och oenigheten är lärorik:

• GPQA Diamond — Qwen3.8-Max 0,9283 vs GPT-6.1 Sol publiceras inte i denna körning

• GDPval — 1 671,4 vs 1 575,09

• Terminal-Bench 2.1 — 0,8876 mot ej publicerad i denna körning

• AutomationBench — 0,5619 mot 0,6487

• SciCode — publicerad i denna körning jämfört med 0.5417 för GPT-6.1 Sol

• CritPT — 0,1771 mot 0,3171

Qwen3.8-Max vinner de naturvetenskapliga frågorna på avancerad nivå och urvalet av yrkesuppgifter, vilket är ett riktigt resultat för en modell i dess generation och anledningen till att dess kodningsindex ligger på 9:e plats av 138. Den förlorar de svårare forskningsnära utvärderingarna – CritPT med 14 poäng – och den förlorar AutomationBench med 8,7, vilket är det som mest liknar oövervakat datorarbete. Vilken av de två du tror spelar större roll för din arbetsbelastning är det egentliga beslutet; rubriksiffran på 6,4 poäng är ett medelvärde över en oenighet, inte en dom.

Vad de extra tokens ger, och vad de inte ger

Long reasoning traces are not waste by definition. A model that spends 70,830 tokens of deliberation on a hard task is doing something the shorter model may be skipping, and on the evaluations where Qwen3.8-Max is ahead, that deliberation is plausibly why. The failure mode is that you pay for it on every task, not only the hard ones. Reasoning-token counts are a property of the model's calibration, not of the question's difficulty, and a model that over-thinks a one-line extraction bills you for it.

Sättet att ta reda på vilken av dina uppgifter som är vilken är att sluta behandla modellvalet som globalt. Vilket för oss till den del som är en konfigurationsändring.

Vårt eget modellkort för GPT-6.1 Sol innehåller subjektets levererade siffror: priset $2.00 / $10.00, kontextfönstret på 1 050 000 token, en p50 på 4,54 sekunder till första token och ett lagrat Artificial Analysis-indexblock på samma sida som prissättningen som en applikation faktiskt skulle routa mot.

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing a 1,050,000-token context window, 128K max output, text/image/file input with text output, the $2.00 input and $10.00 output per-million prices, a 4.54 s p50 time to first token and 284.2M tokens routed over seven days, above the OpenAI-compatible code sample and the supported-parameters list.

En nyckel, en mätare, två modeller

Båda modellerna är nåbara via en enda OrcaRouter-slutpunkt – ett API för 200+ modeller, där listpriset förs vidare med 0 % påslag. OrcaRouter-kortet för Qwen3.8-Max visar den tillämpade taxan tillsammans med kontextfönstret på 1 000 000 token, indatamodaliteterna text/bild/video och sjudagarsvolymen på 101,4 miljoner token – siffrorna en applikation mäts mot, bredvid dem som artikeln argumenterar om. Att priserna förs vidare har särskild betydelse för just Qwen3.8-Max, eftersom en modell vars ekonomi domineras av volymen av utdatatoken är en som leverantören kan sätta nytt pris på när som helst, och en mätare som förs vidare innebär att ändringen når din faktura samma dag som Alibaba publicerar den, i stället för enligt en återförsäljares schema.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the $2.00 input and $6.00 output per-million prices, a 5.66 s p50 time to first token, 101.4M tokens over seven days, a 1,000,000-token context window and text/image/video input, above the OpenAI- and Anthropic-compatible code samples.

Det mer intressanta användningsområdet för routinglagret här är routing-DSL:en, som låter dig komponera modeller till ett enda anrop i stället för att välja en för hela applikationen. Dela upp nattjobbet: en billig modell klassificerar och extraherar, GPT-6.1 Sol hanterar resonemangs- och verifieringsstegen, och Qwen3.8-Max reserveras för de uppgifter där dess långa övervägande och dess vetenskapsstyrka i GPQA-klass faktiskt förändrar svaret. Automatisk felväxling täcker resten – om en leverantör försämras mitt under körningen flyttas begäran i stället för att batchen misslyckas.

Ingetdera av dessa är ett skäl att välja en modell. De är anledningen till att du inte behöver göra valet en gång och sedan leva med det.

Samtalet, och det man ska hålla utkik efter

Betala bara den 7,5-faldiga kostnaden där övervägandet förtjänar det. För ett generellt nattligt jobb är GPT-6.1 Sol till $0,724 per uppgift det försvarbara standardvalet, och $1 690 om året är reella. När uppgiften är hård vetenskap eller yrkesrelaterat resonemang med ett kontrollerbart svar är Qwen3.8-Max 0,9283 på GPQA Diamond värt tokensen — det är just det den gör bättre.

Det man bör hålla ögonen på är huruvida Alibaba sätter om priset. En modell med 2,8× tokens till $2,00/$6,00 är prissatt som om tokens vore den knappa resursen; modellens eget beteende gör tokens rikliga. Om outputpriset rör sig väsentligt, rör sig aritmetiken i den här artikeln med det, och genomströmningsmätaren kommer att visa dig det samma dag som det händer.

Jämförda i den här artikeln2

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen