
GPT-6.1 Sol vs Qwen3.8-Max: Fakturan, inte prislistan
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Ta ett nattligt underhållsjobb för kodförrådet, kör det en gång per natt i en månad och sätt GPT-6.1 Sol och Qwen3.8-Max på det växelvis. Enligt siffrorna per uppgift från Artificial Analysis v4.3.2 kostar GPT-6.1 Sol $21,72 för dessa trettio nätter och Qwen3.8-Max kostar $162,27 — en skillnad på $140,55 i månaden, ungefär $1 690 om året, för ett jobb vars prislista per token anger $2,00 in och $10,00 ut mot $2,00 in och $6,00 ut. Priserna per miljon ligger inom ett avrundningsfel från varandra för input, och den kinesiska modellen är 40 % billigare för output, ändå skiljer sig fakturan med en faktor på 7,5. Leverantören släppte GPT-6.1 Sol den 29 september 2026; Qwen3.8-Max har varit tillgänglig sedan den 3 augusti 2026.
Det gapet är inte ett pristrick och inte en benchmark-artefakt – det är hela budskapet i den här jämförelsen, och det kommer från en enda siffra som ingen prislista visar dig.
Vad varje modell är
GPT-6.1 Sol är OpenAI:s nuvarande flaggskepp för resonemang och kodning, lanserat en vecka efter GPT-6 Sol som det ersätter, till samma listpris på $2.00 / $10.00, med ett pris för cachad indata på $0.10 och ett kontextfönster på 1 050 000 token. Det säljs för agentiskt arbete: dess best-for-taggar på vårt eget modellkort lyder resonemang, kodning och agentiskt, och det har högsta kvalitetsbetyget.
Qwen3.8-Max är Alibabas agentiska flaggskepp – en sluten modell som endast är tillgänglig via API, tar text-, bild- och videoindata och har ett kontextfönster på 1 000 000 tokens. Till skillnad från de mindre Qwen-utgåvorna har denna inga publicerade vikter. I Artificial Analysis ligger den på 45,42 i Intelligence Index, på 17:e plats av 147 modeller, med ett kodningsindex på 76,2 som placerar sig på nionde plats inom det området. Det är inte en svag modell. Den är helt enkelt dyr att låta tänka.
Numret som inte står på prislistan

Artificial Analysis noterar 107 730 uttoken per uppgift för Qwen3.8-Max, varav 70 830 är resonemangstoken. GPT-6.1 Sol producerar 38 128 uttoken, varav 25 190 är resonemangstoken. Den kinesiska modellen skriver 2,8 gånger så många token för att svara på samma fråga, och den skriver dem till 40 % lägre kostnad per token.
• Utdatatokens per uppgift — 38 128 vs 107 730; Qwen skriver 2,8× mer
• Varav resonemang — 25 190 vs 70 830
• Kostnad per uppgift — $0.724 mot $5.409; Qwen kostar 7,5× mer
• Tid per uppgift — 640 s vs 2 152 s; cirka 11 minuter vs cirka 36
• Tid till första svarstoken — 332,0 s mot 55,1 s
• Intelligence Index — 51,83 vs 45,42
• Kontextfönster — 1 050 000 mot 1 000 000 tokens
• Indata som accepteras — text, bild och fil vs text, bild och video
Gör multiplikationen, och rabatten försvinner. En modell som genererar nästan tre gånger så många tokens till en 40 % lägre kostnad kostar inte mindre – den kostar omkring 1,7 gånger så mycket enbart i utdata, och den uppmätta siffran per uppgift visar att den verkliga multipeln är 7,5 när man räknar in input, cachade läsningar och längden på det produktiva svaret.
Notera fjärde och femte raden, för de pekar i motsatta riktningar och tillsammans förklarar de vad Qwen3.8-Max är. Den returnerar sin första token på 55 sekunder där GPT-6.1 Sol tar fem och en halv minut, och spenderar sedan trettiosex minuter på att slutföra uppgiften där OpenAI-modellen är klar på elva. Det är en modell som börjar prata omedelbart och tänker i mycket stor utsträckning. För ett chattgränssnitt med ett strömmande svar uppfattas det som responsivitet. För ett obevakat nattligt jobb är det väggklockstid du också betalar för.
Tre områden där Qwen3.8-Max verkligen ligger före
Indexgapet är 6,4 punkter i hela sviten, vilket är den sorts siffra som citeras som om den vore enhetlig. Det är den inte, och oenigheten är lärorik:
• GPQA Diamond — Qwen3.8-Max 0,9283 vs GPT-6.1 Sol publiceras inte i denna körning
• GDPval — 1 671,4 vs 1 575,09
• Terminal-Bench 2.1 — 0,8876 mot ej publicerad i denna körning
• AutomationBench — 0,5619 mot 0,6487
• SciCode — publicerad i denna körning jämfört med 0.5417 för GPT-6.1 Sol
• CritPT — 0,1771 mot 0,3171
Qwen3.8-Max vinner de naturvetenskapliga frågorna på avancerad nivå och urvalet av yrkesuppgifter, vilket är ett riktigt resultat för en modell i dess generation och anledningen till att dess kodningsindex ligger på 9:e plats av 138. Den förlorar de svårare forskningsnära utvärderingarna – CritPT med 14 poäng – och den förlorar AutomationBench med 8,7, vilket är det som mest liknar oövervakat datorarbete. Vilken av de två du tror spelar större roll för din arbetsbelastning är det egentliga beslutet; rubriksiffran på 6,4 poäng är ett medelvärde över en oenighet, inte en dom.
Vad de extra tokens ger, och vad de inte ger
Long reasoning traces are not waste by definition. A model that spends 70,830 tokens of deliberation on a hard task is doing something the shorter model may be skipping, and on the evaluations where Qwen3.8-Max is ahead, that deliberation is plausibly why. The failure mode is that you pay for it on every task, not only the hard ones. Reasoning-token counts are a property of the model's calibration, not of the question's difficulty, and a model that over-thinks a one-line extraction bills you for it.
Sättet att ta reda på vilken av dina uppgifter som är vilken är att sluta behandla modellvalet som globalt. Vilket för oss till den del som är en konfigurationsändring.
Vårt eget modellkort för GPT-6.1 Sol innehåller subjektets levererade siffror: priset $2.00 / $10.00, kontextfönstret på 1 050 000 token, en p50 på 4,54 sekunder till första token och ett lagrat Artificial Analysis-indexblock på samma sida som prissättningen som en applikation faktiskt skulle routa mot.

En nyckel, en mätare, två modeller
Båda modellerna är nåbara via en enda OrcaRouter-slutpunkt – ett API för 200+ modeller, där listpriset förs vidare med 0 % påslag. OrcaRouter-kortet för Qwen3.8-Max visar den tillämpade taxan tillsammans med kontextfönstret på 1 000 000 token, indatamodaliteterna text/bild/video och sjudagarsvolymen på 101,4 miljoner token – siffrorna en applikation mäts mot, bredvid dem som artikeln argumenterar om. Att priserna förs vidare har särskild betydelse för just Qwen3.8-Max, eftersom en modell vars ekonomi domineras av volymen av utdatatoken är en som leverantören kan sätta nytt pris på när som helst, och en mätare som förs vidare innebär att ändringen når din faktura samma dag som Alibaba publicerar den, i stället för enligt en återförsäljares schema.

Det mer intressanta användningsområdet för routinglagret här är routing-DSL:en, som låter dig komponera modeller till ett enda anrop i stället för att välja en för hela applikationen. Dela upp nattjobbet: en billig modell klassificerar och extraherar, GPT-6.1 Sol hanterar resonemangs- och verifieringsstegen, och Qwen3.8-Max reserveras för de uppgifter där dess långa övervägande och dess vetenskapsstyrka i GPQA-klass faktiskt förändrar svaret. Automatisk felväxling täcker resten – om en leverantör försämras mitt under körningen flyttas begäran i stället för att batchen misslyckas.
Ingetdera av dessa är ett skäl att välja en modell. De är anledningen till att du inte behöver göra valet en gång och sedan leva med det.
Samtalet, och det man ska hålla utkik efter
Betala bara den 7,5-faldiga kostnaden där övervägandet förtjänar det. För ett generellt nattligt jobb är GPT-6.1 Sol till $0,724 per uppgift det försvarbara standardvalet, och $1 690 om året är reella. När uppgiften är hård vetenskap eller yrkesrelaterat resonemang med ett kontrollerbart svar är Qwen3.8-Max 0,9283 på GPQA Diamond värt tokensen — det är just det den gör bättre.
Det man bör hålla ögonen på är huruvida Alibaba sätter om priset. En modell med 2,8× tokens till $2,00/$6,00 är prissatt som om tokens vore den knappa resursen; modellens eget beteende gör tokens rikliga. Om outputpriset rör sig väsentligt, rör sig aritmetiken i den här artikeln med det, och genomströmningsmätaren kommer att visa dig det samma dag som det händer.
Jämförda i den här artikeln2
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
