
GPT-6.1 Sol vs Qwen3.8-Max: De factuur, niet de prijslijst
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Neem één nachtelijke repository-onderhoudstaak, laat die een maand lang één keer per nacht draaien, en zet GPT-6.1 Sol en Qwen3.8-Max er om de beurt op. Volgens de cijfers per taak van Artificial Analysis v4.3.2 kost GPT-6.1 Sol $21,72 voor die dertig nachten en Qwen3.8-Max kost $162,27 — een verschil van $140,55 per maand, ongeveer $1.690 per jaar, voor een taak waarvan de prijslijst per token $2,00 in en $10,00 uit vermeldt tegenover $2,00 in en $6,00 uit. De tarieven per miljoen liggen bij input binnen een afrondingsfout van elkaar en het Chinese model is 40% goedkoper bij output, toch verschilt de factuur met een factor 7,5. De leverancier bracht GPT-6.1 Sol uit op 29 september 2026; Qwen3.8-Max is live sinds 3 augustus 2026.
That gap is not a pricing trick and it is not a benchmark artefact — it is the whole of what this comparison has to say, and it comes from one number that no rate card shows you.
Wat elk model is
GPT-6.1 Sol is het huidige vlaggenschip van OpenAI voor redeneren en coderen, dat een week na de GPT-6 Sol die het vervangt is uitgebracht, tegen dezelfde lijstprijs van $2,00 / $10,00, met een tarief van $0,10 voor gecachte invoer en een contextvenster van 1.050.000 tokens. Het wordt verkocht voor agentisch werk: de best-for-tags op onze eigen modelkaart luiden redeneren, coderen en agentisch, en het draagt de kwaliteitsscore van het hoogste niveau.
Qwen3.8-Max is het agentische vlaggenschip van Alibaba — een gesloten model dat alleen via een API beschikbaar is, tekst-, afbeeldings- en video-invoer accepteert en een context van 1.000.000 tokens biedt. Anders dan de kleinere Qwen-releases heeft deze geen gepubliceerde gewichten. Op Artificial Analysis staat het op 45,42 op de Intelligence Index, als 17e van 147 modellen, met een codingindex van 76,2 die een 9e plaats op dat gebied oplevert. Het is geen zwak model. Het is simpelweg een duur model om te laten nadenken.
Het nummer dat niet op de tariefkaart staat

Artificial Analysis registreert 107.730 outputtokens per taak voor Qwen3.8-Max, waarvan 70.830 redeneertokens. GPT-6.1 Sol produceert 38.128 outputtokens, waarvan 25.190 redeneertokens. Het Chinese model schrijft 2,8 keer zoveel tokens om dezelfde vraag te beantwoorden, en het schrijft ze tegen 40% lagere kosten per token.
• Uitvoertokens per taak — 38.128 vs. 107.730; Qwen schrijft 2,8× meer
• Waarvan redeneren — 25,190 vs 70,830
• Kosten per taak — $ 0,724 vs $ 5,409; Qwen kost 7,5× meer
• Tijd per taak — 640 s vs 2.152 s; ongeveer 11 minuten vs ongeveer 36
• Tijd tot eerste antwoordtoken — 332,0 s vs 55,1 s
• Intelligentie-index — 51,83 vs. 45,42
• Contextvenster — 1.050.000 vs. 1.000.000 tokens
• Geaccepteerde invoer — tekst, afbeelding en bestand vs. tekst, afbeelding en video
Doe de vermenigvuldiging en de korting verdwijnt. Een model dat bijna drie keer zoveel tokens produceert tegen een 40% lager tarief kost niet minder — het kost alleen al op de output ongeveer 1,7 keer zoveel, en het gemeten cijfer per taak brengt de werkelijke factor op 7,5 wanneer input, gecachte reads en de lengte van het productieve antwoord worden meegerekend.
Let op de vierde en vijfde regels, want ze wijzen in tegengestelde richtingen en samen verklaren ze wat Qwen3.8-Max is. Het geeft zijn eerste token na 55 seconden, terwijl GPT-6.1 Sol er vijf en een halve minuut over doet, en besteedt vervolgens zesendertig minuten aan het voltooien van de taak, terwijl het OpenAI-model in elf minuten klaar is. Dat is een model dat onmiddellijk begint te praten en zeer uitgebreid nadenkt. Voor een chatinterface met een streamend antwoord komt dat over als responsiviteit. Voor een onbeheerde nachtelijke job is het kloktijd die je ook betaalt.
Drie punten waarop Qwen3.8-Max echt vooroploopt
De indexkloof bedraagt 6,4 punten over de hele suite, het soort getal dat wordt aangehaald alsof het uniform is. Dat is het niet, en de discrepantie is leerzaam:
• GPQA Diamond — Qwen3.8-Max 0.9283 versus GPT-6.1 Sol niet gepubliceerd in deze run
• GDPval — 1.671,4 vs 1.575,09
• Terminal-Bench 2.1 — 0,8876 vs. niet gepubliceerd in deze run
• AutomationBench — 0,5619 vs. 0,6487
• SciCode — niet gepubliceerd in deze run vs 0,5417 voor GPT-6.1 Sol
• CritPT — 0,1771 vs 0,3171
Qwen3.8-Max wint de wetenschapsvragen op masterniveau en de steekproef met beroepstaken, wat een echt resultaat is voor een model uit zijn generatie en de reden dat zijn coderingsindex op de 9e plaats van 138 staat. Het verliest de moeilijkere, onderzoeksgerelateerde evaluaties — CritPT met 14 punten — en het verliest AutomationBench met 8,7, de benchmark die het meest op onbeheerd computerwerk lijkt. Welke van die twee jij belangrijker vindt voor jouw workload, is de eigenlijke beslissing; het kopcijfer van 6,4 punten is een gemiddelde over een meningsverschil, geen eindoordeel.
Wat de extra tokens opleveren, en wat niet
Lange redeneersporen zijn per definitie geen verspilling. Een model dat 70.830 tokens aan overweging besteedt aan een moeilijke taak, doet iets wat het kortere model misschien overslaat, en bij de evaluaties waarop Qwen3.8-Max voorloopt, is die overweging waarschijnlijk de reden. De faalmodus is dat je ervoor betaalt bij elke taak, niet alleen bij de moeilijke. Het aantal redeneertokens is een eigenschap van de kalibratie van het model, niet van de moeilijkheidsgraad van de vraag, en een model dat te lang nadenkt over een eenregelige extractie, laat je daarvoor betalen.
De manier om erachter te komen welke van je taken welke is, is om de modelkeuze niet langer als globaal te behandelen. Dat brengt ons bij het deel dat een configuratiewijziging is.
Onze eigen modelkaart voor GPT-6.1 Sol bevat de geserveerde cijfers van het subject: het tarief van $2,00 / $10,00, het contextvenster van 1.050.000 tokens, een p50 van 4,54 seconden tot het eerste token, en een opgeslagen Artificial Analysis-indexblok op dezelfde pagina als de prijsstelling waartegen een applicatie daadwerkelijk zou routeren.

Eén sleutel, één meter, twee modellen
Beide modellen zijn bereikbaar via één OrcaRouter-endpoint — één API voor 200+ modellen, de lijstprijs van de provider doorgegeven tegen 0% opslag. De OrcaRouter-kaart voor Qwen3.8-Max vermeldt het gehanteerde tarief naast het contextvenster van 1.000.000 tokens, de invoermodaliteiten tekst/afbeelding/video en het zevendaagse volume van 101,4 miljoen tokens — de cijfers waarop een applicatie routeert, naast de cijfers waarover het artikel discussieert. Die doorgifte is specifiek van belang voor Qwen3.8-Max, want een model waarvan de economie wordt gedomineerd door het volume aan uitvoertokens is er een waarvan de leverancier de prijs op elk moment kan herzien, en een doorgifte-meter betekent dat de wijziging je factuur bereikt op de dag dat Alibaba die publiceert, en niet volgens het schema van een wederverkoper.

Het interessantere gebruik van de routeringslaag hier is de routerings-DSL, waarmee je modellen kunt samenstellen in één aanroep in plaats van er één voor de hele applicatie te kiezen. Splits de nachtelijke taak: een goedkoop model classificeert en extraheert, GPT-6.1 Sol neemt de redeneer- en verificatiestappen voor zijn rekening, en Qwen3.8-Max is gereserveerd voor de taken waar zijn lange beraadslaging en zijn wetenschappelijke kracht van GPQA-niveau daadwerkelijk het antwoord veranderen. Automatische failover dekt de rest: als een provider midden in een run verslechtert, wordt het verzoek verplaatst in plaats van dat de batch mislukt.
Geen van beide is een reden om een model te kiezen. Ze zijn juist de reden dat je die keuze niet één keer hoeft te maken en er vervolgens mee te leven.
De oproep, en het ding om in de gaten te houden
Betaal de 7,5-voudige prijs alleen wanneer de deliberatie dat rechtvaardigt. Bij een nachtelijke taak voor algemeen gebruik is GPT-6.1 Sol tegen $0,724 per taak de verdedigbare standaardoptie, en de $1.690 per jaar is reëel. Waar de taak harde wetenschap of beroepsmatig redeneren met een controleerbaar antwoord betreft, is de 0,9283 van Qwen3.8-Max op GPQA Diamond de tokens waard — dat is precies waar het beter in is.
Het punt om in de gaten te houden is of Alibaba zijn prijzen aanpast. Een model dat 2,8× zoveel tokens produceert, tegen $2,00/$6,00, is geprijsd alsof tokens het schaarse goed zijn; het gedrag van het model zelf maakt tokens overvloedig. Als het tarief voor output wezenlijk verandert, beweegt de rekensom in dit artikel mee, en de pass-through-meter laat je dat zien op dezelfde dag dat het gebeurt.
Vergeleken in dit artikel2
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
