
GPT-6 Sol vs Qwen3.8-Max: de enige regel waarop het gesloten model niet kan concurreren
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Bijna elke vergelijking tussen GPT-6 Sol en Qwen3.8-Max zal op kosten worden beslist, en bijna elke daarvan zal de kosten in dezelfde richting verkeerd inschatten. Qwen3.8-Max, het gehoste vlaggenschip van de leverancier, is sinds zijn algemene beschikbaarheid op 3 augustus 2026 geprijsd op $2,00 per miljoen inputtokens en $6,00 per miljoen outputtokens, met de gedateerde Qwen3.8-Max-0902-snapshot die op 2 september verscheen. GPT-6 Sol was op 22 september 2026 algemeen beschikbaar voor $2,00 in en $10,00 uit. Identieke inputprijs, en 40% goedkopere output op de Qwen3.8-Max-tariefkaart — en, op de onafhankelijke testomgeving, ongeveer vijf keer de kosten om een taak af te ronden.
Maar er is een tweede, zuiverder verschil dat het kostenargument voortdurend blijft begraven, en dat is precies het verschil dat bij sommige workloads daadwerkelijk de doorslag geeft. Qwen3.8-Max accepteert video. GPT-6 Sol niet. Dat is geen prijsregel of een benchmarkregel; het is een capaciteit die een van deze modellen heeft en het andere niet kan benaderen, en het is het enige onderdeel van deze vergelijking dat geen enkele hoeveelheid werk aan token-efficiëntie kan oplossen.

Twee vlaggenschepen, twee verschillende vormen
Qwen3.8-Max is een sparse mixture-of-experts-model met 2,4 biljoen parameters, waarvan er per query ongeveer 95 miljard actief zijn — het op één na grootste gehoste model in productie, na Kimi K3. Het contextvenster bedraagt één miljoen tokens met een uitvoerlimiet van 131.072 tokens, de invoermodaliteiten zijn tekst, afbeelding en video, en het ondersteunt reasoning-inspanning op laag, gemiddeld en extra hoog, met gestructureerde uitvoer en tool calling. Het gehoste vlaggenschip heeft geen open gewichten; het downloadbare artefact van dezelfde generatie is een aparte release met eigen beperkingen.
GPT-6 Sol accepteert tekst en afbeeldingen als invoer en levert tekst als uitvoer. Het venster is 1.050.000 tokens, met een maximale invoer van 922.000 tokens en een uitvoerplafond van 128.000 tokens, tegen een vast tarief van $2,00 en $10,00, met $0,20 per cache-lezing en $2,50 per cache-schrijfactie, waarbij het hele verzoek boven 272.000 invoertokens wordt herprijsd naar $4,00 en $15,00. Het is gesloten, met één enkele identifier, en OpenAI heeft de tarieven omschreven als permanent in plaats van promotioneel.
De venstercijfers ontlopen elkaar ongeveer 7%, en de outputplafonds zitten in dezelfde band. De modaliteitenlijst is het enige structurele gat — en dat gaat maar één kant op.
Regel voor regel
• Invoer — GPT-6 Sol $2,00 per miljoen tokens vs Qwen3.8-Max $2,00 per miljoen tokens; het meest in het oog springende cijfer is identiek
• Uitvoer — GPT-6 Sol $10,00 per miljoen tokens versus Qwen3.8-Max $6,00 per miljoen tokens; het tarief van Alibaba is 40% lager
• Gecachte invoer — GPT-6 Sol $0,20 per miljoen tokens vs Qwen3.8-Max $0,25 per miljoen tokens voor impliciete cache-reads, met een expliciete cache-read tegen $0,17 en een expliciete cache-write tegen $2,50
• Contextvenster — GPT-6 Sol 1.050.000 tokens vs Qwen3.8-Max 1.000.000 tokens
• Maximale uitvoer — GPT-6 Sol 128.000 tokens vs Qwen3.8-Max 131.072 tokens
• Invoermodaliteiten — GPT-6 Sol tekst en afbeelding vs. Qwen3.8-Max tekst, afbeelding en video
• Verwerking van lange contexten — GPT-6 Sol herprijst het hele verzoek boven 272.000 inputtokens tegen 2× de input- en cachetarieven en 1,5× de output, tegenover Qwen3.8-Max met een vast tarief over het volledige venster, wat de enige plek is waar de tariefkaart van Qwen structureel beter is in plaats van marginaal goedkoper
• Redeneerinspanning — GPT-6 Sol geen, laag, gemiddeld (standaard), hoog, xhoog, maximaal vs Qwen3.8-Max laag, gemiddeld en extra hoog
• Kennisafsluitdatum — GPT-6 Sol 20 april 2026 vs. Qwen3.8-Max niet als één enkele datum gepubliceerd
• Gedateerde momentopname — GPT-6 Sol één enkele doorlopende identificatie vs. Qwen3.8-Max-0902 beschikbaar als een vastgezette revisie van 2 september 2026 voor dezelfde prijs
De lang-contextlijn verdient meer aandacht dan ze gewoonlijk krijgt. De toeslag van GPT-6 Sol is een stap die op het hele verzoek wordt toegepast, dus een agent-run van 900.000 tokens wordt gefactureerd tegen $4,00 en $15,00 per token. Qwen3.8-Max rekent één tarief voor het hele venster. Voor een workload die boven de 272.000 tokens ligt, zijn de twee tariefkaarten helemaal niet meer met elkaar te vergelijken — het model dat op het eerste gezicht goedkoper is, is met een ruime marge het duurste, en de richting van het verschil hangt volledig af van waar je context zich bevindt.

De tariefkaart zegt 40% goedkoper. Het testharnas zegt vijf keer de factuur.
Artificial Analysis heeft Qwen3.8-Max-0902 gemeten op een Intelligence Index-score van 45, wat $5,41 per voltooide indextaak kostte, waarbij het model tijdens de run 190 miljoen outputtokens genereerde. De samenvatting ervan beschrijft het model als "opmerkelijk traag en zeer breedsprakig." GPT-6 Sol behaalde een score van 48 tegen $1,06 per taak, met 77 miljoen outputtokens.
Lees die drie paren samen en de vorm van de confrontatie wordt duidelijk. Qwen staat drie indexpunten achter, genereerde tweeënhalf keer zoveel tokens en kostte ongeveer vijf keer zoveel per voltooide taak — op een tariefkaart waarop de output 40% goedkoper is. Het mechanisme is niet subtiel. Bij $6,00 per miljoen outputtokens kost 190 miljoen tokens $1,14 per index-run, alleen al aan output, voordat de input wordt meegeteld; bij $10,00 per miljoen kost die 77 miljoen van Sol $0,77. Het lagere tarief koopt meer tokens, geen kleinere rekening.
Dit is hetzelfde patroon dat zich in het hele septemberveld voordoet, en het is de moeite waard om het als een regel te stellen in plaats van als een feit over deze twee modellen: op een tariefkaart per token is een korting van 40% op de output niets waard als het model tweeënhalf keer zoveel tokens uitstuurt. Kosten per voltooide taak is het enige cijfer dat standhoudt.
Wat Alibaba publiceerde, en het probleem met het instellen van de inspanning
Alibaba's eigen benchmarktabel is de langste in deze vergelijking en het minst vergelijkbaar. Door leveranciers gerapporteerde cijfers plaatsen Qwen3.8-Max voor op PaperBench en IFBench, maar achter op SWE-bench Pro en Humanity's Last Exam, met een schaal voor redeneerinspanning — laag, gemiddeld, extra hoog — die niet direct overeenkomt met OpenAI's schaal met zes niveaus. Een score die bij extra hoog is gepubliceerd, is niet hetzelfde product als een score die bij gemiddeld is gepubliceerd, en geen van beide leveranciers geeft aan welke van de twee een bepaald getal in een vergelijkingsgrafiek heeft opgeleverd.
Dat is de eerlijke reden om hier niet te vertrouwen op de tabel van welke leverancier dan ook. De cijfers van Alibaba zijn gedraaid op het testharnas van Alibaba met de effort-instelling van Alibaba; die van OpenAI op dat van OpenAI. De cijfers van Artificial Analysis bestaan juist omdat die beide onbruikbaar zijn voor een rechtstreekse vergelijking, en dat zijn de cijfers die hierboven zijn gebruikt.
Reproduceerbaarheid is een echte functie, en de prijs ervan is nul.
De gedateerde snapshot is de meest onderschatte regel in deze vergelijking. Qwen3.8-Max-0902 is een vastgepinde revisie van 2 september 2026 waarvan Alibaba zegt dat die dezelfde mogelijkheden en prijsstelling biedt als het basismodel. Door die vast te pinnen verandert het model achter je endpoint niet onder je tussen een dinsdag en een donderdag.
GPT-6 Sol kent geen equivalent. Het is één enkele rollende identifier — dezelfde modelpagina bevat een standaardsnapshot en geen gedateerde varianten — wat betekent dat wat je in september hebt gebenchmarkt, niet gegarandeerd hetzelfde is als wat je in november aanroept. Voor de meeste teams is dat prima. Voor een gereguleerde pijplijn die moet kunnen aantonen wat een output heeft geproduceerd, is dat een reëel verschil, en het is er een die Alibaba gratis weggeeft, terwijl OpenAI die helemaal niet aanbiedt.
De videolijn is degene die beslist
Alles hierboven is een vergelijking. Dit deel niet. Als je invoer video bevat — schermopnames, inspectiebeelden, college-opnames, alles waarbij de informatie in beweging is in plaats van in een stilstaand beeld — accepteert Qwen3.8-Max die native en heeft GPT-6 Sol er geen weg naartoe. Je kunt niet om een modaliteit heen prompten. Je kunt een video niet voorverwerken tot afbeeldingen en hetzelfde krijgen, want temporele informatie is juist het punt, en geen enkel aantal indexpunten op een tekstbenchmark vervangt de invoer die je taak daadwerkelijk vereist.
Het omgekeerde geval is ook het benoemen waard, want dat is het punt waarop de vergelijking niet langer scheef is. Als je invoer uit tekst en afbeeldingen bestaat, is Sol goedkoper per taak, vier punten voor op het neutrale scorebord en goedkoper bij gecachte reads. De videomogelijkheid is geen doorslaggevende factor in jouw voordeel; die wordt simpelweg niet gebruikt.
Een beslissing routeren die twee afzonderlijke antwoorden heeft

Dit is een combinatie waarbij de juiste architectuur echt uit twee modellen bestaat, niet uit één, en de reden daarvoor is dat de splitsing op basis van inputmodaliteit plaatsvindt in plaats van op basis van moeilijkheidsgraad. Een pipeline die video binnenhaalt en over tekst redeneert, heeft beide nodig, en de routeringsregel is een eigenschap van het verzoek in plaats van een inschattingskwestie.
Qwen3.8-Max staat in de catalogus van OrcaRouter — de gedateerde qwen/qwen3.8-max-0902-snapshot is routeerbaar tegen Alibaba's lijstprijs onder het pass-through-model, wat betekent dat een tariefwijziging van Alibaba dezelfde dag aan onze kant live is in plaats van pas nadat een reseller opnieuw heeft onderhandeld. GPT-6 Sol staat op het moment van schrijven niet in onze catalogus en is bereikbaar via OpenAI's eigen API. De routing-DSL is precies het onderdeel dat bij dit specifieke geval past: een regel die verzoeken met video de ene kant op stuurt en al het overige de andere kant op, is precies waarvoor die bedoeld is, en automatische failover betekent dat de modaliteitsvertakking niet het enige storingspunt wordt.
Waar elk van hen wint
• Video in, tekst uit — Qwen3.8-Max, en er is geen concurrentie om te beschrijven.
Tekst en afbeelding als invoer, kosten per voltooide taak als maatstaf — GPT-6 Sol, met ongeveer een factor vijf op de onafhankelijke testomgeving.
• Werk met gecachte prefix — GPT-6 Sol. De gecachte leesbewerking is marginaal goedkoper en het tokenvolume is minder dan de helft.
• Verzoeken boven 272.000 inputtokens — Qwen3.8-Max. De herprijsstelling van hele verzoeken door Sol is het grootste kostenverschil in deze vergelijking, en het is onzichtbaar in de hoofdtarieven.
• Reproduceerbare pinning — Qwen3.8-Max-0902, die niets extra kost en de enige gepinde revisie van de twee is.
• Als je een grafiek te zien kreeg waarin Qwen voorloopt op SWE-bench Pro — controleer door wiens harness die is gemaakt en bij welke effort-instelling. De onafhankelijke ranglijst heeft Qwen drie punten achterstand op de samengestelde score, en de leverancierstabellen zijn niet op dezelfde schaal als elkaar.
Vergeleken in dit artikel3
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
