Een hero-titelkaart voor een artikel dat GPT-6 Sol met Qwen3.8-Max vergelijkt, met de tekst 'GPT-6 Sol vs Qwen3.8-Max' en de ondertitel 'De enige regel waarop het gesloten model niet kan concurreren', waarbij GPT-6 Sol als tekst- en beeldinvoer wordt getoond en Qwen3.8-Max als tekst-, beeld- en video-invoer.
Guides & Insights

GPT-6 Sol vs Qwen3.8-Max: de enige regel waarop het gesloten model niet kan concurreren

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Bijna elke vergelijking tussen GPT-6 Sol en Qwen3.8-Max zal op kosten worden beslist, en bijna elke daarvan zal de kosten in dezelfde richting verkeerd inschatten. Qwen3.8-Max, het gehoste vlaggenschip van de leverancier, is sinds zijn algemene beschikbaarheid op 3 augustus 2026 geprijsd op $2,00 per miljoen inputtokens en $6,00 per miljoen outputtokens, met de gedateerde Qwen3.8-Max-0902-snapshot die op 2 september verscheen. GPT-6 Sol was op 22 september 2026 algemeen beschikbaar voor $2,00 in en $10,00 uit. Identieke inputprijs, en 40% goedkopere output op de Qwen3.8-Max-tariefkaart — en, op de onafhankelijke testomgeving, ongeveer vijf keer de kosten om een taak af te ronden.

Maar er is een tweede, zuiverder verschil dat het kostenargument voortdurend blijft begraven, en dat is precies het verschil dat bij sommige workloads daadwerkelijk de doorslag geeft. Qwen3.8-Max accepteert video. GPT-6 Sol niet. Dat is geen prijsregel of een benchmarkregel; het is een capaciteit die een van deze modellen heeft en het andere niet kan benaderen, en het is het enige onderdeel van deze vergelijking dat geen enkele hoeveelheid werk aan token-efficiëntie kan oplossen.

A six-row scoreboard card titled 'GPT-6 Sol vs Qwen3.8-Max - the scoreboard', comparing the two models on output price, Intelligence Index, cost per task, input modality, maximum output and long-context handling. The left column lists GPT-6 Sol at $10.00 output, an Index of 48, $1.06 per task, text and image input, a 128,000-token maximum output and whole-request repricing above 272K; the right column lists Qwen3.8-Max at $6.00 output, an Index of 45, $5.41 per task, text, image and video input, a 131,072-token maximum output and a flat tier above 272K. A footer reads 'Vendor list rates; Index per Artificial Analysis.'

Twee vlaggenschepen, twee verschillende vormen

Qwen3.8-Max is een sparse mixture-of-experts-model met 2,4 biljoen parameters, waarvan er per query ongeveer 95 miljard actief zijn — het op één na grootste gehoste model in productie, na Kimi K3. Het contextvenster bedraagt één miljoen tokens met een uitvoerlimiet van 131.072 tokens, de invoermodaliteiten zijn tekst, afbeelding en video, en het ondersteunt reasoning-inspanning op laag, gemiddeld en extra hoog, met gestructureerde uitvoer en tool calling. Het gehoste vlaggenschip heeft geen open gewichten; het downloadbare artefact van dezelfde generatie is een aparte release met eigen beperkingen.

GPT-6 Sol accepteert tekst en afbeeldingen als invoer en levert tekst als uitvoer. Het venster is 1.050.000 tokens, met een maximale invoer van 922.000 tokens en een uitvoerplafond van 128.000 tokens, tegen een vast tarief van $2,00 en $10,00, met $0,20 per cache-lezing en $2,50 per cache-schrijfactie, waarbij het hele verzoek boven 272.000 invoertokens wordt herprijsd naar $4,00 en $15,00. Het is gesloten, met één enkele identifier, en OpenAI heeft de tarieven omschreven als permanent in plaats van promotioneel.

De venstercijfers ontlopen elkaar ongeveer 7%, en de outputplafonds zitten in dezelfde band. De modaliteitenlijst is het enige structurele gat — en dat gaat maar één kant op.

Regel voor regel

• Invoer — GPT-6 Sol $2,00 per miljoen tokens vs Qwen3.8-Max $2,00 per miljoen tokens; het meest in het oog springende cijfer is identiek

• Uitvoer — GPT-6 Sol $10,00 per miljoen tokens versus Qwen3.8-Max $6,00 per miljoen tokens; het tarief van Alibaba is 40% lager

• Gecachte invoer — GPT-6 Sol $0,20 per miljoen tokens vs Qwen3.8-Max $0,25 per miljoen tokens voor impliciete cache-reads, met een expliciete cache-read tegen $0,17 en een expliciete cache-write tegen $2,50

• Contextvenster — GPT-6 Sol 1.050.000 tokens vs Qwen3.8-Max 1.000.000 tokens

• Maximale uitvoer — GPT-6 Sol 128.000 tokens vs Qwen3.8-Max 131.072 tokens

• Invoermodaliteiten — GPT-6 Sol tekst en afbeelding vs. Qwen3.8-Max tekst, afbeelding en video

• Verwerking van lange contexten — GPT-6 Sol herprijst het hele verzoek boven 272.000 inputtokens tegen 2× de input- en cachetarieven en 1,5× de output, tegenover Qwen3.8-Max met een vast tarief over het volledige venster, wat de enige plek is waar de tariefkaart van Qwen structureel beter is in plaats van marginaal goedkoper

• Redeneerinspanning — GPT-6 Sol geen, laag, gemiddeld (standaard), hoog, xhoog, maximaal vs Qwen3.8-Max laag, gemiddeld en extra hoog

• Kennisafsluitdatum — GPT-6 Sol 20 april 2026 vs. Qwen3.8-Max niet als één enkele datum gepubliceerd

• Gedateerde momentopname — GPT-6 Sol één enkele doorlopende identificatie vs. Qwen3.8-Max-0902 beschikbaar als een vastgezette revisie van 2 september 2026 voor dezelfde prijs

De lang-contextlijn verdient meer aandacht dan ze gewoonlijk krijgt. De toeslag van GPT-6 Sol is een stap die op het hele verzoek wordt toegepast, dus een agent-run van 900.000 tokens wordt gefactureerd tegen $4,00 en $15,00 per token. Qwen3.8-Max rekent één tarief voor het hele venster. Voor een workload die boven de 272.000 tokens ligt, zijn de twee tariefkaarten helemaal niet meer met elkaar te vergelijken — het model dat op het eerste gezicht goedkoper is, is met een ruime marge het duurste, en de richting van het verschil hangt volledig af van waar je context zich bevindt.

Screenshot of the Artificial Analysis model page for Qwen3.8 Max (0902), captured 23 September 2026, showing an Intelligence Index score of 45, list pricing of $2.00 per million input tokens and $6.00 per million output tokens, a cost of $5.41 per Intelligence Index task, 190 million output tokens generated during the index run, a 984,000-token context window and 39.2 output tokens per second.

De tariefkaart zegt 40% goedkoper. Het testharnas zegt vijf keer de factuur.

Artificial Analysis heeft Qwen3.8-Max-0902 gemeten op een Intelligence Index-score van 45, wat $5,41 per voltooide indextaak kostte, waarbij het model tijdens de run 190 miljoen outputtokens genereerde. De samenvatting ervan beschrijft het model als "opmerkelijk traag en zeer breedsprakig." GPT-6 Sol behaalde een score van 48 tegen $1,06 per taak, met 77 miljoen outputtokens.

Lees die drie paren samen en de vorm van de confrontatie wordt duidelijk. Qwen staat drie indexpunten achter, genereerde tweeënhalf keer zoveel tokens en kostte ongeveer vijf keer zoveel per voltooide taak — op een tariefkaart waarop de output 40% goedkoper is. Het mechanisme is niet subtiel. Bij $6,00 per miljoen outputtokens kost 190 miljoen tokens $1,14 per index-run, alleen al aan output, voordat de input wordt meegeteld; bij $10,00 per miljoen kost die 77 miljoen van Sol $0,77. Het lagere tarief koopt meer tokens, geen kleinere rekening.

Dit is hetzelfde patroon dat zich in het hele septemberveld voordoet, en het is de moeite waard om het als een regel te stellen in plaats van als een feit over deze twee modellen: op een tariefkaart per token is een korting van 40% op de output niets waard als het model tweeënhalf keer zoveel tokens uitstuurt. Kosten per voltooide taak is het enige cijfer dat standhoudt.

Wat Alibaba publiceerde, en het probleem met het instellen van de inspanning

Alibaba's eigen benchmarktabel is de langste in deze vergelijking en het minst vergelijkbaar. Door leveranciers gerapporteerde cijfers plaatsen Qwen3.8-Max voor op PaperBench en IFBench, maar achter op SWE-bench Pro en Humanity's Last Exam, met een schaal voor redeneerinspanning — laag, gemiddeld, extra hoog — die niet direct overeenkomt met OpenAI's schaal met zes niveaus. Een score die bij extra hoog is gepubliceerd, is niet hetzelfde product als een score die bij gemiddeld is gepubliceerd, en geen van beide leveranciers geeft aan welke van de twee een bepaald getal in een vergelijkingsgrafiek heeft opgeleverd.

Dat is de eerlijke reden om hier niet te vertrouwen op de tabel van welke leverancier dan ook. De cijfers van Alibaba zijn gedraaid op het testharnas van Alibaba met de effort-instelling van Alibaba; die van OpenAI op dat van OpenAI. De cijfers van Artificial Analysis bestaan juist omdat die beide onbruikbaar zijn voor een rechtstreekse vergelijking, en dat zijn de cijfers die hierboven zijn gebruikt.

Reproduceerbaarheid is een echte functie, en de prijs ervan is nul.

De gedateerde snapshot is de meest onderschatte regel in deze vergelijking. Qwen3.8-Max-0902 is een vastgepinde revisie van 2 september 2026 waarvan Alibaba zegt dat die dezelfde mogelijkheden en prijsstelling biedt als het basismodel. Door die vast te pinnen verandert het model achter je endpoint niet onder je tussen een dinsdag en een donderdag.

GPT-6 Sol kent geen equivalent. Het is één enkele rollende identifier — dezelfde modelpagina bevat een standaardsnapshot en geen gedateerde varianten — wat betekent dat wat je in september hebt gebenchmarkt, niet gegarandeerd hetzelfde is als wat je in november aanroept. Voor de meeste teams is dat prima. Voor een gereguleerde pijplijn die moet kunnen aantonen wat een output heeft geproduceerd, is dat een reëel verschil, en het is er een die Alibaba gratis weggeeft, terwijl OpenAI die helemaal niet aanbiedt.

De videolijn is degene die beslist

Alles hierboven is een vergelijking. Dit deel niet. Als je invoer video bevat — schermopnames, inspectiebeelden, college-opnames, alles waarbij de informatie in beweging is in plaats van in een stilstaand beeld — accepteert Qwen3.8-Max die native en heeft GPT-6 Sol er geen weg naartoe. Je kunt niet om een modaliteit heen prompten. Je kunt een video niet voorverwerken tot afbeeldingen en hetzelfde krijgen, want temporele informatie is juist het punt, en geen enkel aantal indexpunten op een tekstbenchmark vervangt de invoer die je taak daadwerkelijk vereist.

Het omgekeerde geval is ook het benoemen waard, want dat is het punt waarop de vergelijking niet langer scheef is. Als je invoer uit tekst en afbeeldingen bestaat, is Sol goedkoper per taak, vier punten voor op het neutrale scorebord en goedkoper bij gecachte reads. De videomogelijkheid is geen doorslaggevende factor in jouw voordeel; die wordt simpelweg niet gebruikt.

Een beslissing routeren die twee afzonderlijke antwoorden heeft

Screenshot of OrcaRouter's model page for Qwen3.8 Max (0902), captured 23 September 2026, showing the model id qwen/qwen3.8-max-0902 from provider Qwen, a 1M-token context window with a 131k-token maximum output, text, image and video input with text output, list pricing of $2.00 per million input tokens and $6.00 per million output tokens, and a p50 time to first token of 3.50 seconds.

Dit is een combinatie waarbij de juiste architectuur echt uit twee modellen bestaat, niet uit één, en de reden daarvoor is dat de splitsing op basis van inputmodaliteit plaatsvindt in plaats van op basis van moeilijkheidsgraad. Een pipeline die video binnenhaalt en over tekst redeneert, heeft beide nodig, en de routeringsregel is een eigenschap van het verzoek in plaats van een inschattingskwestie.

Qwen3.8-Max staat in de catalogus van OrcaRouter — de gedateerde qwen/qwen3.8-max-0902-snapshot is routeerbaar tegen Alibaba's lijstprijs onder het pass-through-model, wat betekent dat een tariefwijziging van Alibaba dezelfde dag aan onze kant live is in plaats van pas nadat een reseller opnieuw heeft onderhandeld. GPT-6 Sol staat op het moment van schrijven niet in onze catalogus en is bereikbaar via OpenAI's eigen API. De routing-DSL is precies het onderdeel dat bij dit specifieke geval past: een regel die verzoeken met video de ene kant op stuurt en al het overige de andere kant op, is precies waarvoor die bedoeld is, en automatische failover betekent dat de modaliteitsvertakking niet het enige storingspunt wordt.

Waar elk van hen wint

• Video in, tekst uit — Qwen3.8-Max, en er is geen concurrentie om te beschrijven.

Tekst en afbeelding als invoer, kosten per voltooide taak als maatstaf — GPT-6 Sol, met ongeveer een factor vijf op de onafhankelijke testomgeving.

• Werk met gecachte prefix — GPT-6 Sol. De gecachte leesbewerking is marginaal goedkoper en het tokenvolume is minder dan de helft.

• Verzoeken boven 272.000 inputtokens — Qwen3.8-Max. De herprijsstelling van hele verzoeken door Sol is het grootste kostenverschil in deze vergelijking, en het is onzichtbaar in de hoofdtarieven.

• Reproduceerbare pinning — Qwen3.8-Max-0902, die niets extra kost en de enige gepinde revisie van de twee is.

• Als je een grafiek te zien kreeg waarin Qwen voorloopt op SWE-bench Pro — controleer door wiens harness die is gemaakt en bij welke effort-instelling. De onafhankelijke ranglijst heeft Qwen drie punten achterstand op de samengestelde score, en de leverancierstabellen zijn niet op dezelfde schaal als elkaar.

Vergeleken in dit artikel3

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt