Een gegenereerde hero-kaart voor een vergelijking tussen GPT-6.1 Sol en GLM-5.3, met als kop 'Zeven indexpunten, 2,8 keer het geld', met badges met de tekst 'GPT-6.1 Sol: $0,72 per indextaak', 'GLM-5.3: $2,01 per indextaak' en 'GLM-5.3-gewichten: downloadbaar sinds 25 augustus 2026', een voettekst met de tekst 'Onafhankelijke cijfers volgens Artificial Analysis v4.3.2, maximale inspanning; AI-gegenereerde kaart', en het OrcaRouter-logo in de rechteronderhoek.
Guides & Insights

GPT-6.1 Sol vs GLM-5.3: de gewichten zijn uitgeleverd, maar de rekening bleef gelijk

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Open​AI lanceerde GPT-6.1 Sol op 29 september 2026 tijdens zijn DevDay-keynote, en Z.ai lanceerde GLM-5.3 zes weken eerder, op 18 augustus 2026, en hield de checkpoint een week achter. Dat achterhouden is voorbij: zai-org/GLM-5.3 staat sinds 25 augustus op Hugging Face, een BF16/FP8-checkpoint met ruwweg 753 miljard parameters, waarvan er ongeveer 40 miljard actief zijn per token, en het heeft sindsdien de grens van 1,4 miljoen downloads overschreden. De vraag die de meeste vergelijkingen sinds augustus stellen — is dit een open model of een huurmodel? — heeft dus een antwoord, en het antwoord veranderde de rekensom niet. Op het onafhankelijke scorebord scoort GPT-6.1 Sol 51,8 en kost $0,72 per voltooide indextaak; GLM-5.3 scoort 44,8 en kost $2,01. Je kunt nu het per token goedkopere model bezitten en toch bijna drie keer meer betalen per voltooide taak.

Wat elk model daadwerkelijk is

GPT-6.1 Sol is het GPT-6-model van Open​AI in het middensegment, één trede onder het vlaggenschip GPT-6 Astra en boven het budgetmodel GPT-6 Luna. Het heeft een contextvenster van 1.050.000 tokens met een uitvoerplafond van 128.000 tokens en een kennisafsluitdatum van 30 april 2026, en het accepteert tekst, afbeeldingen en bestanden als invoer. Redenering loopt van low tot max met een standaardwaarde van medium; de waarden none en minimal die GPT-6 Sol accepteerde, geven nu een foutmelding, wat Open​AI's eigen migratieadvies oplost door ontwikkelaars te vertellen om low te gebruiken. Het kost $2,00 per miljoen invoertokens en $10,00 per miljoen uitvoertokens, met gecachte invoer tegen $0,10.

GLM-5.3 is het huidige vlaggenschip van Z.ai voor software-engineering en agentisch werk met een lange horizon, gebouwd op dezelfde mixture-of-experts-basis als GLM-5.2, waarbij de winst uit post-training komt en niet uit een groter model. Het is tekst-in, tekst-uit — geen vision, tegen welke prijs dan ook — met een venster van 1M tokens, een uitvoerlimiet van 128.000 tokens en de denkmodus permanent aan. Er is geen niet-redeneermodus, wat een harde beperking is voor een latentiegevoelige aanroep. Z.ai vermeldt het tegen $1,40 voor invoer en $4,40 voor uitvoer per miljoen tokens, met gecachte invoer tegen $0,26; onze eigen catalogus biedt het aan voor $1,26 en $3,96 met een cacheread van $0,234, dus de leverancierskaart is het conservatievere getal en het getal om vanuit te argumenteren.

De tariefkaart, en de regel die hem omkeert.

Eén regel per dimensie, beide zijden op elk:

• Invoer — GPT-6.1 Sol $2,00 per 1 mln vs GLM-5.3 $1,40 per 1 mln; GLM is 30% goedkoper
• Uitvoer — GPT-6.1 Sol $10,00 per 1 mln vs GLM-5.3 $4,40 per 1 mln; GLM is 56% goedkoper
• Gecachte invoer — GPT-6.1 Sol $0,10 per 1 mln vs GLM-5.3 $0,26 per 1 mln; de volgorde keert om, Sol is 2,6× goedkoper
• Clausule voor lange context — GPT-6.1 Sol herprijst het hele verzoek boven 272.000 invoertokens tegen 2× de invoer en cache en 1,5× de uitvoer vs GLM-5.3 geen gelijkwaardige clausule op de gepubliceerde kaart
• Context en uitvoer — 1.050.000 in / 128.000 uit vs 1 mln in / 128.000 uit; een verschil van 5%, niet materieel
• Modaliteit — tekst, afbeelding en bestand in, tekst uit vs alleen tekst
• Redeneerondergrens — GPT-6.1 Sol laag, gemiddeld (standaard), hoog, xhoog, max vs GLM-5.3 altijd aan, geen ondergrens om naar te zakken
• Gewichten — gesloten, alleen API vs open, downloadbaar, FP8
• Onafhankelijke score, Artificial Analysis v4.3.2 bij maximale inspanning — 51,8 vs 44,8
• Onafhankelijke kosten per indextaak — $0,72 vs $2,01
• Uitvoertokens voor de indexrun — 67 miljoen vs 210 miljoen

<img src="2.png" alt="Een gegenereerd scorebord met twee kolommen, getiteld 'GPT-6.1 Sol vs GLM-5.3 - het scorebord'. Linkerkolom 'GPT-6.1 Sol': rijen met 'Intelligence Index: 51.8', 'Kosten per indextaak: $0.72', 'Inputprijs: $2.00 per 1M', 'Outputprijs: $10.00 per 1M', 'Outputtokens bij indexrun: 67M', 'Gewichten: gesloten'. Rechterkolom 'GLM-5.3': rijen met 'Intelligence Index: 44.8', 'Kosten per indextaak: $2.01', 'Inputprijs: $1.40 per 1M', 'Outputprijs: $4.40 per 1M', 'Outputtokens bij indexrun: 210M', 'Gewichten: open op Hugging Face'. Een voettekst luidt: 'Onafhankelijke cijfers volgens Artificial Analysis v4.3.2 bij maximale inspanning; leverancierslijstprijzen.' Het OrcaRouter-logo staat in de rechteronderhoek." /> Dat laatste paar is bepalend voor deze confrontatie, en het is geen subtiel effect.

A generated two-column comparison scoreboard titled 'GPT-6.1 Sol vs GLM-5.3 - the scoreboard'. Left column 'GPT-6.1 Sol': rows reading 'Intelligence Index: 51.8', 'Cost per index task: $0.72', 'Input price: $2.00 per 1M', 'Output price: $10.00 per 1M', 'Output tokens on index run: 67M', 'Weights: closed'. Right column 'GLM-5.3': rows reading 'Intelligence Index: 44.8', 'Cost per index task: $2.01', 'Input price: $1.40 per 1M', 'Output price: $4.40 per 1M', 'Output tokens on index run: 210M', 'Weights: open on Hugging Face'. A footer reads 'Independent figures per Artificial Analysis v4.3.2 at max effort; vendor list prices.' The OrcaRouter logo sits in the bottom-right corner.

Het probleem van 210 miljoen tokens

Artificial Analysis voert dezelfde suite van tien evaluaties uit tegen elk model op het scorebord en publiceert de tokenaantallen achter elke score. GLM-5.3 genereerde ongeveer 210 miljoen outputtokens tijdens het voltooien van de run. GPT-6.1 Sol genereerde 67 miljoen. Afgezet tegen de eigen vergelijkingsklasse van elk model op het scorebord, ligt de 210 miljoen van GLM-5.3 boven een klassemediaan van ongeveer 140 miljoen, terwijl de 67 miljoen van Sol ruim onder de mediaan van ongeveer 81 miljoen van de flagshipklasse ligt waarin het wordt gescoord. Aangezien output de dure kant van elke tariefkaart is, overleeft de opvallende korting van 56% van GLM-5.3 op de outputregel het contact met de meting niet: het genereert 3,1× zoveel tokens tegen 0,44× de prijs, en 3,1 × 0,44 is 1,37 — GLM-5.3 is het duurdere model voor deze workload, ondanks een aanzienlijk goedkopere tariefkaart.

Het eigen kosten-per-taakcijfer van het bestuur bevestigt de richting en de ruwe omvang. $2,01 tegenover $0,72 is 2,8×, groter dan de tokenratio alleen doet vermoeden, omdat GLM-5.3 per taak ook meer betaalt op de input- en cachelijnen. Het loont om precies te zijn over wat dit wel en niet bewijst: de index-run bestaat uit tien vaste evaluaties, en de uitvoerigheid daarop is niet hetzelfde als de uitvoerigheid in uw verkeer. Maar voor een koper zijn tokens wat wordt gefactureerd, en de vorm van het verschil is hetzelfde in elke taakset waar het model een lang antwoord moet produceren.

De gedeeltelijke compensatie. De cache-read van GLM-5.3 is $0,26 tegen een basis van $1,40, en die van GPT-6.1 Sol is $0,10 tegen een basis van $2,00 — Sol wint met een factor 2,6 op een tarief dat elke workload met een stabiele prefix domineert. Als je verkeer een groot vast corpus is met een antwoord van één alinea, is GLM-5.3 zonder meer de goedkopere optie en moet je die nemen. Als je verkeer lijkt op het verkeer waarvoor beide modellen zijn gebouwd — agent-loops, bewerkingen op repo-schaal, lange gegenereerde outputs — dan verbleekt het voordeel van gecachte input tot ruis naast een tokenratio van 3×.

Waar de leveranciersnummers terechtkomen

De lanceringscijfers van Z.ai zijn sterk en, zoals altijd, niet gereproduceerd. Terminal-Bench 2.1 op 88,2, DeepSWE v1.1 op 66,9, CyberGym op 84,5, ExploitBench op 54,4, AutomationBench op 48,2, GDPval-AA v2 op 1769 Elo. Het enige cijfer dat de moeite waard is om twee keer te lezen, is Terminal-Bench 3.0 op 28,3 — de opvolgende benchmark, en de correctie op de 88,2 op de oudere benchmark. Een model kan uitblinken op de benchmark waarop zijn posttraining was gericht, en middelmatig zijn op de volgende generatie van dezelfde benchmark.

De lanceringscijfers van OpenAI voor GPT-6.1 Sol zijn volledig opgebouwd rond de kosten per voltooide taak in plaats van rond de ruwe score: DeepSWE v1.1 verslaat het beste resultaat van GPT-6 Sol met 6,4 procentpunt bij een lagere redeneerinspanning, AutomationBench 1.0.6 op 2,2 punten boven Claude Opus 5.5 bij gemiddelde inspanning, OSWorld 2.0 zeven punten hoger dan GPT-6 Sol bij maximale inspanning, en Terminal-Bench Science 0.1 meer dan een verdubbeling van GPT-6 Sol tegen minder dan de helft van de kosten per taak. Merk op dat dit OpenAI's testopstelling betreft, met OpenAI's instellingen op OpenAI's geselecteerde benchmarkset, en dat geen van deze onafhankelijk is gereproduceerd.

De overlap tussen de gepubliceerde sets van de twee leveranciers is klein, en de enige beschikbare directe vergelijking gaat over dezelfde benchmark: Z.ai rapporteert 66,9 op DeepSWE v1.1, OpenAI rapporteert 68,8 voor GPT-6 Sol — het model dat 6.1 vervangt — en een verbetering van 6,4 punt voor 6.1 Sol ten opzichte van zijn eigen voorganger. Twee punten uit elkaar in de door de leverancier gerapporteerde vergelijking, en ongeveer zes uit elkaar op de eigen delta van OpenAI. Dat komt dicht bij een gecontroleerde vergelijking, en het zegt wat de onafhankelijke commissie zegt: nagenoeg gelijkwaardig qua capaciteiten, een groot verschil in wat het afmaken van de klus kost.

Eén API, of twee contracten

Beide modellen staan op OrcaRouter, wat het ongebruikelijke deel van deze combinatie is. GPT-6.1 Sol verscheen op de releasedag in de catalogus tegen Open​AI's eigen lijstprijs — $2,00 en $10,00 per miljoen tokens, gecachte invoer $0,10, met de stap bij 272.000 tokens naar $4,00 en $15,00 exact doorgegeven zoals de leverancier die vermeldt — en GLM-5.3 staat ernaast voor $1,26 en $3,96 met een cache-read van $0,234. Bij geen van beide komt er iets bovenop: het platform geeft de lijstprijs van de provider ongewijzigd door, waardoor een prijsverlaging van een leverancier bij ons dezelfde dag zichtbaar wordt in plaats van pas nadat een reseller opnieuw heeft onderhandeld.

A screenshot of the OrcaRouter model page for z-ai/glm-5.3, showing the listing dated 2026-08-18, the model described as Z.ai (Zhipu AI)'s latest flagship for complex software engineering and long-horizon agentic tasks, a 1M-token context with 128K maximum output, text in and text out, and the pass-through list price of $1.26 input and $3.96 output per million tokens, with the page's own pricing tabs and a 4.00 s median time to first token visible.

Dat is voor dit specifieke paar belangrijker dan voor de meeste. De beslissing tussen hen is niet "welke is beter" — het is een drempel op je eigen outputlengte, en die verschuift de eerste keer dat Z.ai zijn tariefkaart aanscherpt of OpenAI de tiergrens van de 6.1-tier wijzigt. Beide achter één sleutel houden, met automatische failover ertussen en een routeringsregel die je in configuratie wijzigt in plaats van in een deployment, is wat je in staat stelt die drempel op echt verkeer te testen in plaats van erover te discussiëren. Als Sols cachelijn je workload wint, routeer daarop; als je antwoordlengtes kort blijven en de vlakke kaart van GLM-5.3 zonder contextklif het segment wint, routeer dan daarop in plaats daarvan — dezelfde sleutel, geen tweede contract, geen tweede rekening.

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing the listing dated 2026-09-29, a 1M-token context with 128K maximum output, text, image and file input, a reasoning effort ladder running from low to max, and the pass-through list price of $2.00 input and $10.00 output per million tokens with cached input at $0.10.

Welke, als je vandaag moet kiezen?

• Lange gegenereerde outputs, agentische loops, output-intensief werk — GPT-6.1 Sol, en de marge is bijna een factor drie zodra de tokenaantallen worden meegerekend. Dit is waar de tariefkaart liegt en de meting niet.
• Stabiele prefix, kort antwoord — GLM-5.3. De tarieven voor gecachte invoer en voor invoer zijn werkelijk beter en de breedsprakigheid krijgt nooit de kans om toe te slaan.
• Elk verzoek boven 272.000 invoertokens — GLM-5.3, omdat GPT-6.1 Sol het hele verzoek bij die grens opnieuw prijst en de tariefkaart van GLM-5.3 geen gelijkwaardige stap kent.
• Alles met een afbeelding of een document als visuele invoer — GPT-6.1 Sol. GLM-5.3 is alleen voor tekst en dit is niet eens dichtbij.
• Inferentie binnen je eigen grens, of een hedge tegen veranderende voorwaarden van een leverancier — GLM-5.3, en nu bestaat de download in plaats van slechts beloofd te zijn. Reserveer budget voor de hardware: het checkpoint is een groot FP8-artefact en self-hosting is een kapitaalbeslissing, geen API-beslissing.
• Latentiegevoelige aanroepen — geen van beide zonder voorzichtigheid. GLM-5.3 heeft geen manier om redeneren uit te schakelen; GPT-6.1 Sol heeft een ondergrens op laag, en zijn eigen time-to-first-token op het onafhankelijke leaderboard bedroeg 332 seconden tegen een leaderboardmediaan van 3,7.

Vergeleken in dit artikel3

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt