Hero-titelkaart voor Grok 4.5 vs GPT-6 Astra met de ondertitel 'Zes keer de stickerprijs, drie keer de rekening', statkaarten met de tekst 'Stickerprijs: $2,00 / $6,00 vs $10,00 / $50,00 per 1 mln.', 'Kosten per taak: $1,04 vs $3,26' en 'Eerste token: 10,94 s vs 342,30 s', een voettekst met de tekst 'Tariefkaarten van leveranciers en onafhankelijke cijfers, geraadpleegd op 23 september 2026', en het OrcaRouter-logo in de rechteronderhoek.
Guides & Insights

Grok 4.5 vs GPT-6 Astra: Zes keer de adviesprijs, drie keer de rekening

Auteur

Elias Hawthorne

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Zet Grok 4.5 en GPT-6 Astra naast elkaar op hun tariefkaarten en de kloof ziet er absurd uit: $2,00 tegen $10,00 per miljoen inputtokens, $6,00 tegen $50,00 per miljoen outputtokens. Haal dezelfde twee door de Intelligence Index van Artificial Analysis en de kloof wordt kleiner tot iets waarover een team echt kan discussiëren — $1,04 per voltooide taak tegen $3,26. De veelvoud op het prijskaartje is 5x op input en 8,3x op output. De veelvoud op de factuur, gemeten op werkelijke tokenaantallen, is iets meer dan 3x. En de dimensie waarin deze twee modellen het meest van elkaar verschillen, is geen van beide. Het is hoe lang je op de eerste token wacht, waar de onafhankelijke meting 10,94 seconden tegen 342,30 seconden bedraagt.

Dat is de hele krachtmeting in één alinea, en het is de reden waarom deze pagina in geen van beide richtingen een kroning is. GPT-6 Astra is het intelligentere model, met een duidelijke en reproduceerbare voorsprong. Grok 4.5 is de goedkopere, met een marge die reëel is maar aanzienlijk kleiner dan zijn prijslijst doet vermoeden. Al het andere — snelheid, token-efficiëntie, context, de programmeerbenchmarks — verdeelt zich, eindigt gelijk, of blijkt met twee verschillende meetlatten te zijn gemeten.

Geen van beide is een nieuw model.

Het is de moeite waard om ronduit te zeggen, want veel vergelijkingspagina's wekken de indruk dat beide er vorige week zijn aangekomen.

xAI bracht Grok 4.5 uit op 8 juli 2026. Het is gebouwd op de V9-basis met 1,5 biljoen parameters en samen met Cursor getraind op gegevens uit ontwikkelaarssessies in plaats van alleen statische code, wat de oorsprong is van zijn reputatie op het gebied van agentisch programmeren. Het heeft een contextvenster van 500.000 tokens. De eigen modellenlijst van de leverancier bevat het vandaag nog steeds, naast twee opvolgers — xAI heeft sindsdien Grok 4.6 en Grok 4.7 uitgebracht — dus beschouw Grok 4.5 als het $2/$6-niveau van de Grok-lijn in plaats van de top ervan.

OpenAI kondigde GPT-6 Astra aan op 3 september 2026, met een gefaseerde uitrol in de daaropvolgende dagen, en het blijft OpenAI's vlaggenschip: een contextvenster van 1M tokens (OrcaRouters catalogus vermeldt 1.050.000 invoer en 128.000 maximale uitvoer), een kennisafsluitdatum van 30 april 2026, en een duidelijke positionering op langdurig agentisch werk — computergebruik, onderzoek, wetenschappelijke en cybersecuritytaken. Volgens OpenAI zelf is het het eerste model dat de "Critical"-drempel voor cybersecurity overschrijdt, wat ook de reden is dat bedrijfstoegang standaard uitgeschakeld is totdat een beheerder deze inschakelt.

Beide zijn algemeen beschikbaar via de API's van hun leveranciers. Geen van beide wordt gelanceerd. Het enige dat deze week in beweging kwam, is de familie rond een van beide, en dat komt aan het einde van dit stuk, omdat het de aanbeveling verandert, niet de vergelijking.

De tariefkaarten, inclusief het niveau dat niemand noemt

• Invoer, korte context — Grok 4.5 $2,00 per 1M vs GPT-6 Astra $10,00 per 1M

Uitvoer, korte context — Grok 4.5 $6,00 per 1 mln. vs GPT-6 Astra $50,00 per 1 mln.

• Gecachte invoer — Grok 4.5 $0,30 per 1 miljoen vs. GPT-6 Astra $1,00 per 1 miljoen

• Invoer met lange context — Grok 4.5 $4,00 per 1 mln. vs. GPT-6 Astra $20,00 per 1 mln.

• Uitvoer met lange context — Grok 4.5 $12,00 per 1M vs GPT-6 Astra $75,00 per 1M

• Contextvenster — Grok 4.5 500.000 tokens vs. GPT-6 Astra 1.000.000 tokens

De clausule die ertoe doet, is degene die bijna geen enkele vergelijkingspagina vermeldt. Bij Grok 4.5 wordt, zodra de prompt van een verzoek 200.000 tokens bereikt, het hele verzoek opnieuw geprijsd tegen het hogere tarief — de documentatie van xAI is expliciet dat het "tegen het hogere tarief wordt gefactureerd voor alle tokens in het verzoek", niet alleen voor de tokens voorbij de grens. Het venster van 500.000 tokens is dus reëel, maar ruwweg de bovenste 60% ervan wordt tegen het dubbele tarief gefactureerd. De prijspagina van OpenAI voor Astra toont dezelfde tweekolomsstructuur met kort/lang, zonder te vermelden waar het omslagpunt ligt. Beschouw de kolom voor lange context dus als degene die van toepassing is zodra je op schaal werkt, en verifieer de grens aan de hand van je eigen factuur.

Screenshot of xAI's own documentation page for Grok 4.5 (docs.x.ai, model id grok-4.5) captured 23 September 2026, showing 'At a glance' with Modalities Text, Image to Text, a Context window of 500,000 and Pricing of $2.00 and $6.00, supported Capabilities of function calling, structured outputs and reasoning, and a Pricing block giving Input Tokens $2.00 / 1M tokens, Cached tokens $0.30 / 1M tokens and Output Tokens $6.00 / 1M tokens, above a 'Higher context pricing' control reading 'We charge different rates for requests which exceed the 200K context window'.

Twee multipliers op serviceniveau staan bovenop Astra's cijfers: Batch en Flex draaien tegen de helft van het standaardtarief, en Fast-modus tegen het dubbele — $20,00 input en $100,00 output bij korte context. Grok 4.5 heeft geen batch-tier op de sheet van xAI; de hefbomen zijn de cachekorting en priority processing tegen 2x.

Ons eigen standpunt in dit alles is bewust saai: OrcaRouter geeft de lijstprijs van de provider door met 0% opslag, dus beide tariefkaarten hierboven zijn bij ons live op dezelfde dag dat een van beide leveranciers ze wijzigt, en gecachede tokens worden in rekening gebracht tegen het cachetarief van de provider in plaats van de volledige prijs. Er is geen tweede getal om af te stemmen.

Wat een workload daadwerkelijk kost

Stickerprijzen zijn hier een slechte leidraad, omdat de twee modellen niet hetzelfde aantal tokens verbruiken om hetzelfde werk te doen. Neem een coding-agent-taak met een repositorycontext van 120.000 tokens en een antwoord van 25.000 tokens. Bij Grok 4.5 is dat $0,24 aan input en $0,15 aan output, dus $0,39. Bij GPT-6 Astra is dat $1,20 en $1,25, dus $2,45. Een verschil van 6,3x.

Duw de prompt nu voorbij de langecontextgrens: 300.000 tokens in, 20.000 uit. Grok 4.5 rekent $1,20 plus $0,24, ofwel $1,44. GPT-6 Astra rekent $6,00 plus $1,50, ofwel $7,50. Het verschil krimpt tot 5,2x, omdat beide leveranciers het inputtarief verdubbelen en Astra's outputveelvoud in de hoogste tariefcategorie kleiner wordt.

Geen van beide is wat Artificial Analysis meet, en hun cijfer is het nuttigere. Bij het volledige Intelligence Index bedragen de gemiddelde kosten per voltooide taak $1.04 voor Grok 4.5 bij hoge inspanning en $3.26 voor GPT-6 Astra bij maximale inspanning. De reden dat de factor daalt naar 3,1x terwijl de invoerprijs 5x uiteenloopt, is tokenefficiëntie: over de hele index genereerde Grok 4.5 77M uitvoertokens en Astra 60M. Astra is het beknoptere model, dus het dicht een deel van de kloof die het op prijs opende. Als je in een budgetdocument hebt gequote dat het "vijf keer goedkoper" is, is 3x het getal dat op de factuur komt te staan.

Snelheid is een gelijkspel. Latentie niet.

Dit is de bevinding die ons verraste, en ze druist in tegen de intuïtie dat het goedkope model het snelle is.

Artificial Analysis meet Grok 4.5 op 55 outputtokens per seconde en GPT-6 Astra op 58. Dat is een verschil van 5% bij dezelfde indexrevisie, en de eigen samenvatting van AA beschrijft beide als langzamer dan gemiddeld — de mediaan van de vergelijking is 74 tokens per seconde. Als doorvoer uw selectiecriterium is, vallen deze twee modellen niet te onderscheiden. Zeg het ronduit in plaats van een winnaar te fabriceren: op het ene snelheidscijfer dat voor beide op dezelfde manier is gemeten, staan ze gelijk.

Latentie drijft hen hevig uiteen. AA zet de tijd tot het eerste antwoordtoken van Grok 4.5 op 10,94 seconden, met 20,01 seconden end-to-end; GPT-6 Astra op 342,30 seconden, met 350,91 seconden end-to-end. Dat is ongeveer 31x, en bij een synchrone aanvraag is het het verschil tussen een spinner en een koffiepauze.

Twee eerlijke voorbehouden voordat iemand hierop budget baseert. Ten eerste zijn dat cijfers inclusief redeneertijd — de "time to first answer token" van AA telt bewust de denktijd van het model mee — dus ze beschrijven een moeilijke taak, niet een chatbeurt. Ten tweede zijn ze niet op gelijke effort afgestemd: de gepubliceerde vermelding van Astra is op max effort, die van Grok 4.5 op high, en een effort-instelling is precies de knop die dit getal verandert. De eigen vermelding van OrcaRouter voor GPT-6 Astra toont een p50-tijd tot eerste token van 8,31 seconden en een p95 van 10,00 seconden over live verkeer, wat een volledig ander meetpunt is — eerste token bij echte productieaanroepen, niet het eerste antwoordtoken bij een benchmarktaak. De twee zijn niet vergelijkbaar en mogen niet in dezelfde zin als vergelijking worden gezet.

Two-column comparison scoreboard for Grok 4.5 vs GPT-6 Astra. Grok 4.5 column: AA Index 39 (high), price per 1M $2.00 / $6.00, cached input $0.30, cost per task $1.04, speed 55 tok/s, first answer token 10.94s. GPT-6 Astra column: AA Index 53 (max), price per 1M $10.00 / $50.00, cached input $1.00, cost per task $3.26, speed 58 tok/s, first answer token 342.30s. Footer: 'Index, cost, speed and latency per Artificial Analysis, index v4.3.2, read 23 September 2026. Prices per the vendors' own rate cards.'

Coding benchmarks: controleer de versie voordat je ernaar verwijst.

Zoek deze matchup op en je zult Grok 4.5's 83,3% op Terminal-Bench 2.1 vinden tegenover GPT-6 Astra's 57,9% op Terminal-Bench 4.0. Dat zijn verschillende benchmarks die dezelfde naam dragen. Ze kunnen niet met elkaar vergeleken worden, en de vergelijkingspagina's die ze naast elkaar zetten, vertellen je niets.

De meeste van de gepubliceerde codeercijfers van beide leveranciers hebben dit probleem. xAI's sheet voor Grok 4.5 rapporteert SWE-bench Pro 64,7%, Terminal-Bench 2.1 83,3%, DeepSWE 1.0 62,0% en DeepSWE 1.1 53%. OpenAI's sheet voor Astra rapporteert Terminal-Bench 4.0 57,9%, OSWorld 2.0 72,6%, FrontierMath Tier 4 97,6% en ARC-AGI-3 99,9%. Allemaal door de leverancier gerapporteerd, en bijna geen enkele daarvan overlapt.

Er is één plek waar de twee elkaar echt ontmoeten op dezelfde harness: DeepSWE v1.1 van Datacurve, die elk model door dezelfde mini-swe-agent-scaffold laat lopen op 113 originele, contaminatievrije taken. Daar scoort GPT-6 Astra 74,1% tegen ongeveer $6,52 per taak, terwijl Grok 4.5 op 53% uitkomt. Dat is het schoonste afzonderlijke resultaat op deze pagina, en het pleit beslist in het voordeel van Astra. Nog één kanttekening specifiek voor Grok 4.5: het CursorBench-cijfer van xAI werd uitgesloten van openbare vergelijking nadat was gebleken dat een eerdere codebase in de training was gelekt, dus beschouw elk CursorBench-getal voor dit model als onbruikbaar.

Agentisch gedrag en het aanroepen van tools

De twee nemen verschillende routes naar dezelfde bestemming, en het verschil is architectonisch van aard, niet een kwestie van score.

De op ontwikkelaars gerichte functies van GPT-6 Astra gaan ervan uit dat je een orchestrator bouwt. Het ondersteunt asynchrone toolaanroepen, zodat wachten op een tool het model er niet van weerhoudt ander werk voort te zetten; bijsturing tijdens een taak via WebSockets, zodat een lopende run kan worden omgeleid zonder deze opnieuw te starten; en redeneerinspanning die tijdens een gesprek kan worden aangepast. In Codex voegt het een mechanisme voor contextbehoud toe dat notities over contextvensters heen bewaart, terwijl eerdere context doorzoekbaar blijft. De eigen systeemkaart van OpenAI vermeldt naar verluidt dat het model moeilijker te monitoren is dan zijn voorganger, wat een reden is om logs van toolaanroepen en systeemstatus — niet de vertelling van het model — als je auditbewijs te beschouwen.

Het agentische verhaal van Grok 4.5 gaat minder over nieuwe primitieven en meer over waar het is getraind. Het samen trainen met Cursor op echte sessies voor het bewerken en debuggen van meerdere bestanden is waaraan xAI de token-efficiëntie bij softwaretaken toeschrijft, en het is de reden waarom het model als standaard opduikt in codeeromgevingen in plaats van als een algemeen vlaggenschipmodel. Functieaanroepen, gestructureerde output, streaming en promptcaching worden allemaal ondersteund; toolaanroepen volgen de OpenAI-compatibele vorm, waardoor het in een bestaande client droppen een kwestie is van de base-URL wijzigen.

Er is geen gedeelde onafhankelijke agentische benchmark waarop beide bij een gelijkwaardige inspanning opduiken, dus we gaan hier geen winnaar verzinnen. Wat wel gezegd kan worden, is dat Astra's tool-calling-oppervlak van de twee het meest expressief is voor werk met een lange horizon, en dat de token-economie per taak van Grok 4.5 aantrekkelijker is voor werk met een hoog volume.

Kies Grok 4.5 als

• Je voert werk met grote volumes of hoge frequentie uit, waarbij de kosten per taak de beslissing domineren, en een 39 op de AA Intelligence Index je kwaliteitsdrempel haalt.

• Je prompts blijven onder 200.000 tokens. Daar is het prijsvoordeel van Grok 4.5 het grootst en wordt de herprijzing voor lange context nooit geactiveerd.

• Je wilt dat een cachediscount echt werk verricht. Bij $0,30 per miljoen gecachte invoertokens tegenover Astra's $1,00 worden workloads met herhaalde prefixen — lange systeemprompts, gedeelde repo-context — snel goedkoop.

• Je hebt een first-token-latentie van minder dan een minuut nodig bij moeilijke taken en kunt geen wachttijd van meerdere minuten verdragen.

Kies GPT-6 Astra als

• De taak is het product, en de rekening is een afrondingsfout vergeleken met een verkeerd antwoord. Veertien indexpunten aan dit uiteinde van de curve is een werkelijk verschil in capaciteit, geen marketingverschil.

• Je werkt echt voorbij 500.000 tokens. Het venster van Astra is ongeveer twee keer zo groot als dat van Grok 4.5, en het is het enige van de twee dat dat bereikt zonder een clausule voor prijsherziening.

• Je hebt computergebruik, diepgaand onderzoek of de cybersecurity-houding nodig — inclusief de bedrijfsinstellingen die standaard uitgeschakeld zijn en die bij OpenAI's Critical-drempel horen.

• Je schrijft orchestratorcode die asynchrone toolaanroepen en bijsturing tijdens de run wil, in plaats van een rechttoe-rechtaan request-responsaanroep.

Wat bewoog er deze week, en waarom het de aanbeveling verandert

Op 22 september 2026 bracht OpenAI GPT-6 Sol en GPT-6 Luna uit voor $2,00/$10,00 en $0,10/$0,50 per miljoen tokens, waarbij de tarieven als permanent en niet als promotioneel werden omschreven. Sol is het middensegmentmodel voor programmeren en analyse, tegen ongeveer een vijfde van de inputprijs van Astra.

Dat is van belang voor precies deze beslissing. Als de reden dat je Grok 4.5 afwoog tegen GPT-6 Astra de prijs was, dan is de eerlijke vergelijking aan de kant van OpenAI niet langer Astra — Astra is het vlaggenschip, en Sol bezet nu het segment waarin Grok 4.5 daadwerkelijk concurreert. Grok 4.5 onderbiedt Sol nog steeds op output ($6,00 tegen $10,00) en evenaart hem op input ($2,00 elk), dus het is niet verdrongen; maar een vergelijking die vóór deze week is geschreven, vergeleek een budgetmodel met een vlaggenschip en noemde de uitkomst een prijsverhaal.

Hetzelfde geldt aan de kant van xAI: de eigen modellenlijst van xAI bevat grok-4.6 en grok-4.7 naast grok-4.5, dus Grok 4.5 is één optie binnen een familie in plaats van het huidige topniveau.

Screenshot of the OrcaRouter model page for GPT-6 Astra, model id openai/gpt-6-astra, captured 23 September 2026, showing INPUT $10.00 and OUTPUT $50.00 per 1M tokens, a p50 time to first token of 8.31s and p95 of 10.00s over seven days, traffic of 300.7M tokens over seven days, a 1M-token context with 128K maximum output, an OpenAI-compatible base URL of https://api.orcarouter.ai/v1, the catalogue date 2026-09-04, and the English-language interface with the language switcher on EN.

Dat is het eigenlijke argument voor routering in plaats van kiezen. De tweemodelstack die steeds terugkomt in praktijkverslagen — het bulkwerk naar het goedkope model sturen, de moeilijke staart opschalen naar het dure — is een routeringsbeslissing, en je kunt die als configuratie uitdrukken in plaats van als een herschrijving. OrcaRouter zet beide modellen achter één API en één sleutel, met de lijstprijs van de provider doorgegeven tegen 0% opslag, automatische failover tussen providers, en een routerings-DSL waarmee je werk onder een drempel naar grok/grok-4.5 en schaal op naar openai/gpt-6-astra wanneer een taak mislukt of een groottelimiet overschrijdt. Je kunt het dure pad op een smalle strook verkeer uitproberen zonder er een productiepijplijn op te verwedden.

De korte versie

GPT-6 Astra is het betere model. Dat is niet eens dichtbij, en deze pagina zou waardeloos zijn als die deed alsof het anders was — 53 tegen 39 op dezelfde indexrevisie, 74,1% tegen 53% op de enige programmeerbenchmark die beide hebben afgelegd.

Grok 4.5 is het goedkopere model, maar met een factor 3,1 per voltooide taak in plaats van de 5x tot 8,3x die zijn prijslijst doet vermoeden, omdat Astra minder tokens besteedt om daar te komen. En op het enige snelheidscijfer dat voor beide identiek is gemeten, staan ze gelijk.

De beslissing is niet welk model wint. Het is of een gat van 14 punten in de index ruwweg drie keer de rekening waard is voor jouw specifieke workload — en of het antwoord hetzelfde is voor elk verzoek dat je verstuurt.

Vergeleken in dit artikel2

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt