
GPT-6 Luna vs Grok 4.6: Het prijsverschil is twintig keer zo groot en het venster is het echte verschil
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Zet GPT-6 Luna en Grok 4.6 op dezelfde pagina en de eerste vergelijking schrijft zichzelf. Luna heeft een prijs van $0,10 per miljoen inputtokens en $0,50 per miljoen output. Grok 4.6 heeft een prijs van $2,00 en $6,00 met een gecachte read van $0,50. Twintig keer op input, twaalf keer op output, en een tarief voor gecachte input dat vijftig keer hoger is bij het model van de leverancier. Dat is de stickerprijs, en op basis van de sticker is het antwoord niet eens in de buurt.
De reden dat het de moeite waard is om de rest van dit stuk te schrijven, is dat de twee modellen het over iets structurelers oneens zijn dan de prijs. Grok 4.6 heeft een contextvenster van 500.000 tokens en herprijst het hele verzoek zodra de prompt 200.000 tokens overschrijdt. GPT-6 Luna heeft 1.050.000 tokens en herprijst bij 272.000. Beide drempels zijn kliffen in plaats van marginale tarieven — steek je er een over, dan wordt het hele verzoek tegen het hogere tarief gefactureerd, niet alleen het deel boven de streep. Waar die twee kliffen liggen, en wat er gebeurt met een long-context-werklast aan de verkeerde kant van elk, bepaalt meer van deze vergelijking dan de twintigvoudige kop.
Twee modellen, twee heel verschillende houdingen
Grok 4.6 is het model van xAI van 12 augustus 2026, en het is een frontier-release voor algemene doeleinden: tekst in, tekst uit, een contextvenster van 500.000 tokens, een gepubliceerde kostprijs per taak van $1,86 op het onafhankelijke board bij hoge inspanning, en een gemeten snelheid van 57,7 outputtokens per seconde. Het is het soort model dat een team in gebruik neemt omdat het goed is in veel dingen en de leverancier snel nieuwe releases uitbrengt.
GPT-6 Luna is de tegenovergestelde houding. OpenAI bracht het op 22 september 2026 uit als het volumetier van de GPT-6-familie, onder GPT-6 Sol van $2,00/$10,00 en het vlaggenschip GPT-6 Astra van $10,00/$50,00. Tekst en afbeelding in, tekst uit, een venster van 1.050.000 tokens met een maximale invoer van 922.000 tokens, een uitvoerlimiet van 128.000 tokens, en een redeneerladder van none via low, medium, high, xhigh en max, met medium als standaard. Het is geen model dat iemand kiest vanwege zijn breedte. Het is een model dat je onder een workload zet.
Dus de eerlijke manier om het te stellen is niet "welke van deze is beter". Het is "welke van deze is geprijsd voor de vorm van werk die jij hebt", en die twee vormen zijn wezenlijk verschillend.
De kaarten, regel voor regel
Eén regel per dimensie, beide zijden op elk:
• Invoer per 1 mln. — GPT-6 Luna $0,10 vs Grok 4.6 $2,00
• Output per 1 mln — GPT-6 Luna $ 0,50 vs Grok 4.6 $ 6,00
• Gecachte invoer per 1M — GPT-6 Luna $0,01 vs Grok 4.6 $0,50, een tiende van zijn eigen invoertarief tegenover een kwart van dat van xAI
• Drempelwaarde voor lange context — GPT-6 Luna 272.000 invoertokens vs Grok 4.6 200.000 prompttokens
• Lange-contexttarieven — GPT-6 Luna herprijst het hele verzoek naar $0,20 in, $0,75 uit, $0,02 in cache, tegenover Grok 4.6 die het hele verzoek herprijst naar $4,00 in, $12,00 uit, $1,00 in cache
• Contextvenster — GPT-6 Luna 1.050.000 tokens vs Grok 4.6 500.000 tokens
• Maximale output — GPT-6 Luna 128.000 tokens vs Grok 4.6 niet gepubliceerd als een afzonderlijk plafond op de kaart
• Intelligence Index, onafhankelijk — GPT-6 Luna 37 bij maximale inspanning vs Grok 4.6 44 bij hoge inspanning op indexrevisie v4.3.2
• Score bij standaardinspanning — GPT-6 Luna 29 bij zijn standaard medium versus Grok 4.6 43 bij medium, waar de ranglijst dit ook meet
• Kosten per Index-taak, onafhankelijk — GPT-6 Luna ongeveer $0,07 versus Grok 4.6 $1,86 bij hoge inspanning
• Uitvoertokens tijdens de index-run — GPT-6 Luna 150M vs Grok 4.6 94M, tegen een leaderboard-mediaan van 88M
• Uitvoersnelheid, onafhankelijk — GPT-6 Luna 153,9 tokens/sec vs Grok 4.6 57,7 tokens/sec op hoog
• Tijd tot eerste token, onafhankelijk — Grok 4.6 38,63s, end-to-end 47,31s; GPT-6 Luna retourneert een eerste token in een tijd die een gebruiker toestaat te wachten
• Cybercapaciteit, onafhankelijk — Grok 4.6 scoort 57 op de cyberevaluatie van het bestuur; er is geen vergelijkbaar cijfer voor GPT-6 Luna gepubliceerd.
• Op OrcaRouter — GPT-6 Luna niet in onze catalogus vs Grok 4.6 routeerbaar tegen xAI's lijstprijs

200.000 tegen 272.000 is het hele argument
Lees de twee drempels naast de twee vensters en de vergelijking herschikt zichzelf.
De klif van Grok 4.6 ligt op 200.000 tokens binnen een venster van 500.000 tokens — op 40% van het venster. Die van GPT-6 Luna ligt op 272.000 binnen 1.050.000 — op 26% van het venster. Dus niet alleen begint het goedkopere model later met het aanpassen van de prijs, het heeft ook meer dan twee keer zoveel ruimte na de drempel voordat het überhaupt het einde van zijn venster bereikt.
Concreet: een verzoek van 450.000 tokens past binnen beide modellen. Op GPT-6 Luna wordt het gefactureerd tegen het long-contexttarief van $0,20 en $0,75. Op Grok 4.6 wordt het gefactureerd tegen $4,00 en $12,00. Dat is twintig keer op input en zestien keer op output voor dezelfde prompt — en het is een verzoek dat Grok 4.6 kan verwerken, dus de keuze is reëel en niet theoretisch.
Het omgekeerde geval is het geval dat mensen verrast. Een verzoek van 190.000 tokens ligt onder beide drempels en wordt bij beide tegen de standaardtarieven gefactureerd: $0,10/$0,50 tegenover $2,00/$6,00, een zuivere twintig- en twaalfvoudige verhouding. Een verzoek van 210.000 tokens ligt boven de grens van Grok 4.6 en onder die van GPT-6 Luna. Het wordt op Grok 4.6 gefactureerd tegen $4,00/$12,00 en op Luna tegen $0,10/$0,50 — een veertigvoudige en vierentwintigvoudige kloof die volledig wordt veroorzaakt door een verschil van 20.000 tokens in promptlengte, zonder dat een van beide modellen is veranderd.
Dat is geen reden om Grok 4.6 te vermijden. Het is een reden om te weten waar je prompts daadwerkelijk terechtkomen, want een workload die gemiddeld 180.000 tokens gebruikt en piekt naar 220.000, betaalt twee verschillende tariefkaarten en zal de eerste maand dat dit gebeurt op een factureringsfout lijken.
Wat het prijsverschil oplevert in de onafhankelijke raad van bestuur.
Grok 4.6 scoort 44 op de Artificial Analysis Intelligence Index bij hoge inspanning. GPT-6 Luna scoort 37 bij maximale inspanning. Zeven punten, op een samengestelde maatstaf waar één enkel punt binnen de ruis van een nieuwe run valt — en de twee modellen verschillen ruwweg een factor zesentwintig in kosten per voltooide taak, $1,86 tegen ongeveer $0,07.
Twee dingen aan dat paar getallen verdienen het om te worden onderscheiden.
De eerste is het standaard inspanningsniveau. De 37 van GPT-6 Luna is een cijfer bij maximale inspanning en de standaard is medium, waar hij 29 scoort. De 44 van Grok 4.6 is een cijfer bij hoge inspanning, en de ranglijst meet hem ook bij medium, waar hij 43 scoort. De like-for-like-vergelijking bij de standaardinstellingen is dus 29 tegen 43 — veertien punten, niet zeven, en het is de versie met veertien punten die een team dat beide uitrolt en niets verandert daadwerkelijk zal ervaren. Grok 4.6 verliest één punt van hoog naar medium. GPT-6 Luna verliest er acht. De inspanningsregelaar kost het goedkope model veel meer dan het dure, en die asymmetrie is onzichtbaar in de kopcijfers van de index.
Het tweede is breedsprakigheid, en hier is de richting tegengesteld aan wat de prijsverhouding suggereert. GPT-6 Luna genereerde 150 miljoen outputtokens voor het voltooien van de index; Grok 4.6 genereerde 94 miljoen. Het model dat per outputtoken een twaalfde kostte, verbruikte 60% meer tokens om tot een lagere score te komen. Op een op output geprijsde kaart is dat het verschil tussen een zesentwintigvoudige kosten-per-taak-kloof en een kleinere, en het is de reden waarom elke vergelijking die alleen op stickerprijzen is gebaseerd, de zaak voor het goedkope segment zal overdrijven.
Grok 4.6 publiceert op dezelfde ranglijst ook een cybercapaciteitsscore van 57. Er is geen vergelijkbaar cijfer voor GPT-6 Luna, dus die dimensie heeft maar één kant — maar het is wel het soort gegeven dat ertoe doet als je workload met beveiligingstools te maken heeft, en het ontbreken ervan bij het goedkopere model is informatie, geen hiaat dat met aannames moet worden opgevuld.
Latentie, waarbij de twee niet dicht bij elkaar liggen en niet in dezelfde richting
De onafhankelijke latentiecijfers voor Grok 4.6 zijn 38,63 seconden tot het eerste token en 47,31 seconden end-to-end bij hoge inspanning. Dat is een cijfer voor een model dat serieus redeneert voordat het spreekt, en het is niet verenigbaar met iemand die naar een cursor kijkt. Onze eigen vermelding voor het model registreert een p50-tijd tot het eerste token van 6,71 seconden en een p95 van 10,00 seconden over een venster van zeven dagen, wat een ander punt in de respons meet en niet vergelijkbaar is met het onafhankelijke cijfer — de twee cijfers spreken elkaar niet tegen, ze beantwoorden verschillende vragen.
GPT-6 Luna draait op 153,9 outputtokens per seconde en levert zijn eerste token snel genoeg om achter een interactief oppervlak te zitten. Bij hoge inspanning is het bijna drie keer de doorvoer van Grok 4.6. Voor een batchtaak is dat verschil een kwestie van wall-clockgemak. Voor alles waar een gebruiker op wacht, is het het verschil tussen een product en een prototype.
De combinatie is ongebruikelijk en verdient het om ronduit benoemd te worden: het goedkope model is het snelle, het dure model is het langzame, en het dure model staat zeven punten voor op de samengestelde score bij gelijke inspanning. Dat is het profiel van een model dat is gebouwd om één keer diep na te denken, en een model dat is gebouwd om heel vaak snel te antwoorden. Als je werklast één aanroep per taak is, is de latentie van Grok 4.6 betaalbaar. Als het duizend aanroepen per taak is, is dat niet het geval.
Wat je aan de xAI-kant eigenlijk koopt
Grok 4.6 kost ongeveer zesentwintig keer zoveel per voltooide taak als GPT-6 Luna en staat zeven indexpunten voor bij gelijke inspanning. Dat is een slechte wisselkoers voor een algemene werkbelasting, en een redelijke voor een specifieke categorie werk.
Drie dingen rechtvaardigen het. De cyberscore van 57 is een capaciteit waarvoor GPT-6 Luna geen tegenhanger publiceert. De index-run van 94 miljoen tokens tegenover Luna's 150 miljoen is een echt beknoptheidsvoordeel bij elke taak waarbij de output door een mens wordt geconsumeerd in plaats van door een parser. En het model is sinds 12 augustus in productie, zes weken langer dan GPT-6 Luna überhaupt bestaat — wat geen benchmark is, maar wel een trackrecord, en voor een team dat er al tegen heeft gebouwd, maken de migratiekosten van vertrek deel uit van de prijs van vertrek.
Daartegenover staat dat het bij GPT-6 Luna niet in de eerste plaats om het twintigvoudige tarief gaat. Het gaat om de drempel van 272.000 tokens binnen een venster van een miljoen tokens, de mogelijkheid om te worden opgedragen helemaal te stoppen met redeneren, een tarief voor gecachte invoer van één cent per miljoen, en een doorvoercijfer dat het bruikbaar maakt als component in plaats van als eindpunt. Dat zijn structurele eigenschappen van de goedkope laag, en geen enkel indexvoordeel aan de andere kant vervangt ze.
Een van beide uitvoeren, of allebei
Grok 4.6 staat op OrcaRouter tegen xAI's lijstprijs, onder pass-through-prijzen waarbij een wijziging van het leverancierstarief dezelfde dag nog aan onze kant wordt doorgevoerd in plaats van te wachten tot een reseller opnieuw onderhandelt. Automatische failover is het onderdeel dat zijn plaats specifiek voor dit model verdient: een venster van 500.000 tokens met een klif van 200.000 tokens is een workload waarbij een verzoek af en toe aan de verkeerde kant van de lijn belandt, en een route die zonder deployment tussen upstreams wisselt, is meer waard dan een fractie van een cent per token.
GPT-6 Luna staat op het moment van schrijven niet in onze catalogus en is alleen bereikbaar via OpenAI's eigen API. Een team dat beide wil, gebruikt dus één key voor Grok 4.6 naast wat het al voor OpenAI gebruikt. De routerings-DSL is het onderdeel dat bij deze combinatie past: een regel die prompts boven een token-drempel naar het model stuurt waarvan ze de prijskloof overschrijden, en alles daaronder naar het model dat een twaalfde van de prijs kost, is uit te drukken als configuratie in plaats van als een vertakking in je applicatie — wat ertoe doet wanneer de drempels zo dicht bij gangbare promptgroottes liggen als deze twee.

Welke, en wanneer?
Kies GPT-6 Luna als je workload een hoog volume heeft, door programma's wordt verbruikt en kort is. Classificatie, extractie, routering, bulk-samenvatting, de inner loop van een agent. Bij $0,10/$0,50 met een gecachte read van één cent, tegenover een model dat bij gelijke inspanning zesentwintig keer zo duur is per voltooide taak voor zeven indexpunten, liggen de cijfers niet dicht bij elkaar. Stel de effort-parameter expliciet in — de standaard is medium en het kopcijfer 37 is een max-effort-getal — en houd je lange calls onder 272.000 tokens.
Kies Grok 4.6 als je de cybercapaciteit nodig hebt, als je output door een mens wordt gelezen en de beknoptheid ervan het betalen waard is, of als je een werklast van 300.000 tot 500.000 tokens hebt die GPT-6 Luna kan bedienen, maar waarbij je liever niet het eerste team bent dat ontdekt hoe het zich op die lengte gedraagt. Houd expliciet rekening met de klif bij 200.000 tokens, en zet het niet achter een interactief oppervlak bij hoge inspanning — 38 seconden tot het eerste token is geen latencycijfer, het is een uitspraak over waar het model voor dient.
De fout waartoe deze vergelijking uitnodigt, is dat je de twintigvoudige verhouding als de beslissing beschouwt. Voor de ene workloadvorm is die de beslissing. Voor de andere wordt de beslissing genomen bij 200.000 en 272.000 tokens, en de prijsverhouding is een detail dat je achteraf leest.

Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
