
GPT-6 Sol en GPT-6 Luna: Een goedkoper token is niet altijd een goedkopere taak
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
De leverancier bracht GPT-6 Sol en GPT-6 Luna uit op 22 september 2026, en de kop die overal boven staat is de prijs: Sol voor $2,00 per miljoen inputtokens en $10,00 output, Luna voor $0,10 en $0,50, beide ongeveer de helft van wat GPT-5.6 Sol en GPT-5.6 Luna rekenen onder de huidige promotietarieven, en beide ruim onder het vlaggenschip GPT-6 Astra op $10,00/$50,00. De aankondiging van de leverancier zelf begint met "we hebben caching en inferentie ook efficiënter gemaakt." Het probleem met het lezen daarvan als een kortingsverhaal is dat de eenheid die daadwerkelijk op je factuur terechtkomt geen token is. Het is een taak. En de eerste onafhankelijke metingen, dezelfde dag gepubliceerd, laten zien dat de twee nieuwe modellen precies op die eenheid in tegengestelde richtingen afdrijven — waarbij GPT-6 Luna, de goedkoopste van de twee met een factor twintig op input, het van de twee het slechtst doet ten opzichte van zijn eigen voorganger. Een van deze modellen is een pure upgrade en het andere is een echte ruil, en de aankondiging van de leverancier maakt geen onderscheid tussen beide.
Voor de cijfers: de bronregels voor dit stuk, want de twee stapels bewijs hier verdienen heel verschillend gewicht. Prijzen, contextvenster, cachetarieven en kennisafsluitdatums komen uit OpenAI's eigen API-documentatie en prijstabellen, gelezen op 23 september 2026, waarbij de regels voor servicelagen en cache-writes zijn geverifieerd aan de hand van externe kosten-trackers in plaats van alleen uit de aankondiging te zijn overgenomen. OpenAI's benchmarktabellen — AutomationBench, DeepSWE 1.1, OSWorld 2.0, Agents' Last Exam en een interne feitelijkheidsbeoordeling — zijn door de leverancier gerapporteerd en niet gereproduceerd, en elk cijfer dat er hieronder uit afkomstig is, is als zodanig gelabeld. De onafhankelijke cijfers komen van Artificial Analysis, dat beide modellen op de lanceringsdag door zijn Intelligence Index en Coding Agent Index haalde; dat zijn de cijfers die je voor een beslissing moet vertrouwen. Waar de twee van elkaar afwijken, vermeldt het artikel dat, in plaats van ze te middelen.
De lancering, in één alinea
Sol en Luna behoren tot de midden- en lagere segmenten van de GPT-6-familie, getraind met de methoden achter GPT-6 Astra en gepositioneerd als snellere, goedkopere manieren om het grootste deel van diens capaciteiten te bereiken. De insteek van OpenAI is kosten per taak in plaats van ruwe capaciteit: het bedrijf zegt dat GPT-6 Sol ongeveer half zoveel fouten maakt als GPT-5.6 Sol in zijn interne factualiteitsevaluatie, en dat GPT-6 Luna bij een hogere redeneerinspanning de factualiteit van GPT-5.6 Sol evenaart tegen ongeveer een honderdste van de taakkosten. Beide accepteren tekst- en afbeeldingsinvoer en produceren tekst, beide hebben een contextvenster van 1.050.000 tokens met een uitvoerplafond van 128K — Artificial Analysis vermeldt 872k voor hetzelfde model, dus beschouw het bovenste uiteinde van dat venster als door de leverancier opgegeven — en beide bieden redeneerinspanning van none tot max, een niveau dat GPT-6 Astra niet biedt, omdat Astra geen none. Model-ID's zijn gpt-6-sol en gpt-6-luna. Beschikbaarheid loopt via de API, via ChatGPT Work en Codex voor Plus-, Pro-, Business-, Enterprise- en Edu-accounts, en via Amazon Bedrock, dat dezelfde dag de algemene beschikbaarheid van beide aankondigde. Gratis en Go-gebruikers krijgen Luna in de desktopapp; geen van beide modellen zit nog in de gewone Chat-modus.
Wat de vier onafhankelijke cijfers zeggen, en waarom ze van elkaar verschillen
Begin met GPT-6 Sol, want het verhaal is simpel. Artificial Analysis geeft het een score van 48 op de Intelligence Index, de 18e van 212 gemeten modellen, tegen $1,06 per indextaak vergeleken met $1,99 voor GPT-5.6 Sol — ongeveer de helft van de kosten voor een gelijke indexscore, en een verbetering van de kosten per taak die standhoudt in plaats van te vervliegen. De Coding Agent Index stijgt van 55 naar 57, waarbij Terminal-Bench 4.0 van 37% naar 43% gaat en SWE-Atlas-QnA van 54% naar 58%, tegen $2,99 per taak op de Pareto-grens. Het hallucinatiepercentage daalt van 92% naar 60%, en zijn abstentiegedrag verandert volledig van vorm: het beantwoordt nu 83% van de vragen waar de vorige generatie 99% beantwoordde, en krijgt daarvoor een kwart minder foute antwoorden, terwijl de nauwkeurigheid van 59% naar 54% daalt. Dat is een model dat is geleerd zijn mond te houden als het iets niet weet, en de AA-Omniscience Index die van 22 naar 27 gaat, is datzelfde feit in de vorm van een score.
Nu GPT-6 Luna, en het verhaal verandert. Artificial Analysis scoort het 37 op de Intelligence Index — exact hetzelfde cijfer dat GPT-5.6 Luna scoort. De kosten per indextaak dalen van $0,18 naar $0,07, ongeveer 60% minder, en die besparing is echt. Maar de Coding Agent Index daalt, 43 naar 41, waarbij SWE-Atlas-QnA zakt van 49% naar 44% en DeepSWE 1.1 zakt van 66% naar 64%. Het hallucinatiepercentage verbetert van 93% naar 77%, en het abstentiegedrag beweegt nauwelijks — nauwkeurigheid 44% tegenover 43%, AA-Omniscience van −10 naar 1. Samen gelezen: dezelfde gemeten intelligentie, tegen ongeveer 40% van de taakkosten, met een slechtere coding agent en vrijwel ongewijzigde antwoordkwaliteit.
Dat is geen tegenstrijdigheid, en de reden doet ertoe. Een goedkopere token levert je alleen minder op als het model meer tokens besteedt om hetzelfde werk te doen — en de onafhankelijke data zeggen dat deze modellen meer besteden, niet minder. De output per indextaak steeg van 29k naar 31k tokens voor Sol en van 41k naar 51k voor Luna. De 60% besparing van GPT-6 Luna komt volledig door de prijsverlaging, niet doordat er zuiniger wordt gedraaid. De drift in tokens per taak is klein genoeg dat de rekensom hier nog steeds in je voordeel uitpakt; hij is niet klein genoeg om als categorie te negeren, want het is het mechanisme waarmee een toekomstige prijsverlaging teniet kan worden gedaan door een spraakzamer model. OpenAI's eigen framing is om dezelfde reden opgeschoven naar kosten per taak.
Twee regressies vallen buiten de twee belangrijkste indexen en verdienen het om genoemd te worden, want geen van beide komt voor in de aankondiging van OpenAI. In GDPval-AA v2.1, die kenniswerkdeliverables meet, verliest GPT-6 Sol ongeveer 100 Elo ten opzichte van zijn voorganger en GPT-6 Luna ongeveer 75. GPT-6 Luna verliest ook ongeveer 45 Elo in AA-Briefcase v1.1, waar Sol stabiel blijft — Artificial Analysis schrijft het verschil toe aan zwakkere presentatie en ontbrekende rubricitems. Als je de goedkope tier gebruikt voor bulk-samenvatting, extractie en classificatie, heeft niets daarvan invloed op jou. Als je er iets mee opstelt dat iemand moet goedkeuren, dan wel.

De cachingwijziging is het echte API-nieuws
Onder de tariefkaart ligt een wijziging begraven die voor een productierekening meer uitmaakt dan de verlaging die de krantenkoppen haalt, en het is het deel van de aankondiging waar het eigen bericht van OpenAI met één zinsnede op zinspeelt. Er zijn drie dingen veranderd, en het derde is het onderdeel dat je twee keer moet lezen.
Het eerste is de korting zelf: het lezen van gecachte input wordt gefactureerd tegen 10% van het inputtarief, een korting van 90%, dezelfde voorwaarde die de familie al hanteerde en niet een nieuwe. Sols gecachte input kost $0.20 per miljoen en die van Luna $0.01; cache-writes kennen een premie van 1,25x, respectievelijk $2.50 en $0.125, met één enkele time-to-live van 30 minuten.
De tweede is controle. Expliciete caching via prompt_cache_options en prompt_cache_breakpoint — de parameters waarmee je kunt aangeven waar een herbruikbaar prompt-voorvoegsel eindigt, in plaats van te hopen dat de provider het raadt — is beschikbaar op beide modellen. Dit is geen nieuw API-oppervlak; wat nieuw is, is dat het de moeite waard is om te gebruiken, omdat de standaard hitratio's zijn gestegen.
De derde is degene die de architectuur verandert. Het wijzigen van de redeneerinspanning of het aan- en uitzetten van tools maakt de gecachte prefix niet langer ongeldig. Voorheen kostte het een agent-loop die de inspanning opschroefde voor een moeilijke stap en weer verlaagde voor een gemakkelijke stap, om bij elke draai aan de knop de hele context opnieuw te verwerken, en dat gold ook voor een loop die midden in een gesprek een tool toevoegde of verwijderde. Die belasting is nu verdwenen bij deze twee modellen. OpenAI verwijst naar GitHub, dat meldde dat de wijzigingen het aandeel prompttokens dat opnieuw verwerkt moest worden met meer dan de helft verminderden bij miljarden verzoeken. Beschouw dat als een door de leverancier aangeleverd cijfer — het is geloofwaardig en het is niet onafhankelijk gecontroleerd.
Reken het eens door voor een lange agent-loop en de rangorde van de twee aankondigingen kantelt. Een loop die een systeemprompt en toolschema van 30.000 tokens over 200 beurten meedraagt, verplaatst 6 miljoen tokens aan context. Zonder caching is dat op GPT-6 Sol $12,00 aan input. Met de prefix in de cache tegen $0,20 per miljoen is het $1,20 plus de eenmalige schrijfactie — een orde van grootte, door één parameterwijziging, nog voordat de tariefsverlaging überhaupt wordt toegepast. De tariefsverlaging is wat de aankondiging verkocht. Het cachegedrag is wat het getal daadwerkelijk beweegt, en het is de reden dat een tarief van $2,00 dat in de aankondiging vooropstaat zich gedraagt als iets veel goedkopers op de workloads waarvoor OpenAI deze modellen aanprijst.
De tariefkaart, inclusief de delen die de aankondiging overslaat
De hoofdtarieven vormen niet de volledige tariefkaart, en drie niveaus veranderen de beslissing voor specifieke workloads.
• Base — GPT-6 Sol $2,00 in / $10,00 uit; GPT-6 Luna $0,10 in / $0,50 uit, per miljoen tokens, voor prompts tot 272K invoertokens.
• Lange context — boven 272K invoertokens wordt de hele aanvraag gefactureerd tegen 2x input en 1,5x output: $4.00/$15.00 voor Sol en $0.20/$0.75 voor Luna. Dit is een klif, geen marginaal tarief. Als je prompts tot 300K tokens lopen, betaal je het dubbele voor de hele aanvraag, niet voor de 28K die over de grens gaat, en een document opsplitsen in twee calls onder de drempel is vaak goedkoper dan het één keer erboven te versturen.
• Servicelagen — Flex halveert de rekening ($1.00/$5.00 voor Sol, $0.05/$0.25 voor Luna) in ruil voor een tragere doorlooptijd; Priority verdubbelt die. Beide worden geselecteerd via de service_tier parameter. Flex is waar batch-achtige taken thuishoren, en dat gebeurt bijna nooit.
• Gecachte invoer — $0,20 per miljoen op Sol en $0,01 op Luna, een korting van 90%, met een TTL van 30 minuten en een premie van 1,25x voor het schrijven naar de cache.
• Context en uitvoer — venster van 1.050.000 tokens, maximale uitvoer van 128K, tekst en afbeelding in, tekst uit, redeneerinspanning geen tot max met gemiddeld als standaard.
• Kennisafsluitdata — 20 april 2026 voor GPT-6 Sol en 18 mei 2026 voor GPT-6 Luna, wat een maand verschil is binnen dezelfde familie en de moeite waard is om te weten voordat je aanneemt dat de twee modellen hetzelfde wereldbeeld delen.
Wat de benchmarktabel van OpenAI zegt, en wat niet.
De gepubliceerde vergelijkingen van OpenAI gaan allemaal over kosten per taak, allemaal tegen Anthropic, en allemaal door de leverancier uitgevoerd. Op AutomationBench 1.0.6, een agentische evaluatie met 47 tools, meldt het bedrijf dat GPT-6 Sol bij xhigh-inspanning 33,2% scoort tegen $0,27 per taak, tegenover Claude Opus 5 met 26,9% en ongeveer 11 keer de kosten per taak. Op DeepSWE 1.1 meldt het Sol bij maximale inspanning met 68,8% tegenover Claude Fable 5 met 69,9% — een verlies qua score tegen ongeveer 80% lagere kosten per taak — en Luna op 66,6%. Op OSWorld 2.0 scoort Sol 60,5% bij xhigh tegenover Opus 5's 60,3%, opnieuw tegen ongeveer 80% minder per taak. Op Agents' Last Exam bereikt Sol 56,4%, wat volgens OpenAI het beste resultaat van Opus 5 overtreft tegen 60% lagere kosten per taak.
Al die cijfers zijn door de leverancier opgegeven en niet gereproduceerd, en twee kanttekeningen zijn het waard om mee te nemen in plaats van weg te bergen. Ten eerste heeft OpenAI de benchmark uitgevoerd tegen Claude Opus 5, niet tegen Claude Opus 5.5 die enkele uren voor de aankondiging werd uitgebracht, dus geen enkele vergelijking in dezelfde testopstelling toont vooralsnog aan welk model daadwerkelijk de lagere kosten per succesvolle taak levert. Ten tweede zijn kosten per taak niet hetzelfde als kosten per correcte taak: een model dat 83% van de tijd antwoordt en zich bij de rest onthoudt, lijkt goedkoop per taak in een benchmark die onthoudingen als taken meetelt. De onafhankelijke onthoudingsgegevens hierboven zijn juist wat je in staat stelt dat eerlijk te beprijzen — dat GPT-6 Sol 83% van de vragen beantwoordt waar het oude model 99% beantwoordde, is een bewuste afweging, en of die goed is, hangt volledig af van wat een fout antwoord je kost.
OpenAI meldt dat GPT-6 Luna bij hogere inspanning de factualiteit van GPT-5.6 Sol evenaart tegen ongeveer een honderdste van de kosten per taak. Dat is een factualiteitsvergelijking, geen capaciteitsvergelijking, en de onafhankelijke Coding Agent Index plaatst GPT-6 Luna twee punten onder GPT-5.6 Luna, laat staan GPT-5.6 Sol.

Wat je hier eigenlijk mee moet doen
GPT-6 Sol is de eenvoudige optie. Halve taakkosten bij een niveau-indexscore, een betere coding agent, een flinke daling van hallucinaties en een echte verandering in abstentiegedrag vormen samen een upgrade die je volgens schema kunt doorvoeren in plaats van een gok. Als je op GPT-5.6 Sol zit, is dit een migratie, en de enige echte vraag is welke van je prompts afhankelijk zijn van de bereidheid van het oude model om alles te beantwoorden.
GPT-6 Luna is het model dat je moet testen voordat je overstapt. Het is geen strikt betere GPT-5.6 Luna; het is een anders gevormd model — goedkoper per taak, voorzichtiger over wat het beweert, en meetbaar slechter in agentic coding. Voor classificatie, extractie, routing en samenvatting op volume is de ruil bijna gratis geld. Voor alles wat een coding agent voedt, of een document oplevert dat iemand goedkeurt, zijn de regressie van twee punten op Coding Agent en de daling op GDPval de reden om GPT-5.6 Luna in het pad te houden totdat je je eigen taken door beide hebt gehaald.
Dat is ook het argument om geen van beide hard te coderen. Beide modellen zijn op dit moment alleen bij OpenAI verkrijgbaar, en de workloads die deze lagen bedienen — routing, extractie, goedkope classificatie — zijn precies de gevallen waarin een tweede provider achter hetzelfde endpoint van een modelregressie een non-event maakt. OrcaRouter geeft de lijstprijzen van providers door tegen0% opslag, dus een tariefwijziging van een leverancier komt bij ons aan op dezelfde dag dat die bij de leverancier ingaat, en derouting-DSL laat je GPT-6 Luna achter een goedkoper model zetten voor het makkelijke deel van het verkeer, terwijl het moeilijkere deel naar GPT-6 Sol gaat — metautomatische failover als een van beide paden verslechtert. Je hoeft op de dag van de lancering geen winnaar te kiezen om van de lancering te profiteren.
De eerlijke kanttekening: GPT-6 Sol en GPT-6 Luna zijn per 23 september 2026 niet routeerbaar via OrcaRouter. We hosten ze nog niet, en niets hierboven mag worden gelezen als een bewering dat we dat wel doen. Wat wij vandaag wél hebben, is de vergelijkingsset — GPT-5.6 Sol voor $4,00/$20,00, GPT-5.6 Luna voor $0,20/$1,20 en GPT-6 Astra voor $10,00/$50,00 — en dat is precies wat u nodig hebt om de migratie te beprijzen voordat u zich eraan vastlegt.

Wat nu te kijken
Drie dingen zouden duidelijk maken wat deze lancering werkelijk was. Het eerste is of het tarief van $0,20/$1,20 van GPT-5.6 Luna het kwartaal overleeft, want een permanente prijs van één leverancier is historisch gezien de openingstrek gebleken, niet het einde ervan — en dezelfde dag waarop Claude Opus 5.5 uitkwam, wijst erop dat de druk die tot deze verlaging leidde niet is verdwenen. Het tweede is of de verschuiving naar onthouding standhoudt in de praktijk: dat GPT-6 Sol weigert één op de zes vragen te beantwoorden, is het soort verandering dat in een lab als een verbetering leest en in een pijplijn die een antwoord veronderstelde als een kapot product. Het derde is of het cachegedrag echt is op jouw verkeer, wat deze week meetbaar is en alleen door te meten te beantwoorden valt — de korting is groot genoeg dat één uur dat je besteedt aan het instrumenteren van cache-hitrates op je langste prompts meer waard is dan nog een benchmarktabel.
Vergeleken in dit artikel2
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
