Hero-titelkaart voor GPT-6 Luna vs GPT-5.6 Luna met de badge 'GA 22 sep 2026', de kop 'GPT-6 Luna vs GPT-5.6 Luna', de ondertitel 'Dezelfde naam, de helft van de prijs, een slechtere oplevering', en drie statistiekkaarten met 'Invoer: $0,10 vs $0,20 per MTok', 'Uitvoer: $0,50 vs $1,20 per MTok' en 'AA Index: 37,26 vs 37,32', met het OrcaRouter-logo rechtsonder gecompositeerd.
Guides & Insights

GPT-6 Luna vs GPT-5.6 Luna: Dezelfde naam, de helft van de prijs en een slechtere oplevering

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Twee modellen, één woord gemeen, en een onafhankelijke score die vrijwel identiek is. GPT-6 Luna bereikt 37,26 op de Artificial Analysis Intelligence Index; GPT-5.6 Luna bereikte 37,32. Een verschil van 0,07 punt is geen meting, het is ruis, en het is het allerbelangrijkste feit over deze combinatie. Wat de twee modellen scheidt, is niet het vermogen — het is $0,0681 per voltooide indextaak tegenover $0,1783, en een reeks regressies in kenniswerk die de prijsverlaging niet vermeldt.

De datums zijn belangrijk voor het interpreteren van de cijfers. GPT-5.6 Luna werd uitgebracht op 9 juli 2026 voor $0,20 per miljoen inputtokens en $1,20 per miljoen outputtokens. GPT-6 Luna werd uitgebracht op 22 september 2026 voor $0,10 en $0,50 — precies de helft van het inputtarief en 58% lager dan het outputtarief, wat OpenAI als permanent heeft omschreven in plaats van als promotioneel. Dat is een echte verlaging, en het is ook het kleinere deel van het verhaal. Het grotere deel is dat het nieuwere model een ander model is, niet hetzelfde model met een nieuwe prijs.

Two-column comparison scoreboard titled 'GPT-6 Luna vs GPT-5.6 Luna - the scoreboard'. Left column 'GPT-6 Luna': Input per MTok $0.10; Output per MTok $0.50; Cost per index task $0.0681; Hallucination rate 76.7%; AA-Briefcase Elo 1,299.23; AA Intelligence Index 37.26. Right column 'GPT-5.6 Luna': Input per MTok $0.20; Output per MTok $1.20; Cost per index task $0.1783; Hallucination rate 92.6%; AA-Briefcase Elo 1,345.38; AA Intelligence Index 37.32. Footer reads 'Vendor price lines per OpenAI; independent figures per Artificial Analysis.' OrcaRouter logo composited bottom-right.

Wat een migratie daadwerkelijk oplevert, in cijfers

Zet de twee naast elkaar op de dimensies die een migratie bepalen, en het beeld is ongelijkmatig. Sommige rijen verbeteren, sommige gaan achteruit, en één verbetert aanzienlijk.

Prijs — GPT-6 Luna $0,10 in / $0,50 uit per miljoen tokens versus GPT-5.6 Luna $0,20 / $1,20. Half op input, 58% korting op output.

• Gecachte input — $0,01 per miljoen tegenover $0,02. Dezelfde korting van 90% op een gehalveerde basis, dus een herhaald prefix kost de helft van wat het in juli kostte.

• Kosten per voltooide taak — $0,0681 tegen $0,1783 op dezelfde suite. Een verlaging van 62%, die groter is dan de verlaging van de tokenprijs omdat de taakmix niet identiek is.

• Uitvoertokens per taak — 50.537 tegenover 41.235. Het nieuwe model is 23% spraakzamer per afgeronde taak, en 78% van zijn uitvoer is redeneerwerk dat nooit in het antwoord verschijnt.

• Contextvenster — 1.050.000 tokens tegenover 1.000.000. Hetzelfde praktische plafond; beide beperken de uitvoer tot 128.000 tokens.

• Onthouding — een hallucinatiepercentage van 76,7% op AA-Omniscience tegen 92,6%. Dit is de grootste individuele verbetering in de set, en het is geen kenniswinst: de nauwkeurigheid gaat van 42,7% naar 43,8%, vrijwel gelijk. Het nieuwere model onthoudt zich in plaats van te verzinnen, wat een gedragsverandering is en geen capaciteitsverandering.

• Deliverables voor kenniswerk — AA-Briefcase v1.1 daalt van 1.345,38 Elo naar 1.299,23, en GDPval-AA v2.1 daalt van 1.443,14 naar 1.367,09. Beide omlaag, met ongeveer 46 en 76 punten.

• Programmeren en langetermijnwerk — Terminal-Bench 4.0 gaat van 11,6% naar 12,6% en SciCode van 53,6% naar 54,6%, de twee rijen hier die stijgen. Daarentegen daalt de Coding Agent Index van 43 naar 41 en de SWE-achtige agentische evaluaties bewegen dezelfde kant op.

• AutomationBench-AA — 53,2% tegenover 50,2%. Een stijging, en wel met meer dan enige andere agentische maatstaf in de reeks.

Screenshot of the Artificial Analysis page for GPT-6 Luna (max), dated September 2026, showing a proprietary model that accepts text and image input and outputs text with a 1M-token context window, an Artificial Analysis Intelligence Index score of 37, pricing of $0.10 per million input tokens and $0.50 per million output tokens, a 90% cache discount, and a cost rank of 20th of 183 models in its class.

De regressie zit in het artefact, niet in de redenering.

Het patroon in die laatste twee rijen is het benoemen waard, want het is de hele beslissing. Het nieuwe model is beter in agentische acties van één stap en slechter in het terugleveren van een afgerond document. Artificial Analysis schrijft de achteruitgang bij kenniswerk toe aan presentatiekwaliteit en deliverables die vereiste rubric-elementen oversloegen, eerder dan aan feitelijke of redeneerfouten — precies het soort regressie dat een smoke test overleeft en een review niet doorstaat.

Combineer de twee feiten en de migratie valt netjes uiteen op basis van wat de output consumeert. Als je pipeline gestructureerde output leest — JSON, een classificatie, een geëxtraheerd veld, een routeringsbeslissing — kost de presentatieregressie je niets, is de verbetering op het gebied van onthouding echte winst, en wordt de 62%-reductie in taakkosten volledig gerealiseerd. Als een mens het eindproduct leest — een rapport, een memo, een klantgericht document — is het nieuwere model meetbaar slechter in precies datgene waarvoor je betaalt, en levert de besparing je een reviewer op.

Het abstentiegetal verdient dezelfde behandeling. Een model dat van verzinnen bij 93% van wat het niet weet naar verzinnen bij 77% gaat, is een wezenlijk ander object voor een guardrail, een compliancecontrole of elke pijplijn waarin een zelfverzekerd maar fout antwoord zich voortplant. Die verbetering is echt, ze is onafhankelijk gemeten, en het is het sterkste argument om werk naar het nieuwe model te verplaatsen dat helemaal niet van de prijs afhangt.

Wat verandert er in je code, en wat niet

Minder dan een prijsverlaging van deze omvang doet vermoeden, en dat is het goede nieuws. Het contextvenster is van dezelfde orde, de maximale uitvoer is identiek bij 128.000 tokens, en de herprijzingsclausule voor lange contexten van de familie is ongewijzigd: verzoeken boven 272.000 invoertokens worden gefactureerd tegen 2x de invoer- en cachetarieven en 1,5x de uitvoer, voor het hele verzoek in plaats van voor het deel boven de grens. Een verzoek dat bij 300.000 tokens op GPT-5.6 Luna duur was, is op GPT-6 Luna ook duur — tegen de helft van het tarief, dezelfde drempel, dus een werklast die in juli gesplitst had moeten worden, moet nu nog steeds worden gesplitst.

De effort-ladder is waar gedrag verandert, niet de kosten. GPT-6 Luna biedt none, low, medium (de standaard), high, xhigh en max, en de standaard doet ertoe: een pipeline die is afgestemd op de standaard effort van het ene model, is niet automatisch afgestemd op die van een ander. Teams die een instelling expliciet hebben vastgezet, zijn niet getroffen. Teams die de standaard hebben overgenomen, draaien een andere configuratie dan in juli, en het zichtbare symptoom zal tokenvolume zijn, niet kwaliteit.

Het is de moeite waard om één valkuil te herhalen, omdat deze niet verdwijnt met het nieuwe model. Op het Chat Completions-endpoint werkt functieaanroepen alleen wanneer reasoning effort op none is ingesteld; elk ander reasoning effort-niveau, en elke ingebouwde tool, vereist de Responses API. Een team dat een tool-calling-lus port door de modelstring te wijzigen, zal merken dat zijn tools stilzwijgend niet beschikbaar zijn bij de standaard medium effort, en de oplossing is een herschrijving van het aanroepoppervlak in plaats van een parameter.

Wat u vandaag kunt routeren, en wat u niet kunt

Dit is het deel van de migratie dat niets met benchmarks te maken heeft. GPT-5.6 Luna staat op OrcaRouter tegen zijn lijstprijs — $0,20 per miljoen inputtokens, $1,20 per miljoen outputtokens, een contextvenster van 1.000.000 tokens, een maximale output van 128.000 tokens, en een p50-tijd tot het eerste token van 1,60 seconden, gemeten over liveverkeer op onze eigen modelpagina. We geven de lijstprijzen van de provider ongewijzigd door, zonder opslag, dus op de dag dat OpenAI de prijzen voor deze familie aanpaste, was de wijziging direct aan onze kant live in plaats van pas bij de volgende factureringscyclus.

Screenshot of the OrcaRouter model page for openai/gpt-5.6-luna, showing GPT-5.6 Luna by OpenAI dated 2026-07-09, Vision, Tools, JSON and Reasoning badges, a 1M-token context window, 128K maximum output, text, image and file input, pricing of $0.20 input and $1.20 output per million tokens, a p50 time to first token of 1.60 seconds and a p95 of 10.00 seconds, and the description 'GPT-5.6 Luna is the fast, cost-efficient model in OpenAI's GPT-5.6 series — tuned for high-volume, latency-sensitive workloads while retaining genuinely capable reasoning.'

GPT-6 Luna is vanaf 23 september 2026 niet routeerbaar via OrcaRouter. De beschikbaarheid is OpenAI's eigen API en de cloudcatalogi die deze familie aanbieden, en we vermelden geen model dat we niet kunnen leveren. Het praktische gevolg is dat een team dat deze migratie plant vandaag de prijsstelling kan doorvoeren en vandaag de routering niet kan doorvoeren — de twee helften van de wijziging vallen op verschillende datums.

Wat dat in de tussentijd mogelijk maakt, is de opzet die de meeste teams uiteindelijk toch zullen willen. Houd GPT-5.6 Luna op de paden waar het op te leveren resultaat het product is, gebruik GPT-6 Luna waar de output door code wordt gebruikt, en behandel de grens als een laag in plaats van een herschrijving. Omdat de modellen die je kunt bereiken achter één endpoint zitten, met meer dan 200 modellen op dezelfde sleutel en automatische failover tussen providers, is het toevoegen of verwijderen van een laag een configuratieregel in plaats van een tweede integratie — en het escalatiepad is niet langer afhankelijk van of één enkel model beschikbaar is.

De migratiebeslissing, eenvoudig gesteld

Verplaats het werk naar waar de output door machines wordt gelezen en de succesvoorwaarde verifieerbaar is. Classificatie, extractie, routeringsbeslissingen, guardrail-aanroepen, bulktransformatierondes en enkelstaps agentacties komen allemaal in aanmerking: het samengestelde resultaat blijft onveranderd, het abstentiegedrag is wezenlijk beter en de taakkosten liggen ongeveer 62% lager. Met Batch tegen de helft van de standaardtarieven en gecachte input tegen een tiende van een gehalveerde basis, is een pipeline die in juli nog marginaal was nu eenvoudig haalbaar.

Verplaats het werk niet waar een persoon het artefact goedkeurt, en verplaats coding-agentpaden niet blindelings. Een daling van 46 punten op AA-Briefcase en een daling van 76 punten op GDPval zijn kleine getallen die in dezelfde richting wijzen als een daling van twee punten op de Coding Agent Index, en de faalmodus die Artificial Analysis beschrijft — overgeslagen rubric-elementen, zwakkere presentatie — is onzichtbaar voor een geautomatiseerde controle. Houd het vorige model aan waar afwerking het eindproduct is.

En behandel het gelijkspel van 0,07 punt in de index als de bevinding die het is. Dit is geen slimmer model tegen een lagere prijs. Het is een anders gevormd model tegen een lagere prijs, en de vraag die een migratieplan moet beantwoorden is welke vorm je workload verbruikt — niet welke score hoger is, want in de onafhankelijke registratie zijn die twee scores hetzelfde getal.