OpenAI verlaagt GPT-5.6 API-prijzen: wat er veranderd is, waarom, en hoe je het krijgt
Guides & Insights

OpenAI verlaagt GPT-5.6 API-prijzen: wat er veranderd is, waarom, en hoe je het krijgt

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Op 30 juli 2026 verlaagde OpenAI de API-prijzen van zijn twee goedkopere GPT-5.6-modellen — met een scherpe verlaging van de goedkoopste prijsklasse en een lichte verlaging van de middencategorie. Drie weken later was de beurt aan het vlaggenschip: op 21 augustus 2026 kondigde OpenAI aan dat de API-prijzen van GPT-5.6 Sol de komende drie maanden met meer dan 20% dalen, terwijl het bedrijf ernaar streeft het model efficiënter te laten draaien. Dit artikel legt precies uit wat er in beide rondes veranderde, welke techniek erachter zit, hoe de nieuwe prijzen zich verhouden tot die van concurrenten, op welke verborgen kosten u moet letten, hoe u uw factuur verder kunt verlagen — en hoe de lagere prijzen al live zijn op OrcaRouter met een opslag van 0%.

Elk figuur hieronder is gelabeld met de bron. De prijzen zijn per miljoen tokens (invoer / uitvoer). De Luna- en Terra-tarieven weerspiegelen OpenAI's tariefkaart van 30 juli 2026, zoals gerapporteerd door onder meer Unite.AI; de Sol-verlaging weerspiegelt OpenAI's aankondiging van 21 augustus 2026, met prijzen per token zoals gerapporteerd door onder meer Runtimewire en Reuters. De pass-through-modelpagina's van OrcaRouter tonen dezelfde cijfers; concurrentencijfers worden toegeschreven. Prijzen veranderen — controleer voordat je bouwt.

TL;DR. OpenAI verlaagde GPT-5.6 Luna naar $0,20 / $1,20 (van $1 / $6, ~80% korting) en GPT-5.6 Terra naar $2 / $12 (van $2,50 / $15, ~20% korting) op 30 juli. Op 21 augustus breidde het de korting uit naar het vlaggenschip: de GPT-5.6 Sol API-prijzen dalen de komende drie maanden met meer dan 20% — van $5 / $30 naar $4 / $20 per miljoen tokens, aldus OpenAI — terwijl tokengebaseerde Codex- en ChatGPT Work-tegoeden meer opleveren en abonnementsgebruik ongewijzigd blijft. Twee efficiëntiewinsten betaalden voor de verlaging van juli: herschreven GPU-kernels (ongeveer 20% lagere servingkosten) en een herontworpen conceptmodel voor speculatieve decodering (15%+ snellere tokengeneratie). Als je routeert via een vendor-neutraal endpoint met 0% winstopslag zoals OrcaRouter, zijn de nieuwe tarieven al live — dezelfde prijs, één OpenAI-compatibele API, met elk concurrerend model ernaast om te vergelijken en waartussen je kunt routeren.

Belangrijkste conclusies

• GPT-5.6 Luna: nu $0,20 / $1,20 per 1M tokens, verlaagd van $1 / $6 — ongeveer een korting van 80%.

• GPT-5.6 Terra: nu $2 / $12, verlaagd van $2,50 / $15 — een verlaging van ongeveer 20%.

• GPT-5.6 Sol (vlaggenschip): nu $4 / $20 voor de komende drie maanden, verlaagd van $5 / $30 — een korting van >20%, aangekondigd op 21 augustus 2026.

• Codex & ChatGPT Work tokengebaseerde credits leveren meer op: Sol-input daalt naar 100 credits en output naar 500 credits per 1M tokens (van 125 / 750).

• Abonnementen ongewijzigd: het inbegrepen gebruik voor Plus, Pro en Business, de wekelijkse limieten van vijf uur en de legacy-creditkoersen worden niet beïnvloed.

• Waarom: OpenAI presenteerde beide rondes als efficiëntiewinsten — herschreven productie-GPU-kernels (~20% lagere servingkosten) plus een herontwerp van het draft-model voor speculatieve decodering (15%+ efficiëntere token-generatie), volgens de engineering-post van OpenAI van 29 juli.

• Hoe krijg je het: de verlaagde prijzen zijn al verwerkt op OrcaRouter (0% opslag) — Luna voor $0.20 / $1.20, Sol voor $4 / $20 — via één OpenAI-compatibel eindpunt.

Wat is er precies veranderd?

De GPT-5.6-familie van OpenAI werkt als een getrapte ladder: Luna (snel, goedkoopst), Terra (midden) en Sol (vlaggenschip). De verlaging van 30 juli trof de twee goedkopere lagen. Volgens de gerapporteerde tariefkaart daalde GPT-5.6 Luna van $1 / $6 naar $0,20 / $1,20 per miljoen invoer-/uitvoertokens — een verlaging van ongeveer 80% voor zowel invoer als uitvoer — en GPT-5.6 Terra daalde van $2,50 / $15 naar $2 / $12, ruwweg 20%. GPT-5.6 Sol, het vlaggenschip dat is gebouwd voor de moeilijkste redeneertaken en agentische codering, bleef die dag ongemoeid — maar op 21 augustus 2026 kondigde OpenAI ook voor dit model een tijdelijke verlaging aan: de API-prijzen dalen de komende drie maanden met meer dan 20%, naar $4 per miljoen invoertokens en $20 per miljoen uitvoertokens, waarbij gecachte invoer daalt van $0,50 naar $0,40. In dezelfde aankondiging stond dat je met de credits die je koopt verder komt in Codex bij op tokens gebaseerde abonnementen, en dat het gebruik dat in je abonnement is inbegrepen hetzelfde blijft.

Het basistarief per token is niet het hele verhaal. GPT-5.6-prijzen kennen ook inputlengteniveaus (zeer lange contexten gaan naar een hoger tarief), een korting voor prompt-caching (gecachte input is veel goedkoper dan verse input) en een batchoptie (asynchrone taken met korting). Alle drie blijven van kracht na de verlaging, dus de effectieve prijs voor een workload met veel cache of batch kan nog lager uitvallen. Let in de andere richting op het lange-contextniveau: het invoeren van enorme prompts kan je naar een hoger niveau tillen.

De twee optimalisaties achter de cut

Dit was geen verlieslokker — OpenAI presenteerde het als een efficiëntiewinst. In een technische blogpost van 29 juli 2026 beschreven leden van OpenAI's technische staf optimalisaties op het gebied van inferentie en de agent-harness achter Codex en ChatGPT Work. Twee springen eruit. Ten eerste: herschrijvingen van GPU-kernels in de productie-infrastructuur — waarbij Sol, draaiend binnen Codex, werd ingezet om de eigen kernels van het bedrijf te herschrijven — die volgens OpenAI de kosten voor end-to-end serving met ongeveer 20% verlaagden. Ten tweede: een herontworpen draftmodel voor speculatieve decodering dat de efficiëntie van tokengeneratie naar verluidt met meer dan 15% verbeterde. De lagere servingkosten, doorgegeven aan klanten als lagere prijzen voor de hoog-volume-pakketten, zijn het verhaal — en het biedt een glimp van een feedbackloop waar de hele industrie achteraan jaagt: frontiermodellen gebruiken om juist de infrastructuur te optimaliseren die hen bedient.

De Sol-verlaging die op 21 augustus werd aangekondigd, hanteert dezelfde framing. Volgens OpenAI komt de reductie — meer dan 20% voor de komende drie maanden — doordat het bedrijf het model efficiënter maakt om te draaien, en deze is uitdrukkelijk tijdelijk in plaats van een permanente prijsreset.

Hoe de nieuwe prijzen zich verhouden

De prijsverlaging is rechtstreeks op de concurrentie gericht. Volgens de berichtgeving van Unite.AI onderbiedt Luna's nieuwe $0,20 / $1,20 Anthropic's Haiku 4.5 met ruwweg 5x op invoer en ongeveer 4x op uitvoer, en Terra's nieuwe $2 / $12 ligt onder de standaardprijzen van Claude Sonnet 5 (gerapporteerd op $3 / $15, ingaand na 31 augustus 2026). In vergelijking met het open-gewicht veld ligt Luna nu dicht bij de goedkope inferentie-ondergrens die is vastgesteld door DeepSeek's V4-lijn en Zhipu's GLM-5.2 (ongeveer $1,20 / $4,10), met Alibaba's Qwen en Google's Gemini Flash-niveaus in dezelfde buurt. Sol's tijdelijke verlaging naar $4 / $20 houdt het vlaggenschip ruim boven de eigen volumeniveaus, maar snijdt wel in de premie — en de vermindering met een derde op uitvoertokens is het belangrijkst voor output-intensieve agentworkloads. In de berichtgeving over deze stap wordt opgemerkt dat deze komt terwijl OpenAI te maken krijgt met toenemende concurrentie van Anthropic en Chinese AI-modellen.

Inferentie wordt steeds goedkoper

Zoom uit en deze verlaging past in een meerjarige trend: de kosten van een bepaald niveau van capaciteit zijn scherp gedaald, generatie na generatie, doordat laboratoria meer doorvoer uit dezelfde hardware weten te halen. OpenAI's eigen oudere niveaus illustreren de neerwaartse tendens in de loop van de tijd, en elke efficiëntiedoorbraak — betere kernels, speculatieve decodering, goedkopere aandacht — vertaalt zich doorgaans binnen enkele maanden naar een prijsverlaging. Voor kopers is de praktische conclusie dat ze moeten ontwerpen voor een wereld waarin inferentie volgens een schema goedkoper wordt: ga geen te grote verplichtingen aan met de prijsstelling van één model en houd omschakelen goedkoop.

De verborgen kosten om op te letten: redeneertokens

GPT-5.6-modellen zijn redeneringsmodellen, en dat bepaalt de werkelijke uitgaven in de praktijk. Wanneer redeneren is ingeschakeld, genereert het model interne redeneringstokens die als output worden gefactureerd — dus uw effectieve outputkosten kunnen hoger zijn dan een naïeve schatting op basis van "woorden in het antwoord" suggereert, vooral bij moeilijke prompts met hoge redeneringsinspanning. De oplossing is om de redeneringsinspanning af te stemmen op de taak (laag of uit voor eenvoudige aanroepen), de output waar mogelijk te begrenzen, en het werkelijke tokenverbruik te meten in plaats van te veronderstellen. Een lager tarief per token helpt, maar controle over hoeveel tokens u genereert, helpt nog meer.

Wat het betekent voor ontwikkelaars

Als je GPT-5.6 Luna of Terra gebruikt voor werk met grote volumes — classificatie, extractie, routing, lichtgewicht agents, chat — dan is je rekening net gedaald, in sommige gevallen met het grootste deel van de waarde, zonder dat er code hoeft te worden aangepast. Dat maakt de volumetarieven nog aantrekkelijker voor kostenbewuste workloads en verkleint het prijsverschil met goedkope open modellen. De vlaggenschip-wiskunde is ook veranderd, althans voorlopig: Sol voor $4 / $20 voor de komende drie maanden verlaagt de kosten van redeneerintensief en agentisch werk op het hoogste niveau, en token-gebaseerde Codex- en ChatGPT Work-tegoeden reiken verder. Het blijft een premium keuze voor de moeilijkste taken — alleen goedkoper dan voorheen. Het winnende patroon is hetzelfde: routeer op moeilijkheidsgraad — goedkope niveaus (of goedkope open modellen) voor de makkelijke 80%, het vlaggenschip alleen waar het zijn kosten verdient.

Hoe u uw rekening nog verder kunt verlagen

De prijsverlaging is een basis om op voort te bouwen, niet de eindstreep. De grootste extra hefbomen: prompt caching (hergebruik een stabiele system prompt of lange context en betaal het veel lagere tarief voor gecachte input); de batchoptie (voer niet-dringende taken asynchroon uit met korting); tier- en modelroutering (stuur elke aanvraag naar het goedkoopste model dat het aankan, inclusief open modellen); en redeneringscontrole (betaal niet voor diep redeneren bij triviale aanroepen). Gecombineerd besparen deze hefbomen doorgaans veel meer op de werkelijke rekening dan welke tariefwijziging dan ook. Als concreet anker: bij 10 miljoen tokens per maand met een invoeraandeel van 70%, komen de nieuwe tarieven van Luna neer op ruwweg $5 per maand (ongeveer $4,37 met caching); hetzelfde volume op Sol kost ongeveer $125 per maand — het duidelijkste argument voor routering op basis van moeilijkheidsgraad.

Hoe u de lagere prijzen onmiddellijk kunt vastleggen

Dit is het deel dat het allemaal samenbrengt. OrcaRouter rekent 0% opslag en geeft providerprijzen direct door, dus OpenAI's prijsverlagingen zijn nu al live op OrcaRouter: op de modelpagina's staan nu GPT-5.6 Luna voor $0,20 / $1,20, Terra voor $2 / $12, en GPT-5.6 Sol voor $4 / $20 — dezelfde tarieven als op OpenAI's eigen prijzenkaart, bereikbaar via één OpenAI-compatibel endpoint naast 185+ andere modellen. Je krijgt de prijsverlagingen zonder migratie, en je kunt Sol, Luna en Terra qua prijs vergelijken met DeepSeek, GLM, Qwen, Gemini en Claude op één plek, en vervolgens elk verzoek routeren naar wat het goedkoopst is voor de taak. Er is ook een gratis laag en een 'Offers'-pagina voor extra besparingen.

De prijsverlagingen zijn al live op OrcaRouter: GPT-5.6 Luna voor $0,20 / $1,20 en GPT-5.6 Sol voor $4 / $20 per 1M tokens, doorgegeven tegen 0% opslag.

Kies je route op moeilijkheidsgraad om nog meer te besparen.

De goedkoopste rekening is niet één model — het is het juiste model per verzoek. Omdat OrcaRouter via één endpoint het volledige modelaanbod blootstelt, kun je eenvoudige, hoogvolumineuze calls naar Luna sturen of naar een goedkoop open model, en Sol of een ander vlaggenschip reserveren voor de lastige. Je schakelt met een configuratiewijziging in plaats van een herintegratie. Een prijsverlaging op Luna maakt die route-op-moeilijkheidsgraad-strategie nog goedkoper, en de tijdelijke Sol-korting verlaagt ook de kosten van de lastige calls — zonder dat je iets opnieuw hoeft aan te sluiten.

Veelgestelde vragen

Met hoeveel heeft OpenAI de prijzen van GPT-5.6 verlaagd?

GPT-5.6 Luna daalde van $1 / $6 naar $0,20 / $1,20 per miljoen tokens (ongeveer 80%), en GPT-5.6 Terra van $2,50 / $15 naar $2 / $12 (ongeveer 20%). Op 21 augustus 2026 verlaagde OpenAI ook GPT-5.6 Sol van $5 / $30 naar $4 / $20 voor de komende drie maanden.

Wanneer ging de prijsverlaging in?

De Luna- en Terra-verlagingen gingen op 30 juli 2026 in, live op de gepubliceerde tariefkaart. OpenAI kondigde de tijdelijke Sol-verlaging aan op 21 augustus 2026, voor de komende drie maanden.

Waarom heeft OpenAI de prijzen verlaagd?

OpenAI schrijft de verlaging van juli toe aan inferentie-optimalisaties — herschreven productie-GPU-kernels (ongeveer 20% lagere serverkosten) en een opnieuw ontworpen conceptmodel voor speculatieve decodering (15%+ efficiëntie bij tokengeneratie) — volgens een technisch artikel van 29 juli 2026. Het presenteerde de Sol-verlaging op dezelfde manier, als een stap die werd gezet terwijl het model goedkoper wordt om te draaien, in een markt met toenemende concurrentie.

Is het vlaggenschip (Sol) goedkoper geworden?

Ja — tijdelijk. De prijsverlaging van 30 juli liet GPT-5.6 Sol op $5 / $30 staan, maar op 21 augustus 2026 kondigde OpenAI een prijsverlaging van meer dan 20% aan voor de komende drie maanden, naar $4 / $20 per miljoen tokens. Codex- en ChatGPT Work-tegoeden op basis van tokens kopen ook meer, terwijl abonnementsgebruik ongewijzigd blijft.

Hoe verhouden de nieuwe prijzen zich tot Anthropic en open modellen?

Volgens berichten onderbiedt Luna Anthropic's Haiku 4.5 nu met ongeveer 5x input / 4x output, en Terra valt onder de standaardprijzen van Claude Sonnet 5 ($3 / $15). Luna ligt ook dicht bij de goedkope ondergrens voor open modellen die door DeepSeek en GLM-5.2 is vastgesteld.

Wat is het addertje onder het gras met reasoning tokens?

GPT-5.6 zijn redeneringsmodellen; interne redeneertokens worden als uitvoer gefactureerd, dus de effectieve uitvoerkosten kunnen een naïeve schatting overschrijden. Stem de redeneerinspanning af en begrens de uitvoer om dit te beheersen.

Hoe krijg ik de nieuwe lagere prijzen?

Ze zijn al live op de API van OpenAI en, met 0% opslag, op OrcaRouter — waar GPT-5.6 Luna $0.20 / $1.20 toont en GPT-5.6 Sol $4 / $20 — via één OpenAI-compatibel endpoint, geen code-wijziging nodig.

Kortom

De prijsverlaging van OpenAI op 30 juli maakte GPT-5.6 Luna en Terra aanzienlijk goedkoper voor grootschalig werk, en de aankondiging van 21 augustus breidt dat verhaal uit naar het vlaggenschip: GPT-5.6 Sol zakt naar $4 / $20 voor de komende drie maanden, terwijl Codex-tokencredits meer opleveren en het abonnementsgebruik ongewijzigd blijft. Beide rondes zijn efficiëntiedividenden — enerzijds kernel-herschrijvingen en winsten door speculatieve decodering, anderzijds goedkopere servering — en een duidelijk antwoord op een echte prijzenoorlog. Routeer op basis van moeilijkheidsgraad, leun op caching en batchverwerking, en beheer redeneertokens om het meeste te besparen. En omdat OrcaRouter de prijzen van providers doorberekent met 0% opslag, zijn de lagere tarieven daar al actief — Luna voor $0.20 / $1.20, Sol voor $4 / $20 — dezelfde prijs, één OpenAI-compatibel eindpunt, het hele modellenaanbod op één plek. Profiteer van de verlagingen zonder ook maar één regel code te wijzigen, en laat elk verzoek het goedkoopste model kiezen dat de klus kan klaren.