
OpenAI's Decisions API: GPT-6 Luna stopt met chatten en kiest één antwoord.
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 393 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAINIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 209 tok/s
- OrcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- xAISpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
GPT-6 Luna werd op 22 september 2026 uitgebracht als de goedkope trede van OpenAI's GPT-6-ladder. Wat op 29 september nieuw is, is een taak voor het model die niets met gesprekken te maken heeft. OpenAI's Decisions API neemt een vraag die jij hebt geschreven, een eindige lijst met antwoorden die je toestaat, en een stuk context — tekst of een afbeelding — en geeft een van die antwoorden terug. Geen proza. Geen alinea om te ontleden en maar te hopen. Eén enkele keuze, zodat een supportticket naar een van vijf wachtrijen gaat, een afbeelding in één moderatiecategorie terechtkomt, of een agent zijn volgende zet kiest uit een beleid dat jij hebt gedefinieerd. Het werd aangekondigd op DevDay 2026 en het is nu in beperkte preview, waarbij OpenAI zegt dat een brede release in de komende dagen gepland staat.
Het meeste van wat een team nodig heeft voordat het hierop voortbouwt, is nog niet gepubliceerd. Er is geen prijs per aanroep, geen vermelde limiet voor hoeveel kandidaat-antwoorden een verzoek kan bevatten, geen uitspraak over of je het op je eigen data kunt afstemmen, en — per 30 september — nergens een vermelding ervoor in OpenAI's eigen index van ontwikkelaarsdocumentatie, changelog of API-referentie. We hebben alle drie gecontroleerd. De mogelijkheid bestaat momenteel in OpenAI's DevDay-recap en in wat een woordvoerder van OpenAI op de dag van de lancering aan verslaggevers vertelde. Dus de rest van dit artikel houdt drie niveaus zichtbaar gescheiden: wat OpenAI heeft bevestigd, wat één meting op de dag van de lancering beweert, en wat nog niemand kan weten.
Wat een beperkte beslissing werkelijk is
Twee bestaande benaderingen doen dit werk slecht, en de Decisions API is gericht op de kloof daartussen. De eerste is het prompten van een chatmodel: je schrijft een zorgvuldige instructie waarin je het vraagt om uit een lijst te kiezen, het schrijft een zin voor je, en als je geluk hebt kun je tokenkansen uit het antwoord halen om iets te krijgen dat op een betrouwbaarheidsscore lijkt. Het werkt, het vreet tokens, en het betrouwbaarheidsgetal is een ruwe gok. De tweede is het trainen van een kleine classifier: snel, goedkoop, en er is gelabelde data nodig plus een hertraining telkens wanneer de labelset verandert.
Een beslissingsmodel zit tussen die twee in. Het accepteert nieuwe labels in de prompt — op dezelfde manier waarop een prompt dat doet — maar retourneert een score of een keuze waarop een ontwikkelaar kan vertakken zonder te parsen, wat de eigenschap was die een classifier had en een chatmodel nooit heeft gehad. Deze vorm is niet nieuw voor OpenAI: de Moderation API retourneert al jaren scores per categorie in plaats van tekst, met één verschil dat hier van belang is. De categorieën van Moderation zijn die van OpenAI. De categorieën van de Decisions API zijn de jouwe.
De beperking is het product, en het is de moeite waard precies te zijn over wat ze wel en niet oplevert. Een eindige uitvoerruimte betekent dat elke toegestane waarde vooraf bekend is, zodat je applicatie een antwoord kan afwijzen dat ze niet heeft gedefinieerd, aan elke vertakking een ander machtigingsniveau kan koppelen, en kan terugvallen op een mens wanneer het vertrouwen of de context beperkt is. Het maakt ook offline-evaluatie beheersbaar, omdat elke testcase een doelklasse heeft en meetbare kosten wanneer die fout is. Wat het niet oplevert, is correctheid. Een model met beperkingen kan nog steeds het verkeerde geldige antwoord kiezen, zich laten sturen door misleidende context, of de bias van de categorieën die je hebt geschreven overnemen.
De bewering van 150 milliseconden, en het getal dat OpenAI niet publiceerde
OpenAI zegt dat de Decisions API beslissingen ongeveer tien keer sneller neemt dan GPT-6 Luna via de reguliere API doet — in de orde van 150 milliseconden tegen ongeveer 1,6 seconde. Dat cijfer is door de leverancier opgegeven en niet gereproduceerd; er is in de twee dagen sinds de lancering geen onafhankelijke meting van, en OpenAI's eigen samenvatting zegt alleen "besluitvorming in realtime." Bij het cijfer horen geen latentieverdeling, geen regio, geen invoergrootte, geen concurrentieniveau en geen service-level agreement.
Onze eigen verkeersgegevens zijn geen vervanging voor die test, maar ze verklaren waarom de ontbrekende verdeling ertoe doet. Over de zeven dagen tot 30 september laat GPT-6 Luna, bediend via de normale chat-completions-route van OrcaRouter, een mediaan zien van 699 milliseconden en een p95 van 7,6 seconden over 3,23 miljard tokens met gemengde werklast — een spreiding van meer dan een orde van grootte tussen het midden en de staart. Dat is een andere aanvraagvorm dan een beperkte beslissing, dus het is geen vergelijking met de bewering van 150 ms. Het is de reden dat één p50-kopgetal het verkeerde getal is om een deadline op te baseren. Als je de preview test, registreer dan mediaan, p95 en p99 afzonderlijk voor tekst- en beeldinvoer, neem netwerktijd en retries mee, en meet de deadline die je product daadwerkelijk heeft — een routeringsbeslissing voor een asynchrone wachtrij en een die tussen een klik en een betaling zit, delen geen latentiebudget.

Prijzen: wat het onderliggende model kost, en waarom dat niet de prijs van de API is
OpenAI heeft geen tarief gepubliceerd voor de Decisions API. Het is ook niet veilig om aan te nemen dat de Luna-token tarieven van toepassing zijn, omdat de Decisions API een eigen product is — een ander endpoint met andere limieten, en OpenAI heeft gezegd meer details te delen "bij brede uitrol." Iedereen die je nu een kostenbedrag per beslissing noemt, leidt dat af.
Wat wordt gepubliceerd is de tariefkaart voor het model waarop het is gebouwd, gelezen van OpenAI's prijspagina op 30 september 2026:
• Invoer — $0,10 per miljoen tokens, wat $0,20 wordt boven 272.000 invoertokens
• Uitvoer — $0,50 per miljoen tokens, wat $0,75 wordt boven 272.000 invoertokens
• Gecachte invoer — $0,01 per miljoen tokens; cache-writes worden gefactureerd tegen $0,125, een premie van 25% op het niet-gecachte tarief
• Batch- en Flex-verwerking — 50% van de standaardtarieven; Fast-modus — 2x de geldende tarieven
De long-contextgrens is de grens die mensen vaak verrast, en die werkt hetzelfde als in de hele GPT-6-familie: het overschrijden van 272.000 inputtokens betekent dat voor het hele verzoek het hogere tarief wordt gerekend, niet alleen voor het overschot. Een beslissings-API die een lang document of een grote set afbeeldingen aan het model doorgeeft, is precies het soort aanroep dat die grens kan overschrijden, wat weer een extra punt is dat de niet-gepubliceerde limieten van de preview openlaten.
GPT-6 Luna op eigen voorwaarden
Haal de API weg en het onderliggende model is een redeneermodel onderaan een drietrapsfamilie — onder GPT-6 Sol tegen $2,00/$10,00 en het vlaggenschip GPT-6 Astra tegen $10,00/$50,00 — met een contextvenster van 1.050.000 tokens, een 128.000-token, een kennisafsluitdatum van 18 mei 2026, en redeneerinspanning instelbaar over zes waarden van none tot max. Het accepteert tekst- en afbeeldingsinvoer en retourneert tekst, en in de eigen ontwikkelaarsdocumentatie van OpenAI is de standaardwaarde voor redeneerinspanning medium. Eén praktische kanttekening van diezelfde pagina, niet gerelateerd aan de Decisions API maar relevant als je Luna als terugvaloptie inbouwt: bij Chat Completions werkt function calling alleen wanneer redeneerinspanning op none staat. Tools met een andere instelling voor redeneerinspanning hebben de Responses API nodig.
Wat kwaliteit betreft is het onafhankelijke cijfer de Intelligence Index van Artificial Analysis: 37,3 voor Luna bij maximale inspanning, tegenover 47,5 voor GPT-6 Sol — een verschil van ongeveer tien punten, wat de eerlijke manier is om het prijsverschil van twintig keer bij input te interpreteren. Geen van beide cijfers is een uitspraak over de Decisions API, waarvan de beperkte taak een heel andere meting is en waarvoor geen gepubliceerde score bestaat.

Jev, Laya en de 'systeem één'-framing
De Decisions API kwam niet in een leeg veld terecht. TypeSafe AI's Jev, gelanceerd op 15 september 2026 door Diogo Almeida en algemeen beschikbaar sinds 21 september, is het model dat deze categorie voor ontwikkelaars leesbaar maakte: het genereert helemaal geen tekst, maar retourneert in plaats daarvan getypeerde antwoorden met betrouwbaarheidswaarden, tegen $0,042 per miljoen inputtokens, waarbij output tegen nul wordt gefactureerd. De eerste onafhankelijke test van Jev, uitgevoerd door Every, verwerkte 777 beoordelingen over 37 documenten in minder dan 0,7 seconden voor ongeveer een kwart cent, en een tweede test klokte het op een mediaan van 0,35 seconden per passage tegenover 8,83 seconden voor Claude Fable 5.1 bij hoge inspanning — ongeveer 25 keer sneller tegen ongeveer 1/580 van de kosten, terwijl het zes van de zeven opzettelijk aangebrachte defecten vond, waar Fable 5 alle zeven vond. "Goed maar niet perfect" was het oordeel van Every, en dat is de juiste samenvatting in één regel. Laya is de derde deelnemer in dezelfde vorm, een beslissingsmodel dat antwoordt zonder een token te schrijven.
Of OpenAI de Decisions API vanwege Jev heeft gebouwd, is speculatie. The New Stack, dat er op de dag van de lancering over berichtte, noemde een reactie op TypeSafe 'waarschijnlijk' en merkte op dat OpenAI de aankondiging waarschijnlijk haastig naar voren heeft gehaald vóór DevDay; OpenAI heeft niets van dien aard gezegd, en de timing — de algemene beschikbaarheid van Jev op 21 september, DevDay op 29 september — is suggestief maar geen bewijs. Wat geen speculatie is, is dat de twee nog niet vergelijkbaar zijn op de as die kopers belangrijk vinden. Jev publiceert een prijs, een vorm per aanroep en een GA-datum. De Decisions API publiceert geen van die drie.
Waar het draait, en wat je ernaast warm moet houden
De Decisions API is een eigen product van OpenAI. Het is geen model in onze catalogus en we routeren het niet, dus als je dit specifieke endpoint wilt, moet je bij OpenAI zijn. Het model waarop het is gebouwd, is een ander verhaal: GPT-6 Luna is een live-route op OrcaRoutertegen de lijstprijs van OpenAI zonder dat er enige markup wordt doorberekend — $0,10 input en $0,50 output per miljoen tokens, waarbij voor de >272K-tier $0,20/$0,75 wordt gerekend — en in de zeven dagen tot 30 september heeft het 3,23 miljard tokens via ons verwerkt met een foutpercentage van 0,18%.
Dat is belangrijk voor hoe je een preview minder risicovol maakt. De verstandige manier om een endpoint voor beperkte beslissingen te testen is om het op prompts gebaseerde pad warm te houden als fallback, omdat een preview limieten of prijzen zonder kennisgeving kan wijzigen en een beslissing die op een kritieke pad zit, moet ergens naartoe kunnen. Die fallback op dezelfde sleutel als je andere modellen houden betekent geen tweede contract en geen codewijziging aan het fallbackpad: één API voor 200+ modellen, met automatische failover over providers wanneer er één hapert. En als je beslissing één stap in een langere keten is, voegt de routing-DSL modellen samen tot één aanroep, wat precies het orchestrator-plus-decider-patroon is dat de Jev-verslaggeving populair maakte — een groter model dat plant, een klein model dat elke stap kiest. Dat patroon is vandaag construeerbaar uit modellen die wij aanbieden; de Decisions API zelf zou erbuiten vallen totdat OpenAI die openstelt.
Wie moet zich verplaatsen, en wie moet wachten
Als je probleem een classificatie- of routeringstaak met een hoog volume is waarbij een verkeerde vertakking goedkoop en omkeerbaar is, dan is de preview deze week een requestvorm en een gelabelde set waard — de mogelijkheid is reëel, de beperking is een echte verbetering ten opzichte van het parsen van proza, en een preview is het goedkoopste moment om te ontdekken waar de foutkosten neerslaan. Als je beslissing geld autoriseert, een bericht naar een klant stuurt, of tussen een gebruiker en een betaling staat, verandert er deze week niets aan je afweging: er is geen gepubliceerde prijs om te modelleren, geen gepubliceerde limiet om omheen te ontwerpen, geen SLA, en geen woord over of je het ding op je eigen data kunt afstellen. Die vier leemtes zijn wat "brede uitrol" moet invullen, en totdat OpenAI ze bij naam noemt, is de eerlijke lezing van de Decisions API een veelbelovende interface met een snel door de leverancier opgegeven tijdschema en geen rekening eraan verbonden.

Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
