Een gegenereerde titelkaart voor het Ultrafast-niveau met de kop 'GPT-6 Astra Ultrafast', de ondertitel 'Zes keer de snelheid, op elke lijn' en twee badges met de tekst 'geprijsd en algemeen beschikbaar' en 'de snelle route is geen tweede model'.
Guides & Insights

GPT-6 Astra Ultrafast met 6x: wat de gepubliceerde tariefkaart je werkelijk kost

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

GPT-6 Astra Ultrafast stopped being a waitlist on September 29, 2026. It is now a purchasable service tier with a published price, and that price is exactly six times standard on every single line. The model underneath — GPT-6 Astra, the company's flagship, shipped on September 3, 2026 — is unchanged; what changed at DevDay is that the fast lane over it became generally available, and the company's API documentation now reads plainly that Ultrafast "is broadly available for GPT-6 Astra, with preview access for GPT-5.6 Sol." For the first time you can put this tier on a budget line, and the number to put there is $60.00 per million input tokens and $300.00 per million output tokens, read from the company's own pricing page on September 30, 2026.

Dat maakt dit een andere vraag dan degene die de berichtgeving over de lancering beantwoordde. Het interessante feit deze week is niet dat het niveau bestaat — de preview werd aangekondigd op 13 augustus 2026, en tot in den treure behandeld. Het interessante feit is dat een niveau zonder prijs er nu een heeft, en de rekensom die daaruit volgt is op een specifieke, kwantificeerbare manier onflatteus. Zes keer is geen meerprijs die je met een schouderophalen slikt; het is een meerprijs die je in minder beurten moet terugverdienen, en of je dat kunt, is een eigenschap van je werklast en niet van het model.

De meerdere grepen op elke lijn, en dat is het eerste dat je moet begrijpen.

Bij het lezen van OpenAI's prijzenpagina op 30 september 2026 blijkt de kolom Ultrafast voor GPT-6 Astra een vlakke 6x van de kolom Standard te zijn, in plaats van een opslag op sommige regels en niet op andere. Dat is belangrijk, want het betekent dat je er niet onderuit kunt optimaliseren door de vorm van je verzoeken te veranderen.

• GPT-6 Astra, standaarddienst, aanvragen tot 272.000 invoertokens — $10,00 invoer, $1,00 gecachte invoer, $12,50 cacheschrijfacties, $50,00 uitvoer, per 1 mln. tokens.

• GPT-6 Astra Ultrafast, dezelfde drempel — $60.00 input, $6.00 gecachte input, $75.00 cache-writes, $300.00 output, per 1M tokens. Precies 6x op alle vier de regels.

• Boven 272.000 invoertokens wordt de hele aanvraag opnieuw geprijsd — Standard gaat naar $20,00 / $2,00 / $25,00 / $75,00, Ultrafast naar $120,00 / $12,00 / $150,00 / $450,00. Nog steeds 6x. De long-contextregel die OpenAI voor GPT-6 Astra documenteert, is 2x de invoer- en cachetarieven met 1,5x de uitvoer over de volledige aanvraag zodra je de drempel overschrijdt, en die geldt identiek voor beide tiers.

• De andere tiers op dezelfde kaart — Batch en Flex zijn 50% van Standard, en Fast mode is 2x Standard. De multiplier-ladder voor dit ene model loopt dus 0,5x, 1x, 2x, 6x, zonder trede tussen de laatste twee.

Er is geen Ultrafast-equivalent van Batch. Batch en Flex zijn kortingen die je koopt met lossere planning op de standaardroute; er is geen langzame, goedkope versie van de snelle route. Als je de snelheid wilt, betaal je de 6x op elke token die je verstuurt en elke token die je terugkrijgt, en er is geen mix van gecachte en verse input die de verhouding verbetert.

A screenshot of OpenAI's API pricing page with the Ultrafast tab selected, showing gpt-6-astra at $60.00 input, $6.00 cached input, $75.00 cache writes and $300.00 output per 1M tokens for short-context requests, stepping to $120.00 / $12.00 / $150.00 / $450.00 above 272,000 input tokens, alongside gpt-5.6-sol at $4.00 / $0.40 / $5.00 / $20.00 short-context and $8.00 / $0.80 / $10.00 long-context, with the page's notes that data-residency endpoints carry a 10% uplift for models released on or after March 5, 2026, that FedRAMP carries a further 10%, that Priority processing was renamed Fast mode on July 30, 2026, and that GPT-5.6 Sol's promotional pricing is available at least through November 21, 2026.

Wat één oproep werkelijk kost

De abstractie wordt makkelijker te doorgronden met twee concrete verzoeken. Beide gebruiken de door OpenAI gepubliceerde tarieven per miljoen; de rekensom is van ons.

Een eenmalige aanroep met 20.000 invoertokens en een antwoord van 2.000 tokens kost $0,30 op Standard — 20.000 tokens tegen $10 per miljoen is $0,20, plus 2.000 tegen $50 per miljoen is $0,10. Dezelfde aanroep op Ultrafast kost $1,80. Precies zes keer, zoals geadverteerd.

Nu het geval dat echt een agent-lus beschrijft: een gesprek van 200.000 tokens waarin 190.000 tokens een gecachte prefix zijn en slechts 10.000 nieuw zijn, wat een stap van 1.000 tokens oplevert. Standard rekent $0,19 voor het lezen uit de cache, $0,10 voor de nieuwe input en $0,05 voor de output — $0,34 per stap. Ultrafast rekent $1,14, $0,60 en $0,30 — $2,04 per stap. Weer 6x, maar kijk naar wat de mix deed: caching is de meest effectieve kostenhefboom op dit model en het is op de standaardvariant nog steeds precies 6x goedkoper, dus een agent met veel cache heeft proportioneel niets aan de snelle tier en het verzacht de meerprijs ook niet.

Het gevolg is het deel dat je je eigen moet maken. Omdat de factor constant is, gaat het break-evenpunt helemaal niet over je tokenmix. Het gaat volledig om het aantal beurten. Ultrafast verdient zichzelf in een werklast alleen terug wanneer het draaien ervan het aantal gefactureerde beurten met ongeveer een factor zes terugbrengt — hetzij door een retry-lus samen te voegen tot één enkele doorgang, hetzij door een reeks korte verduidelijkingsaanroepen te vervangen door één snellere interactieve sessie. Als je werklast hetzelfde aantal beurten oplevert als voorheen, alleen sneller, dan koop je latentie tegen precies 6x en niets anders.

Rate limits en geografie zijn de ongeadverteerde plafonds

Twee beperkingen staan buiten de prijs en zijn makkelijk te missen wanneer u een tariefkaart leest.

Het eerste is doorvoer. Ultrafast voor GPT-6 Astra is beschikbaar voor alle API-gebruikers, maar aanvankelijk met lage snelheidslimieten: OpenAI documenteert 500.000 tokens per minuut voor tier 1 tot en met 3, 1.000.000 voor tier 4 en 5.000.000 voor tier 5. Voor een tier die op snelheid wordt verkocht, is dat een echt plafond — een agentcontext van 200.000 tokens bij een half miljoen tokens per minuut komt neer op tweeënhalf verzoek per minuut op een lage tier. OpenAI's eigen advies wijst vanuit de andere hoek op hetzelfde probleem: het raadt WebSockets sterk aan, juist omdat de netwerkoverhead per verzoek de latentie kan opslokken waarvoor de tier betaalt.

Het tweede is residentie. Ultrafast ondersteunt alleen dataresidentie in de VS en wereldwijde verwerking. Het ondersteunt geen EU- of andere regionale verwerkingsendpoints buiten de VS. Als uw implementatie afhankelijk is van een EU-residentie-endpoint voor GPT-6 Astra, is dit niveau tegen geen enkele prijs voor u beschikbaar, en dat is een harde grens en geen configuratiekeuze. Let ook op dat residentie-endpoints een toeslag van 10% hebben voor modellen die op of na 5 maart 2026 zijn uitgebracht, wat ook voor GPT-6 Astra geldt.

De snelheidsheadline daalde van 14x naar 8x

Dit moet zorgvuldig worden gesteld, want het getal dat in de meeste berichtgeving circuleert, is verouderd. De Ultrafast-documentatiepagina van OpenAI bevat, zoals vandaag gepubliceerd, de regel: "onze snelste API-servicelaag, met snelheden tot 8x sneller dan de Standard-modus." De preview-aankondiging van 13 augustus 2026 voor GPT-5.6 Sol beloofde "tot 14x sneller dan Standard-verwerking" en tot 750 outputtokens per seconde op Cerebras-hardware.

Dat zijn niet dezelfde bewering, en het verschil is niet zozeer een intrekking als wel een verandering van onderwerp. Het cijfer van 14x is gemeten op GPT-5.6 Sol in een beperkte preview; het cijfer van 8x is wat OpenAI publiceert voor het niveau zoals het er nu voorstaat, met GPT-6 Astra als het breed beschikbare model. Wie op Astra rekent met 14x, rekent met een cijfer dat OpenAI niet voor Astra heeft gepubliceerd. De eerlijke lezing is dat beide cijfers door de leverancier gerapporteerde plafonds voor de outputdoorvoer zijn, dat geen van beide een latencygarantie voor jouw workload is, en dat de end-to-endtijd nog steeds input, tool calls en je eigen orchestratie omvat. Beschouw 8x als het planningscijfer en beschouw alles wat beter is als een bonus die je op je eigen verkeer verifieert in plaats van aanneemt.

Wat te doen met dit op maandag?

De beslisregel die uit de berekening volgt, is nauwer dan de marketing suggereert, en het is de moeite waard om die op te schrijven voordat iemand voorstelt Ultrafast over een hele omgeving in te schakelen.

Schakel het in waar de werkbelasting latentiegebonden en interactief is, en waar een mens op wacht. Incidenttriage, een live supportescalatie, een onderzoeksloop waarin een analist in één zit itereert — dit zijn de gevallen waarin de waarde van het antwoord dat nu aankomt in plaats van over vier minuten niet evenredig is met de tokenprijs, en waarin een 6x-factuur voor een klein aantal beurten verwaarloosbaar kleiner is dan de kosten van de persoon die wacht. OpenAI's eigen voorbeelden in de aankondiging van de preview hadden precies deze vorm: logs lezen terwijl een storing zich ontvouwt, een nachtelijke onderzoeksloop comprimeren tot een werksessie.

Schakel het uit waar de workload doorvoergebonden of batchvormig is. Een nachtelijke herindexering, een bulkclassificatieronde, een gepland rapport, een backfill — geen van deze geeft om wall-clocklatentie, allemaal worden ze gedomineerd door het aantal tokens, en allemaal hebben ze een 0,5x-optie die recht daar op dezelfde tariefkaart in Batch en Flex staat. 12x het batchtarief betalen om eerder klaar te zijn, is de duidelijkste manier om geld te verspillen in deze tabel.

Het ongemakkelijke midden is de agentische coderingslus, en daar beslist de rekenkunde van het aantal beurten het. Als de snelheid echt retries wegneemt — als de eerste doorgang van het model bij een wijziging over meerdere bestanden vaker slaagt omdat het niet tegen een timeout vecht — dan kan Ultrafast goedkoper zijn per voltooide taak, ondanks dat het 6x per token is. Dat is een meetbare bewering over je eigen traces, niet een algemene, en de meting is goedkoop: tel gefactureerde beurten per voltooide taak op beide tiers en vermenigvuldig met het tarief. Als de verhouding niet in de buurt van zes ligt, is de snelle tier een latentieaankoop en moet die als zodanig worden gerechtvaardigd.

De tier heeft een prijs; de routes eromheen zijn een andere kwestie.

Een praktische opmerking over hoe je dit aanpakt. GPT-6 Astra in standaarddienst is live op OrcaRouter als openai/gpt-6-astra tegen het eigen tarief van de provider — $10,00 invoer en $50,00 uitvoer per miljoen tokens, met de 272K lange context verhoogd naar $20,00 / $75,00 — geleverd tegen 0% markup, wat betekent dat de listprijs van de provider wordt doorgegeven en elke leverancier dezelfde dag op je factuur staat als op de tariefkaart van OpenAI, in plaats van bij je volgende contractverlenging. Dezelfde sleutel bereikt meer dan 200 modellen, zodat de standaard tier achter dezelfde client kan zitten als de goedkope tier of het model van een concurrent, zonder een tweede integratie.

Wat we niet doen, is de Ultrafast-tier aanbieden. Het is een service-tier-flag op een OpenAI-account in plaats van een apart routeerbaar model — je stelt service_tier: "ultrafast" in bij een aanvraag aan gpt-6-astra — en OpenAI factureert dit aan je eigen account tegen de bovenstaande tarieven. Als je het inschakelt, zit het in je directe OpenAI-integratie, en OrcaRouter is de juiste plek voor het standaard-tier-verkeer dat je daarnaast routeert. Dat ronduit zeggen is nuttiger dan een capaciteit te suggereren die we niet hebben.

A screenshot of the OrcaRouter model page for GPT-6 Astra, model id openai/gpt-6-astra, showing a 1M-token context window, 128K maximum output, text, image and file input, text output, public benchmarks attributed to OpenAI dated 2026-09-04, input price $10.00 and output price $50.00 per 1M tokens, p50 time to first token 4.69 s, a 10.00 s figure, and 155.1M tokens of traffic, with the page's code sample and EN language toggle visible in the header.

De beslissingsregel, in één alinea

Zes keer is de prijs van een tier, niet de prijs van een model: de gewichten, het contextvenster van 1.050.000 tokens, het uitvoerplafond van 128.000 tokens en de antwoorden zijn allemaal identiek aan standaard GPT-6 Astra. Wat je koopt, is tot 8x snellere outputdoorvoer, op een tariefkaart die op elke regel 6x bedraagt, onderhevig aan lage initiële snelheidslimieten en een Amerikaanse residentiebeperking die de EU volledig uitsluit. Die afweging is duidelijk juist voor een mens die op een antwoord wacht, duidelijk verkeerd voor een geplande batchtaak waarvoor een halve-prijsbaan beschikbaar is, en echt onbeslist voor agentische loops waar het antwoord afhangt van of snelheid beurten wegneemt. Meet het aantal beurten in je eigen traces voordat je je vastlegt, en routeer de rest tegen lijstprijs.

A screenshot of OpenAI's Ultrafast documentation page, showing the sentence 'Our fastest API service tier, with up to 8x faster speeds than Standard mode.', the sentence 'It is broadly available for GPT-6 Astra, with preview access for GPT-5.6 Sol.', the recommendation to use WebSockets because per-request network overhead can reduce the latency gains, the note that Ultrafast for GPT-6 Astra is available to all API users at low rate limits with higher limits or Sol preview access available through an OpenAI account team, and a Python code sample setting service_tier to 'ultrafast' with model 'gpt-6-astra'.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt