Een gegenereerde titelkaart met de kop 'GPT-6 Astra Ultrafast draait op Blackwell', de ondertitel 'NVIDIA noemt de hardware achter de 8x', en drie kaarten met de tekst 'Hardware: Blackwell-GPU's', 'Prijsfactor: 6,00x standaardtarief' en 'Beweerde snelheid: tot 8x', met een voettekst met de tekst 'NVIDIA-bericht, 1 oktober 2026 - door de leverancier gerapporteerde cijfers'.
Guides & Insights

GPT-6 Astra Ultrafast draait op Blackwell: NVIDIA noemt de hardware achter de 8x

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Op 1 oktober 2026 publiceerde NVIDIA een bericht van Dion Harris met de titel "Hoe NVIDIA GPU's GPT-6 Astra Ultrafast van OpenAI helpen versnellen", en de zin die daarin centraal staat is de eerste keer dat een van beide bedrijven heeft gezegd waarop de servicelaag draait: "GPT-6 Astra Ultrafast, draaiend op NVIDIA Blackwell-GPU's, is nu beschikbaar in de OpenAI API en voor gebruikers van ChatGPT Work en Codex die daarvoor in aanmerking komen." Dat is het nieuws, en het is beperkter dan de kop doet vermoeden. GPT-6 Astra, het model, werd op 3 september 2026 uitgebracht. De Ultrafast-servicelaag daarbovenop werd op 29 september 2026 algemeen beschikbaar. De snelheidsclaim — tot 8x snellere tokengeneratie dan de standaardmodus van Astra — was al twee dagen oud toen NVIDIA die herhaalde.

Dat roept de vraag op die de post echt beantwoordt: niet "hoe snel is het", maar "wiens silicium is het."

A screenshot of OpenAI's Ultrafast mode documentation page, showing the sentence 'Our fastest API service tier, with up to 8x faster speeds than Standard mode.', the sentence 'It is broadly available for GPT-6 Astra, with preview access for GPT-5.6 Sol.', the note that Ultrafast for GPT-6 Astra is currently available to all API users at low rate limits with higher limits or Sol preview access requestable through an OpenAI account team, the recommendation to use WebSockets because without a persistent connection network overhead can reduce the latency gains, and a Python code sample setting service_tier to 'ultrafast' with model 'gpt-6-astra'.

Drie dingen die de post eigenlijk toevoegde

Haal de herhaling eruit en de post van 1 oktober levert drie feiten op.

• De hardware — Blackwell. OpenAI's eigen Ultrafast-documentatie, gepubliceerd op 30 september, beschrijft de snelheid van deze tier, de configuratie en de snelheidslimieten, en noemt helemaal geen GPU. De toeschrijving aan het silicium is dus afkomstig van één enkele bron: de hardwareleverancier. Dat maakt het niet onwaar; het maakt het een claim van een leverancier over zijn eigen apparatuur, en het is de moeite waard die als zodanig te bestempelen.

• Twee met naam genoemde ingenieurs — Philippe Tillet, het hoofd inferentie van OpenAI, en Uday Ruddarraju, de chief technology officer voor compute van OpenAI, beiden met naam en toenaam geciteerd over waar de versnelling vandaan kwam.

• Het publiek — "gebruikers van ChatGPT Work en Codex die in aanmerking komen," wat breder is dan de positionering uitsluitend voor de API waarmee deze tier werd gelanceerd. OpenAI's eigen documentatie zegt nog steeds dat Ultrafast voor GPT-6 Astra "beschikbaar is voor alle API-gebruikers met lage snelheidslimieten," en dat voorbehoud over lage limieten is niet officieel ingetrokken.

De twee citaten, en waarom ze het interessante deel vormen

Tillets bijdrage is eerder een loop dan een benchmark. De investering van NVIDIA in tooling en documentatie, zegt hij, "heeft ons in staat gesteld onze modellen uitzonderlijk goed te maken in programmeren," en Astra kan dan "die kennis omzetten in high-performance kernels die NVIDIA-hardware aantrekkelijk maken." Ruddarraju is botter over de richting van het werk: "We gebruikten onze interne modellen om inferentie op NVIDIA GPU's te optimaliseren."

Samen gelezen is dat een bewering over deployment, niet over capaciteit: de frontier-modellen van OpenAI zijn nu goed genoeg in het schrijven van GPU-kernels dat OpenAI ze gebruikt om zijn eigen serving-stack te optimaliseren. Het strookt ook met het enige gedeelte van het bericht van NVIDIA dat helemaal niet over de lanceringsweek gaat — een kop met de tekst "Continually Improving Performance", met het argument dat geïmplementeerde inferentie na verloop van tijd sneller wordt omdat OpenAI zijn eigen modellen blijft richten op de NVIDIA-software waarop het draait.

Niets hiervan is een meting. Het zijn twee ingenieurs die een proces beschrijven, gepubliceerd door het bedrijf dat de GPU's verkocht. De eerlijke lezing is dat het proces plausibel is, makkelijk te geloven, en van buitenaf niet falsifieerbaar — wat ook geldt voor elk snelheidsgetal in dit verhaal.

Blackwell hier, Cerebras daar

Het nuttigste dat deze post doet, is een splitsing blootleggen die niemand heeft uitgelegd. Op 13 augustus 2026 previewde OpenAI een snelle tier bovenop een ander model — GPT-5.6 Sol die "tot 14×" sneller draait — en noemde Cerebras als de partner erachter, met een beschrijving van wafer-scale hardware die tot 750 outputtokens per seconde genereert. Zeven weken later draait de snelle tier bovenop Astra op Blackwell, en het aantal is 8x.

Twee snelle niveaus, twee hardwareantwoorden, een daarvan een gespecialiseerde partner en de andere de grootste leverancier van het bedrijf zelf. Geen van beide leveranciers heeft een vergelijking tussen de twee serveerpaden gepubliceerd, en geen enkele onafhankelijke evaluator heeft een van beide gemeten. Let ook op wat de post van NVIDIA met de tweede naam doet: "Rubin" komt één keer voor, in Tillets citaat over modellen die kernels schrijven voor "Blackwell- en Rubin-GPU's." Het is een uitspraak over wat de modellen van OpenAI kunnen programmeren, niet een uitspraak dat er vandaag iets op Rubin wordt geserveerd.

Het getal dat NVIDIA niet afdrukte

In dit verhaal zit een cijfer dat geen van beide bedrijven naast de 8x heeft gezet, en dat is precies het cijfer dat bepaalt of een team de tier inschakelt. De gepubliceerde Ultrafast-tarievenkaart van OpenAI vermeldt gpt-6-astra voor $60,00 per miljoen inputtokens, $6,00 voor gecachte input, $75,00 voor cache-write en $300,00 voor output. Hetzelfde model in de standaard-tier kost $10,00 en $50,00, met gecachte input tegen $1,00 en cache-write tegen $12,50. Elke kolom is precies zes keer het standaardtarief.

• De vermenigvuldigingsfactor — 6,00x op invoer, uitvoer, gecachede invoer en cacheschrijfactie. Niet "tot". Zes.

• Het maximum — 8x, het getal dat beide leveranciers noemen met "tot" ervoor en zonder vermelde voorwaarden.

• Wat dat betekent — de prijsfactor ligt onder het door deze tier zelf geclaimde beste scenario. Op het plafond is de transactie voordelig; bij alles onder 6x op jouw verkeer betaal je meer per eenheid bespaarde tijd dan de marketing suggereert. Daarom is de enige zinvolle test van deze tier een meting op je eigen aanvragen.

• De long-contextstap — boven 272.000 inputtokens worden de Ultrafast-tarieven $120,00 voor input en $450,00 voor output, zes keer de eigen getrapte tarieven van de standaardlaag.

• De operationele kleine lettertjes — OpenAI documenteert een Ultrafast-ladder van tokens per minuut van 500.000 voor gebruiksniveaus 1 tot en met 3, 1.000.000 voor niveau 4 en 5.000.000 voor niveau 5; Ultrafast ondersteunt alleen datalocatie in de VS en wereldwijde verwerking, zonder een EU- of andere niet-Amerikaanse regionale verwerkingsendpoint; en de documentatie raadt WebSockets aan voor Ultrafast, "vooral voor agentische toepassingen die veel tool calls snel achter elkaar doen", met de waarschuwing dat "zonder een persistente verbinding netwerkoverhead de latentiewinsten kan verminderen".

A screenshot of OpenAI's API pricing page with the Ultrafast tab selected, showing the gpt-6-astra row at $60.00 input, $6.00 cached input, $75.00 cache writes and $300.00 output per 1M tokens for short-context requests, stepping to $120.00 / $12.00 / $150.00 / $450.00 above 272,000 input tokens, alongside gpt-5.6-sol at $4.00 / $0.40 / $5.00 / $20.00 short-context and $8.00 / $0.80 / $10.00 long-context, with the page's notes that regional processing endpoints carry a 10% uplift for models released on or after March 5, 2026, that FedRAMP endpoints carry a further 10%, that Priority processing was renamed Fast mode on July 30, 2026, and that GPT-5.6 Sol's promotional pricing is available at least through November 21, 2026.

Dat laatste punt is het punt waarop actie moet worden ondernomen. Een team dat de tier inschakelt en daaronder HTTP per verzoek in stand laat, heeft zes keer het tarief betaald om een deel van de snelheidswinst terug te geven aan het opzetten van verbindingen — een gedocumenteerde, vermijdbare manier om het geld te verspillen.

Hoe dit er vanaf een enkel eindpunt uitziet

GPT-6 Astra staat op OrcaRouter als openai/gpt-6-astra: een contextvenster van 1.050.000 tokens, tot 128.000 uitvoertokens, invoer van tekst, afbeeldingen en bestanden, en OpenAI's lijstprijs die rechtstreeks wordt doorgegeven tegen $10,00 voor invoer en $50,00 voor uitvoer per miljoen tokens, oplopend naar $20,00 en $75,00 boven 272.000 invoertokens. De benchmark die in de catalogus als hoofdpunt wordt genoemd, is 96,1 op GPQA Diamond.

De Ultrafast-tier staat niet op OrcaRouter, en dat kan ook niet: het is een toegangsgecontroleerd attribuut van een OpenAI-account in plaats van een model-id, en dat is waarom openai/gpt-6-astra-ultrafast model-not-found retourneert. Als je de tier inschakelt, zit die in je directe OpenAI-integratie. Wat een endpoint met meer dan 200 modellen met 0% opslag je in deze situatie oplevert, is niet de snelle route — het is de controle. Omdat de lijstprijs van de provider wordt doorgegeven in plaats van met opslag te worden verkocht, komt een tariefwijziging van OpenAI op dezelfde dag bij ons aan als bij hen, en omdat de standaard Astra-lane er al is, is het experiment dat deze beslissing beslecht één regel configuratie: dezelfde prompt, standaard-tier, en een goedkoper model ernaast, op dezelfde sleutel. Dat komt het dichtst in de buurt van een latentiebenchmark die de meeste teams ooit zullen uitvoeren, en het kost niets om op te zetten.

A screenshot of the OrcaRouter model page for GPT-6 Astra, model id openai/gpt-6-astra, showing a 1,050,000-token context window, 128k maximum output, text, image and file input, public benchmarks attributed to OpenAI dated 2026-09-04, input price $10.00 and output price $50.00 per 1M tokens, p50 time to first token 4.69 s, a 10.00 s figure and 155.1M tokens of traffic, with an OpenAI-compatible Python code sample and the EN language toggle in the header.

Wat is er nog steeds niet gemeten?

Drie dingen zijn vandaag controleerbaar. Het niveau bestaat, staat op de tariefkaart tegen precies zes keer het standaardtarief, en sinds 1 oktober wordt het publiekelijk toegeschreven aan NVIDIA Blackwell GPU's.

Eén ding is het niet: de multiplier voor je verkeer. Geen enkele leverancier heeft een latentieverdeling gepubliceerd voor de tier bij een opgegeven gelijktijdigheidsniveau, en geen enkele derde partij heeft de 8x gereproduceerd. Er is ook geen benchmark die Astra op Ultrafast vergelijkt met Astra op standaard, en er zou geen flatteuze moeten zijn — het is hetzelfde checkpoint op een sneller pad, dus identieke instellingen zouden bij verschillende snelheden identieke antwoorden moeten opleveren. Als jouw twee lanes bij dezelfde prompts uiteenlopen, heb je een bugrapport, geen feature.

Dus de nuttige samenvatting van 1 oktober is kleiner dan de aankondiging doet vermoeden. Het is dezelfde tier tegen dezelfde prijs met hetzelfde niet-geverifieerde snelheidsplafond, nu met een hardwarelabel. Dat label is belangrijk — het vertelt je op welke acceleratorlijn OpenAI dit opschaalt, en het vertelt je dat het verhaal van de snelle tier in minder dan twee maanden is verschoven van een gespecialiseerde partner naar de grootste GPU-leverancier van de sector. Het vertelt je alleen niets over je eigen latentiebudget, en geen enkele post zal dat doen.