Een gegenereerde titelkaart met de kop 'Ultrafast vs Standard', het subkopje 'Eén checkpoint, twee serviceniveaus' en twee badges met de tekst 'dezelfde gewichten, dezelfde antwoorden' en 'alleen het serveerpad verandert'.
Guides & Insights

GPT-6 Astra Ultrafast vs GPT-6 Astra: hetzelfde checkpoint, zes keer de snelheid

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Dit is de zeldzame vergelijking waarin beide kanten hetzelfde zijn. GPT-6 Astra Ultrafast is geen model; het is een servicelaag die wordt toegepast op GPT-6 Astra, het vlaggenschip van het bedrijf, dat op 3 september 2026 is uitgebracht, en de documentatie van het bedrijf vermeldt het mechanisme ronduit: je stelt model in op gpt-6-astra en voegt service_tier: "ultrafast" toe. Er is geen apart model-id, geen apart checkpoint en geen apart contextvenster. Een pagina met de titel GPT-6 Astra Ultrafast vs GPT-6 Astra kan dus geen benchmarkargument zijn, want er is geen tweede set gewichten om te benchmarken — en doen alsof dat wel zo is, zou de gemakkelijkste manier zijn om deze week een misleidend artikel te schrijven.

Wat er te vergelijken valt, is nauwer en nuttiger dan een specificatietabel: de ene tarievenkaart tegenover de andere, de ene beschikbaarheidshouding tegenover de andere, en een verschil in kloktijd waarvan OpenAI de grootte aangeeft als "tot 8x". Sinds Ultrafast for GPT-6 Astra op 29 september 2026 algemeen beschikbaar werd, hebben beide kanten van deze vergelijking eindelijk prijzen, wat niet het geval was in augustus toen de tier alleen in preview was. Dat betekent dat de vraag van vorm is veranderd. Het is niet langer "is deze tier echt", maar "bij zes keer het tarief, wat moet er waar zijn over mijn workload wil de snelle route de juiste aankoop zijn."

De kolommen die verschillen, en de kolom die dat niet doet.

Als je de twee stroken naast elkaar legt, is bijna elke rij per constructie identiek. De rijen die niet identiek zijn, vormen de enige inhoud van dit artikel.

• De checkpoint — identiek. GPT-6 Astra Ultrafast draait op de gewichten van standaard GPT-6 Astra. Hetzelfde samplinggedrag, hetzelfde redeneergedrag, hetzelfde antwoord op dezelfde prompt bij dezelfde effort-instelling.

• Context, uitvoer en invoer — identiek. Een invoervenster van 1.050.000 tokens en een uitvoerplafond van 128.000 tokens aan beide zijden, invoer van tekst, afbeeldingen en bestanden, tekst als uitvoer, en een kennisafsluitdatum van 30 april 2026, ongeacht het niveau.

• Redeneercontrole — identiek. Inspanning kent laag, midden, hoog, xhigh en max aan beide zijden. De tier verandert hoe snel de tokens binnenkomen, niet hoe hard het model nadenkt, dus een xhigh-effort Ultrafast-verzoek is nog steeds een xhigh-effort-verzoek.

• Tariefkaart — anders, en dit is de hele beslissing. Standard rekent $10,00 voor input, $1,00 voor input, $12,50 voor cache-writes en $50,00 voor output per 1M tokens tot 272.000 inputtokens; Ultrafast rekent $60,00 / $6,00 / $75,00 / $300,00. Boven 272K wordt het hele verzoek opnieuw geprijsd naar $20,00 / $2,00 / $25,00 / $75,00 standaard en $120,00 / $12,00 / $150,00 / $450,00 op Ultrafast. Zes keer, op alle vier de regels, in beide contextbanden.

• Toegang — verschillend. Standard is de standaardroute, aanroepbaar door iedereen met een API-sleutel. Ultrafast was een wachtlijst en is nu beschikbaar voor alle API-gebruikers, maar aanvankelijk met lage snelheidslimieten: OpenAI documenteert 500.000 tokens per minuut op API-tiers 1 tot en met 3, 1.000.000 op tier 4 en 5.000.000 op tier 5.

• Geografie — slechts in één richting anders, omdat de beperking aan de tier is gekoppeld. Ultrafast ondersteunt alleen dataresidentie in de VS en wereldwijde verwerking en ondersteunt geen EU- of andere regionale verwerkingsendpoints buiten de VS; de standaardlane kent geen gelijkwaardige beperking.

• Doorvoer — anders, en vermeld als een plafond in plaats van een belofte. De Ultrafast-documentatie van OpenAI beschrijft het niveau als "tot 8x snellere snelheden dan de Standard-modus."

• Benchmarks — geen rij. Er is niets om erin te zetten. Waar een vergelijkingspagina tussen twee modellen een indextabel zou bevatten, staan hier aan beide kanten dezelfde cijfers, en dat is juist het punt, niet een gat in de gegevens.

A screenshot of OpenAI's Ultrafast documentation page, showing the sentence 'Our fastest API service tier, with up to 8x faster speeds than Standard mode.', the sentence 'It is broadly available for GPT-6 Astra, with preview access for GPT-5.6 Sol.', the recommendation to use WebSockets because per-request network overhead can reduce the latency gains, the note that Ultrafast for GPT-6 Astra is available to all API users at low rate limits with higher limits or Sol preview access available through an OpenAI account team, and a Python code sample setting service_tier to 'ultrafast' with model 'gpt-6-astra'.

De crossover, goed uitgevoerd

Omdat de vermenigvuldiger een vaste factor van 6x is, komt de beslissing neer op één ongelijkheid, en het is de moeite waard om die uit te schrijven in plaats van er slechts vaag naar te verwijzen. Ultrafast is de juiste aankoop wanneer de waarde van eerder afronden groter is dan zes keer de tokenrekening. Al het andere is commentaar.

Neem een concreet voorbeeld: een agentische pass die een repositorycontext van 100.000 tokens verwerkt en een patch van 5.000 tokens produceert, waarbij de repository-inhoud tussen pogingen in de cache wordt bewaard. Bij de standaarddienst kost de cache-read $0,10, de nieuwe input $0,10 en de output $0,25 — $0,45 per poging. Bij Ultrafast kost dezelfde poging $0,60, $0,60 en $1,50 — $2,70. Het verschil is $2,25 per poging. Als snelheid niets anders doet dan elke poging sneller te laten eindigen en het aantal pogingen ongewijzigd blijft, heb je $2,25 per poging betaald voor latentie, en de enige rechtvaardiging is de waarde van de wachttijd.

Laat de snelheid nu het werk doen. Als de snellere baan betekent dat de eerste pass van het model vaker slaagt omdat het niet tegen een trage round trip vecht, en het aantal passes daalt van drie naar één, dan kost standard $1,35 voor de taak tegenover Ultrafast's $2,70. Nog steeds duurder — maar slechts 2x, niet 6x, en nu is de vraag of twee dollar het verschil waard is tussen één interactieve cyclus en een reeks daarvan.

Dat is het rekenwerk dat teams overslaan, en de verleiding om het over te slaan werkt in beide richtingen. Een vaste 6x op elke regel laat de tier uniform duur lijken, wat onjuist is wanneer daardoor beurten wegvallen. En de kop 'tot 8x' laat hem uniform goedkoop lijken, wat onjuist is wanneer dat niet gebeurt. Het getal dat de doorslag geeft, is gefactureerde beurten per voltooide taak, gemeten op je eigen traces, vermenigvuldigd met het tarief. Als die verhouding de zes niet nadert, is Ultrafast een latentie-aankoop en moet dat als zodanig worden goedgekeurd, met een mens met een naam aan de andere kant van het wachten.

Wat "tot 8x" wel en niet dekt.

De gepubliceerde snelheidsclaim is een plafond voor de uitvoer-doorvoer, en het verwarren van doorvoer met latentie is de meest voorkomende fout die over deze tier wordt gemaakt.

Doorvoer is tokens per seconde zodra de generatie draait. Latentie is de tijd tussen het verzenden van een verzoek en het hebben van het antwoord. Ultrafast verbetert het eerste. OpenAI's eigen documentatie wijst op het tweede als een afzonderlijk probleem en beveelt WebSockets voor Ultrafast sterk aan, juist omdat netwerkoverhead per verzoek de latentiewinst kan uithollen — een advies dat overbodig zou zijn als de tier round trips gratis zou maken. Twee andere stukken van de kloktijd vallen volledig buiten de tier: de tijd die je eigen orkestratie tussen aanroepen doorbrengt, en de tijd die een toolaanroep kost op de servers van iemand anders. Voor één lange generatie is doorvoer het grootste deel van het verhaal. Voor een agentlus van twintig stappen is het een fractie daarvan, en juist daarom is het rekenwerk met het aantal beurten hierboven belangrijker dan de 8x-headline.

A screenshot of the OrcaRouter model page for GPT-6 Astra, model id openai/gpt-6-astra, showing a 1M-token context window, 128K maximum output, text, image and file input, text output, public benchmarks attributed to OpenAI dated 2026-09-04, input price $10.00 and output price $50.00 per 1M tokens, p50 time to first token 4.69 s, a 10.00 s figure, and 155.1M tokens of traffic, with the page's code sample and EN language toggle visible in the header.

Ter kalibratie: kijk naar het niveau eronder. Fast mode, op 30 juli 2026 hernoemd van Priority processing, is geprijsd op 2x standaard en volgens de documentatie tot 2,5x sneller. Ultrafast is geprijsd op 6x standaard en volgens de documentatie tot 8x sneller. De stap van Fast naar Ultrafast is dus 3x het geld voor ongeveer 3,2x de snelheid — een bijna lineaire ruil. De meerprijs ten opzichte van standaard is niet superlineair; hij is simpelweg groot, en is alleen beschikbaar voor deze ene modelfamilie. De prijstabel voor Ultrafast van OpenAI heeft één rij, en die is gpt-6-astra, wat betekent dat het niveau een capaciteit van het huidige vlaggenschip is, in plaats van een algemene keuze op serviceniveau voor de hele lijn.

Twee workloads, één model

De zuiverste manier om deze vergelijking te hanteren is te stoppen met de vraag of Ultrafast beter is en te beginnen met de vraag welke van twee vormen je verzoek heeft.

De eerste vorm is iemand die wacht. Incidenttriage terwijl een storing zich ontvouwt, een supportescalatie waarbij een klant aan de lijn is, een analist die binnen één sessie blijft itereren — dit zijn workloads waarbij het antwoord dat binnen twintig seconden in plaats van twee minuten arriveert, verandert wat de persoon hierna kan doen, en waarbij de totale tokenrekening klein is omdat het aantal beurten klein is. Een 6x-tarief op een handvol beurten is een afrondingsfout naast de kosten van de persoon die daar zit. Dit is waar de tier duidelijk correct is, en het is de vorm die het eigen previewmateriaal van OpenAI beschreef.

De tweede vorm is een machine op een schema. Een nachtelijke herindexering, een bulkclassificatieronde, een rapport dat 's ochtends klaar moet zijn, een backfill. Geen van deze kan latentie waarnemen. Ze worden allemaal gedomineerd door het tokenaantal. En ze hebben allemaal een betere optie op dezelfde tariefkaart: Batch en Flex, geprijsd op 50% van de standaardprijs, of $5,00 input en $25,00 output per miljoen voor GPT-6 Astra tot 272K. Zes keer zoveel betalen om een taak sneller te laten afronden waar niemand naar kijkt, terwijl er een halve-prijsbaan bestaat, is de duurste fout die in deze tabel beschikbaar is.

De derde vorm is de dubbelzinnige, en het is degene die de meeste engineeringteams feitelijk hebben: de agentische lus. Dat is waar de crossover-rekenkunde de beslissing neemt in plaats van een vuistregel, en waar de meting goedkoop genoeg is dat er geen excuus is om te gissen — instrumenteer het aantal beurten per voltooide taak op beide sporen, vermenigvuldig met het tarief, en vergelijk de totalen. De antwoorden van GPT-6 Astra zijn aan beide kanten hetzelfde, dus elk verschil in beurten is een verschil in hoe lang het model erover deed, niet in wat het produceerde, wat dit een zuiver experiment maakt in plaats van een vertroebeld experiment.

De standaardbaan kopen

Het loont om twee dingen te onderscheiden die de term "Ultrafast pricing" doorgaans vertroebelt: de prijs van de tier en de prijs van het model. Standaard GPT-6 Astra is een routeerbaar model, en op OrcaRouter is het live als openai/gpt-6-astra tegen het eigen tarief van de provider — $10,00 input, $1,00 gecachte input en $50,00 output per miljoen tokens, met de gedocumenteerde long-contextstap naar $20,00 / $2,00 / $75,00 boven 272.000 inputtokens. Het wordt aangeboden met 0% opslag, wat betekent dat de lijstprijs van de provider ongewijzigd wordt doorgegeven en dat een tariefwijziging van de leverancier dezelfde dag nog op uw factuur terechtkomt in plaats van bij de volgende contractverlenging, en dezelfde sleutel geeft toegang tot meer dan 200 andere modellen, zodat een evaluatie die met Astra begint kan worden uitgebreid naar een concurrent zonder een tweede integratie.

De Ultrafast-tier zelf is niet iets dat wij routeren, en de reden is structureel in plaats van commercieel: het is geen model. Het is een toegangsgecontroleerde service-tier-flag die OpenAI toepast op zijn eigen model-id en op je account factureert, per verzoek ingeschakeld door de aanroeper. De scheidslijn is dus helder — als je Ultrafast aanzet, leeft het in je directe OpenAI-integratie, en het standard-tier-verkeer dat je daarnaast draait is precies het soort ding waarvoor een pass-through gateway bedoeld is. Die grens precies benoemen is nuttiger dan een alinea die suggereert dat de snelle route via ons beschikbaar is.

A screenshot of OpenAI's API pricing page with the Ultrafast tab selected, showing gpt-6-astra at $60.00 input, $6.00 cached input, $75.00 cache writes and $300.00 output per 1M tokens for short-context requests, stepping to $120.00 / $12.00 / $150.00 / $450.00 above 272,000 input tokens, alongside gpt-5.6-sol at $4.00 / $0.40 / $5.00 / $20.00 short-context and $8.00 / $0.80 / $10.00 long-context, with the page's notes that data-residency endpoints carry a 10% uplift for models released on or after March 5, 2026, that FedRAMP carries a further 10%, that Priority processing was renamed Fast mode on July 30, 2026, and that GPT-5.6 Sol's promotional pricing is available at least through November 21, 2026.

De onderste lijn, die korter is dan de pagina

GPT-6 Astra Ultrafast en GPT-6 Astra zijn één model met twee tariefkaarten. De tier verandert wanneer je het antwoord krijgt, niet wat het is — dezelfde gewichten, hetzelfde venster van 1.050.000 tokens, hetzelfde outputplafond van 128.000 tokens, dezelfde effort-instellingen en dezelfde kennisafsluitdatum, tegen tot 8x de outputdoorvoer voor precies 6x de prijs op elke regel, onderworpen aan lage initiële snelheidslimieten en een residentiebeperking tot alleen de VS die de standaardroute niet heeft. Koop het waar iemand wacht of waar de snelheid aantoonbaar gefactureerde beurten wegneemt, sla het over waar de taak volgens een schema draait en Batch of Flex beschikbaar is tegen de helft van het standaardtarief, en meet het aantal beurten in plaats van het aan te nemen. Het enige wat deze vergelijking je niet kan vertellen, is welk model beter is, want er heeft altijd maar één model in gezeten.