
GPT-6 Astra API: de model-ID, het endpoint en wat een langdurige taak daadwerkelijk kost
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
The short version: GPT-6 Astra is callable today at https://api.openai.com/v1 under a single model id, gpt-6-astra, at $10.00 per million input tokens, $1.00 cached input and $50.00 output — the figures OpenAI's own pricing page carried on September 16, 2026. The model itself is from September 3, 2026, thirteen days before this page was written, so nothing here is launch coverage and nothing here is framed as an announcement. This is the reference page for the developer question that comes after availability: what string to pass, which endpoint takes it, what the 1,050,000-token window really buys, what the account has to look like first, and what one genuine long-horizon agent run costs on a rate card that quietly reprices itself above 272,000 input tokens. GPT-5.6 Sol appears throughout only as the price baseline it is sold above, never as the subject.
De reden dat een dertien dagen oud model deze week een pagina verdient, is dat de routes ernaartoe veranderden nadat de lancering dat deed, en dat de API-route nu de gewone route is. Toen OpenAI Astra op 3 september uitbracht, beschreef het een uitrol in plaats van een beschikbaarheid; tegen 8 september zei het dat het model volledig was uitgerold naar Plus-, Pro-, Business- en Enterprise-gebruikers in Codex en ChatGPT Work, en in de week van 14 september vermeldde AWS het op Bedrock en bood Microsoft Foundry het algemeen beschikbaar aan. Voor wie de API aanroept, maakt die volgorde minder uit dan het klinkt — het endpoint is de hele tijd live en gedocumenteerd geweest — maar het betekent wel dat de inkoopvragen eromheen nu antwoorden hebben die ze op de dag van de lancering niet hadden. Alles hieronder is op 16 september 2026 gelezen uit OpenAI's eigen modeldocumentatie, prijzenpagina en pagina over gegevensbeheer, en alles wat ergens anders vandaan komt, zegt dat in de zin waarin het staat.
Het model-id en de snapshotvraag eerlijk beantwoord.
De string die moet worden doorgegeven is gpt-6-astra — kleine letters, met koppeltekens, geen leveranciersprefix. Dat is de enige id die OpenAI voor dit model documenteert.
Als je een gedateerde snapshot zoekt om vast te pinnen, is die er niet te vinden, en we gaan geen plausibel uitziend achtervoegsel verzinnen. De modelpagina van OpenAI voor GPT-6 Astra vermeldt precies één vermelding onder Snapshots, en dat is het kale gpt-6-astra. Er is geen -2026-09-03-achtige gedateerde vorm en geen -latest-alias aan de kant van de leverancier. Tijdens onderzoek zagen we een bewegende alias van de vorm ~openai/gpt-astra-latest in een routervermelding; dat is een gateway-constructie die bovenop het leveranciers-id is gebouwd, niet iets wat OpenAI publiceert, en het zou niet in je config moeten belanden alsof het er wel een is.
Het praktische gevolg is klein, maar het is het vermelden waard. Je kunt het modelobject ophalen om te bevestigen met welk model je communiceert:
curl https://api.openai.com/v1/models/gpt-6-astra -H "Authorization: Bearer $OPENAI_API_KEY"
Zet de kale id vast in een configuratiewaarde in plaats van hem op een stuk of twaalf call sites te typen. Als OpenAI later gedateerde snapshots toevoegt, wordt de kale id het bewegende doel en je vastgezette waarde begint onder je voeten te veranderen — één plek om te bewerken is het verschil tussen een wijziging van twee minuten en een middag grep'en.
Het eindpunt: basis-URL, compatibiliteit en een verzoek dat werkt.
The base URL is https://api.openai.com/v1. Per OpenAI's model documentation, GPT-6 Astra is supported on Responses (/v1/responses), Chat Completions (/v1/chat/completions) and Batch (/v1/batch). It is explicitly not supported on Realtime, Assistants, Fine-tuning, Embeddings, image generation and editing, video, audio, moderation, or the legacy Completions endpoint — and those absences matter as much as the presence list, because a team that planned around the Assistants API or a fine-tuned variant has to replan rather than rewrite.
Over compatibiliteit: dit is de eigen first-party API van OpenAI, het wire-formaat waartegen elke OpenAI-compatibele SDK en client is geschreven. Alles wat dat formaat spreekt, praat zonder shim met gpt-6-astra — je wijzigt de modelstring en, als je migreert vanaf een ouder OpenAI-model, de parameternamen hieronder. Voor nieuw werk kun je het beste de Responses API gebruiken: het is de interface waarop OpenAI de reasoning-besturing van dit model documenteert, het is waar de ingebouwde tools zich bevinden, en de Chat Completions-ondersteuning voor de nieuwste modellen is historisch gezien de minder diepgaande van de twee geweest.
Een minimale streamingaanroep, met reasoning effort ingesteld:
curl https://api.openai.com/v1/responses \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model": "gpt-6-astra", "input": "Noem de bestanden die je zou wijzigen om deze service van de verouderde auth-API af te halen.", "reasoning": {"effort": "high"}, "max_output_tokens": 16000, "stream": true}'
En hetzelfde in Python, waar de meeste lezers zich in de praktijk zullen bevinden:
from openai import OpenAI
client = OpenAI()
stream = client.responses.create(model="gpt-6-astra", input="Noem de bestanden die je zou wijzigen om deze service van de legacy auth-API af te halen.", reasoning={"effort": "high"}, max_output_tokens=16000, stream=True)
for event in stream:
if event.type == "response.output_text.delta": print(event.delta, end="")
Drie dingen aan dat verzoek zijn specifiek voor dit model in plaats van gekopieerd uit een generieke quickstart.
• Reasoning-inspanning is een kostenknop, niet alleen een kwaliteitsknop. De modelpagina van OpenAI vermeldt de ondersteunde waarden als low, medium, high, xhigh en max. Let op waar die lijst begint: er is geen none of minimal voor GPT-6 Astra, dus de ondergrens is omhooggegaan. Reasoning-tokens worden gefactureerd als outputtokens tegen $50,00 per miljoen, wat betekent dat het verzetten van de inspanning van high naar max een beslissing met een prijskaartje is, niet een gratis kwaliteitsupgrade.
• Streaming wordt ondersteund, en het is de eerlijke manier om lange beurten uit te voeren. Een enkele aanvraag op dit model kan tot 128.000 uitvoertokens genereren. Wachten tot dat in één responsbody aankomt, zonder zicht op of het vordert, is hoe je uiteindelijk moet gokken bij time-outs.
• Prompt-caching is hier expliciet. De Responses API documenteert een prompt_cache_breakpoint op tekst-, afbeeldings- en bestandsinhoud, met een modus explicit, die "het exacte einde van een herbruikbaar prompt-prefix" markeert en zijn TTL erft van de prompt_cache_options.ttl van het verzoek. Bij een model waarvan het tarief voor gecachte input een tiende bedraagt van het niet-gecachte tarief, is de plek waar je die grens legt de regel met de grootste impact in je verzoek.

Wat een tokenvenster van 1.050.000 tokens echt betekent
De gedocumenteerde cijfers zijn een contextvenster van 1.050.000 tokens, een maximale invoer van 922.000 tokens, een maximale uitvoer van 128.000 tokens en een kennisafsluitdatum van 30 april 2026.
Begin met de rekensom die mensen over het hoofd zien: 922.000 plus 128.000 is 1.050.000. Het venster wordt gedeeld tussen wat je verstuurt en wat het model mag terugsturen, en het uitvoerplafond is daarvan afgereserveerd. Je kunt geen 1.050.000 tokens aan invoer versturen; het praktische plafond voor één verzoek is 922.000, en minder dan dat als je ruimte wilt voor een echt antwoord.
Wat koop je voor een miljoen tokens in de eenheden waarin je daadwerkelijk werkt? Conversies van tokens naar tekst zijn benaderingen, en deze zijn van ons, niet van OpenAI, maar ze zitten in de juiste orde van grootte: bij ongeveer vier tekens per token is 1.050.000 tokens in de orde van grootte van 750.000 woorden, of zoiets als honderdduizend regels code. Dat is een middelgrote repository, in zijn geheel, met nog ruimte over voor de tool-uitvoer die een agent genereert terwijl hij werkt. Het langetermijnscenario waarvoor het model wordt verkocht, is precies dit: een agent die een uur geleden een bestand heeft gelezen en nog steeds kan zien wat erin stond, in plaats van een agent die de ochtend heeft samengeperst tot een samenvattingsalinea.
Dan het deel dat op een kostenpagina thuishoort en niet op een specificatiepagina. De modeldocumentatie van OpenAI stelt dat prompts met meer dan 272.000 invoertokens worden geprijsd tegen 2x de invoer- en cachetarieven en 1,5x de uitvoer voor het volledige verzoek. De prijzenpagina vermeldt het als een tweede rij: lange context op GPT-6 Astra bedraagt $20,00 voor invoer, $2,00 voor gecachte invoer en $75,00 voor uitvoer. Dus de bovenste driekwart van dat venster is een prijsband, niet alleen speelruimte. Een run waarvan het transcript boven 272.000 tokens ligt, betaalt het dubbele voor elke invoertoken — inclusief de gecachte — voor het hele verzoek, en dat is de grootste individuele schommeling in de economie van dit model. Hieronder wordt het volledig uitgewerkt.
Nog een mechanisme dat het kennen waard is, want het is de eigen erkenning van de leverancier dat één venster niet het hele antwoord is. Voor Codex beschrijft OpenAI een experimentele contextaanpak die met Astra wordt meegeleverd, waarbij notities over contextvensters heen bewaard blijven in plaats van herhaaldelijk te worden samengeperst tot één samenvatting, en eerdere vensters doorzoekbaar blijven zodat vereisten en testresultaten uit eerdere berichten en tool-uitvoer vindbaar blijven. OpenAI noemt het experimenteel, zegt dat het is ingeschakeld in de Codex config.toml, en zegt dat het de standaard voor Astra zal worden. Als je het equivalent zelf op de API bouwt, is dat de vorm om te kopiëren: duurzame notities plus opvraagbare geschiedenis, in plaats van één heroïsche prompt.
En de beperking van het getal zelf: een groot venster is een capaciteit, geen garantie dat de aandacht het hele venster beslaat. De door de leverancier gerapporteerde cijfers voor de lange horizon zijn een betere leidraad voor gedrag dan het aantal tokens — OpenAI rapporteert OSWorld 2.0 op 72,6% bij ongeveer 40 minuten per taak, en Terminal-Bench 4.0 op 57,9% tegenover 37,3% voor GPT-5.6 Sol. Dat zijn de eigen cijfers van OpenAI, niet door ons gereproduceerd, en het onafhankelijke beeld komt dicht in de buurt maar is niet identiek: Artificial Analysis mat Astra op 59,1% op Terminal-Bench v4.0 tegenover 52,0% voor Claude Fable 5.1 en 39,9% voor GPT-5.6 Sol. Beide zijn het erover eens dat de kloof op de lange horizon ten opzichte van de vorige generatie echt is; geen van beide is een vervanging voor het uitvoeren van je eigen taak.
Invoermodaliteiten, en de vraag over het bestand eerlijk open gelaten
Op de modelpagina van OpenAI staan de invoermodaliteiten tekst en afbeelding, met tekstuitvoer. Geen audio, geen video, geen beeldgeneratie bij dit model.
Afbeeldingsinvoer gaat mee als een contentonderdeel in een gebruikersbericht. Het onderdeeltype is input_image, en de afbeelding wordt aangeleverd als een volledig gekwalificeerde URL of een base64-data-URL op image_url, of als een file_id van de Files API. Er is een optionele detail met de waarden auto, low, high of original, die standaard op auto staat. De vorm is:
{"model": "gpt-6-astra", "input": [{"role": "user", "content": [{"type": "input_text", "text": "wat is er veranderd in deze schermafbeelding?"}, {"type": "input_image", "image_url": "data:image/png;base64,...", "detail": "high"}]}]}
In OpenAI's visiedocumentatie staan PNG, JPEG, WEBP en niet-geanimeerde GIF vermeld als geaccepteerd, tot 512 MB totale payload per verzoek en tot 1.500 afbeeldingen per verzoek, waarbij afbeeldingen met meer dan 30.000 patches worden geweigerd in plaats van verkleind. Dat zijn de algemene visielimieten van het platform, niet specifiek die van Astra, en afbeeldingen worden als tokens gefactureerd, net als elke andere invoer.
Nu de vraag waarmee lezers daadwerkelijk aankomen, en het eerlijke antwoord. Kun je bestanden of pdf's versturen? We konden documentinvoer voor dit model niet bevestigen in de documentatie van OpenAI, en we gaan niet suggereren dat het werkt. De Responses API definieert wel een input_file-contentonderdeel, dus de infrastructuur bestaat in de API in het algemeen; maar de pagina van OpenAI voor GPT-6 Astra vermeldt tekst en afbeelding als invoermodaliteiten en vermeldt geen bestand, en we vonden geen verklaring van OpenAI die PDF-invoer voor dit endpoint documenteert. Een routervermelding voor hetzelfde model toont wel bestand naast tekst en afbeelding — zie dat als door de router gerapporteerd, wat een router over een route vastlegt, niet wat de leverancier garandeert. Als het inlezen van documenten essentieel is voor je workload, test het dan tegen het echte endpoint voordat je erop bouwt, en houd een OCR-naar-tekst-fallback achter de hand. Dat is het verschil tussen een middag testen en een herschrijving.
De volledige prijslijn, en één langetermijnrun doorgerekend
Elk getal in deze sectie is overgenomen van OpenAI's eigen prijzenpagina op 16 september 2026, en alle getallen zijn per miljoen tokens op het Standardniveau, tenzij de regel anders vermeldt.
• Korte context, tot 272K invoer — $10,00 invoer, $1,00 in cache opgeslagen invoer, $12,50 schrijven naar cache, $50,00 uitvoer.
• Lange context, boven 272K invoer — $20.00 invoer, $2.00 gecachte invoer, $25.00 cacheschrijven, $75.00 uitvoer, toegepast op het volledige verzoek.
• Batch en Flex — de helft van Standard: $5.00 / $0.50 / $6.25 / $25.00 korte context, $10.00 / $1.00 / $12.50 / $37.50 lange context.
• Snelle modus — dubbele Standard: $20,00 / $2,00 / $25,00 / $100,00 korte context, $40,00 / $4,00 / $50,00 / $150,00 lange context. OpenAI merkt op dat Snelle modus niet beschikbaar is voor GPT-6 Astra met EU-dataresidentie.
• Gegevensresidentie — eindpunten die hiervan gebruikmaken, rekenen een opslag van 10% voor modellen die op of na 5 maart 2026 zijn uitgebracht. GPT-6 Astra komt in aanmerking, dus een implementatie met gegevensresidentie ligt 10% boven elk hierboven genoemd getal.
De regel die je moet internaliseren is het tarief voor gecachte invoer. $1,00 tegenover $10,00 is een korting van 90% op het deel van de prompt dat je opnieuw verstuurt — en bij een agent-workload is dat bijna de hele prompt. Cache-writes worden gefactureerd tegen $12,50, oftewel 1,25x het tarief voor niet-gecachte invoer, dus het break-evenpunt is simpel: 100.000 tokens die tweemaal ongecacht worden verzonden, kosten $2,00, terwijl het eenmaal wegschrijven van die prefix en het eenmaal teruglezen ervan $1,35 kost. Caching loont vanaf het tweede hergebruik, en een agent die honderd beurten met hetzelfde transcript werkt, hergebruikt het honderd keer.
Wat ons brengt bij de rekensom die daadwerkelijk bepaalt of dit model betaalbaar is, want het headline-tarief is niet het getal dat op de factuur belandt. Hier is een gemodelleerde run — de onze, gebaseerd op de gepubliceerde tarieven van OpenAI, geen gemeten factuur — voor het soort taak waarvoor het model wordt verkocht: een autonome coding-agent die een paar uur werkt aan een migratie op reponiveau, 120 modelaanroepen, een transcript van het werk dat, naarmate het zich opbouwt, gemiddeld ongeveer 500.000 invoertokens per aanroep telt, 80% van die invoer uit cache geleverd, en 400.000 uitvoertokens over de hele run, inclusief redeneren.
Bij Standard-tarieven voor korte context:
• Niet-gecachte invoer — 12 mln. tokens × $ 10,00 = $ 120,00
• Gecachte invoer — 48M tokens × $1,00 = $48,00
• Uitvoer — 0,4M tokens × $50,00 = $20,00
• Totaal ≈ $ 188,00 voor de run
Dezelfde run in de long-contextband, wat een transcript dat boven 272.000 tokens per aanroep uitkomt daadwerkelijk krijgt:
• Niet-gecachte invoer — 12M tokens × $20,00 = $240,00
• Gecachte invoer — 48M tokens × $2,00 = $96,00
• Uitvoer — 0,4M tokens × $75,00 = $30,00
• Totaal ≈ $366,00 voor de run
Daaruit volgen twee conclusies, en geen van beide blijkt uit het gepubliceerde tarief. Ten eerste, waar je transcript zich bevindt, weegt net zo zwaar als welk model je kiest — de identieke taak wordt ongeveer twee keer zo duur, afhankelijk van of deze de drempel van 272K overschrijdt, waardoor contextdiscipline (de juiste 100K ophalen in plaats van 600K meedragen) bij dit model een techniek voor kostenbeheersing is, niet alleen voor prestaties. Ten tweede, caching is meer waard dan de korting doet vermoeden: zonder enige cachehits bevat het eerste scenario $600,00 aan input in plaats van $168,00, en kost de run ongeveer $620 in plaats van $188. Schakel caching in voordat je de reasoning-inspanning opvoert.
Voor de basislijn komt dezelfde tokenmix op GPT-5.6 Sol tegen de tarieven die de prijspagina van OpenAI op 16 september toonde — $4,00 invoer, $0,40 gecachete invoer, $20,00 uitvoer bij korte context — uit op ongeveer $75,20, en bij Sol's lange-contextrij ($8,00 / $0,80 / $30,00) ongeveer $146,40. Dat maakt deze run ongeveer 2,5x in beide banden. Twee kanttekeningen bij die factor, want die heeft elders al voor verwarring gezorgd: Sol's getal is een promotietarief — OpenAI zegt dat de promotie ten minste tot 21 november 2026 beschikbaar is — terwijl dat van Astra het lijsttarief is, dus de factor meet de twee huidige tariefkaarten in plaats van een stabiel feit over de modellen, en hij wordt kleiner als de promotie afloopt. En de oudere "2,5x" die voor Astra circuleert, wordt soms berekend tegen Sol's lijsttarief van vóór de promotie van $5,00/$30,00, wat 2x op invoer en ongeveer 1,67x op uitvoer geeft. Geef aan welk Sol-tarief je bedoelt, anders is het getal waardeloos.
Nog één regel: de Batch-tier halveert dat allemaal, waardoor de eerste run op ongeveer $94 uitkomt. Of je die kunt gebruiken, hangt af van de volgende sectie.

Zero Data Retention, en de korting die zichzelf diskwalificeert
OpenAI stelt dat Zero Data Retention beschikbaar is voor in aanmerking komende API-klanten op ondersteunde eindpunten, onder voorbehoud van goedkeuring — en beide helften van die zin doen er echt toe. Het is geen selfservice-schakelaar: geschiktheid is onderworpen aan voorafgaande goedkeuring door OpenAI en acceptatie van aanvullende vereisten, en je start het door met sales te praten. Zodra het is goedgekeurd, wordt het geconfigureerd op organisatie- of projectniveau onder Settings → Organization → Data controls, op het tabblad Data Retention, waar een project de organisatiestandaard kan overnemen, ZDR expliciet kan instellen, Modified Abuse Monitoring kan selecteren of beide kan uitschakelen.
Wat het in de praktijk verandert: ZDR sluit klantinhoud uit van logboeken voor misbruikmonitoring, waarmee de standaardbewaartermijn van maximaal 30 dagen komt te vervallen, en de parameter store op /v1/responses en /v1/chat/completions wordt als false behandeld, zelfs als een verzoek probeert deze op true te zetten.
Het detail dat er het meest toe doet op een pagina over kosten: /v1/batches staat niet op de lijst met voor ZDR in aanmerking komende endpoints. OpenAI's pagina over datacontroles vermeldt het als niet in aanmerking komend, waarbij de applicatiestatus wordt bewaard tot deze wordt verwijderd. Op GPT-6 Astra sluiten de 50%-korting van de Batch-tier en Zero Data Retention elkaar dus uit — een compliancegebonden workload die ZDR nodig heeft, kan beter rekenen met het Standard-tarief dan met het batchtarief, en het bedrag van $94 hierboven is daarvoor niet beschikbaar.
Drie extra kanttekeningen, ronduit gesteld, want een pagina die ZDR te veel aanprijst is erger dan een pagina die het weglaat. ZDR is niet absoluut: onder "Eyes Off" behoudt OpenAI zich het recht voor om modellen voor specifieke klanten niet in aanmerking te laten komen voor ZDR, met voorafgaande schriftelijke kennisgeving, en onder "Safety Retention" kan content worden bewaard en door mensen worden beoordeeld wanneer classificatoren een ernstig risico signaleren. Afbeeldings- en bestandsinvoer die als mogelijke CSAM zijn gemarkeerd, worden zelfs onder ZDR bewaard voor handmatige beoordeling. En ZDR stopt bij de grens van OpenAI — als je agent een externe MCP-server of de API van een andere leverancier aanroept, valt dat verkeer onder het bewaarbeleid van die partij, niet onder dit beleid. Los daarvan is dataresidentie een andere beheersmaatregel dan ZDR, vereist deze een eigen goedkeuring en een wijziging inzake Modified Retention buiten de Verenigde Staten, en gaat ze gepaard met de hierboven genoemde verhoging van 10%. Als je onder ZDR op caching vertrouwt, lees de datacontroleregels van OpenAI om te zien wat caching bewaart; wij gaan er geen retentiecijfer voor afdrukken dat we daar zelf niet konden lezen.
Snelheidslimieten zoals gedocumenteerd, en degene die het eerst toeslaat
De modelpagina van OpenAI publiceert deze limieten per tier voor GPT-6 Astra — aanvragen en tokens per minuut, en dan de limiet voor de batchwachtrij:
• Niveau 1 — 500 RPM, 500.000 TPM, batchwachtrij 1.500.000
• Niveau 2 — 5.000 RPM, 1.000.000 TPM, batchwachtrij 3.000.000
• Niveau 3 — 5.000 RPM, 2.000.000 TPM, batchwachtrij 100.000.000
• Niveau 4 — 10.000 RPM, 4.000.000 TPM, batchwachtrij 200.000.000
• Niveau 5 — 15.000 RPM, 40.000.000 TPM, batchwachtrij 15.000.000.000
Twee limieten die we als niet gedocumenteerd zullen benoemen in plaats van ze in te vullen: er is geen gepubliceerde limiet voor het gratis niveau, omdat GPT-6 Astra helemaal niet op het gratis niveau zit; en we vonden geen gepubliceerde bovengrens boven Tier 5 en geen aparte limiettabel voor Fast mode. Als een leverancier geen limiet heeft gepubliceerd, beschouw het ontbreken dan als onopgelost — ga er niet van uit dat het onbeperkt is.
Het getal dat een agentworkload het eerst parten speelt, is de 500.000 TPM van Tier 1. Eén enkele aanroep op dit model kan een transcript van 500.000 tokens verwerken, wat betekent één aanvraag een hele minuut van je tokenbudget op het instapniveau kan verbruiken. Een contextvenster van een miljoen tokens is niet erg nuttig voor een agent die hetzelfde transcript gedurende 120 beurten bezet houdt als de tier de tokens niet kan doorvoeren. Stem de tier af op het tokenvolume uit het uitgewerkte voorbeeld hierboven, niet op het aantal aanvragen — en let op: tierverhoging hangt af van bestedingen en accountgeschiedenis, dus het is de moeite waard om dat vóór een deadline te regelen in plaats van er middenin.
Azure en AWS Bedrock, elk één regel
• Microsoft Azure — GPT-6 Astra kan in Microsoft Foundry worden uitgerold onder dezelfde id gpt-6-astra, waarbij Foundry-dekking de algemene beschikbaarheid op begin september 2026 dateert en melding maakt van Global Standard- en US Data Zone-implementaties, geen EU Data Zone bij de lancering, en tarieven op of nabij de lijstprijs van OpenAI met een rij voor lange context. We lezen dat uit Foundry-dekking, niet van Microsofts eigen cataloguspagina, die we vandaag niet konden bereiken — verifieer de huidige implementatielijst, regioset en tarief op Microsofts eigen documentatie voordat u een implementatie erop plant.
• AWS Bedrock — vermeld als openai.gpt-6-astra, beschikbaar via ondersteunde Bedrock-API's en bevestigd in de wekelijkse roundup van AWS van 15 september 2026, met de eigen governance-perimeter van Bedrock (VPC-endpointisolatie, KMS-versleuteling, Guardrails) en de verklaring van AWS dat inferentiegegevens niet voor modeltraining worden gebruikt. Voor gerapporteerde in-regio- en geografische cross-region-inferentie op Bedrock wordt 10% bovenop de basistarieven gerekend; dat cijfer is in onze lezing uit tweede hand, dus controleer de eigen prijspagina van AWS.
Geen van beide routes verandert het model. Beide veranderen de inkoop, en voor een zakelijke lezer is dat precies het punt: een Foundry- of Bedrock-implementatie kan binnen een bestaande cloudcommitment vallen, de bijbehorende IAM, logging en netwerkgrens overnemen en op een factuur belanden die finance al heeft goedgekeurd — vaak het verschil tussen een pilot en iets dat daadwerkelijk in productie gaat. De keerzijde is dat je de modellifecycle van de cloud en het tarief van de cloud overneemt, en beide clouds worden gerapporteerd op of boven OpenAI's lijstprijs in plaats van eronder.
Waar een router past, inclusief de onderdelen die ertegen pleiten
GPT-6 Astra staat in de OrcaRouter-catalogus als openai/gpt-6-astra, en OrcaRouter geeft de lijstprijs van de provider door tegen 0% opslag — de prijs van de leverancier is onze prijs, en een prijswijziging van de leverancier komt dezelfde dag op uw factuur terecht in plaats van bij de verlenging. Bij een model in deze prijsklasse is dat geen kwestie van afrondingsfouten: de rekensom hierboven is dezelfde rekensom die u rechtstreeks zou betalen.

Het eerlijke argument voor routering is hier niet de prijs, maar de omkeerbaarheid. Astra is ongeveer 2,5x zo duur als het model eronder, en de kosten schommelen op basis van een drempel die je architectuur bepaalt, dus de meeste teams willen het uitproberen op een deel van het echte verkeer voordat ze een productiepad vastleggen. Via één sleutel kun je het achter dezelfde endpoint zetten als de modellen die je al draait, er een deel van het verkeer naartoe sturen, en automatisch failoveren naar iets goedkopers wanneer het het verschil niet terugverdient — een configuratiewijziging in plaats van een migratie, met één API die meer dan 200 modellen ondersteunt, een routerings-DSL die meerdere modellen in één aanroep samenbrengt, en modelfusie wanneer je een panel samen wilt laten antwoorden.
De punten die ertegen pleiten, ronduit gezegd. Een router is een extra hop in het aanvraagpad en een extra partij in de datastroom — en in dit model is dat niet hypothetisch, want ZDR wordt per organisatie goedgekeurd bij OpenAI en een gerouteerd verzoek valt niet automatisch onder jouw ZDR-goedkeuring. Als je gereguleerde data verstuurt, controleer dan de gegevensvoorwaarden van de route voordat je iets verstuurt, en wees bereid om voor die workload rechtstreeks contact op te nemen met de leverancier. Routering voegt ook een component toe die kan uitvallen of latentie kan veroorzaken, en het maakt het wisselen van modellen zo makkelijk dat je kunt veranderen wat je gebruikers te zien krijgen zonder dat te beoordelen. Niets daarvan weegt op tegen het argument van uitproberen en terugdraaien voor de meeste teams; toch is het allemaal de moeite waard om te weten voordat je besluit dat de router gratis is. We hebben de routeringsplatforms in een apart stuk tegen elkaar afgezet in plaats van de vergelijking hier te herhalen.
Drie vragen die niet met één zin te beantwoorden zijn
Kan ik GPT-6 Astra fine-tunen of het met de Assistants API gebruiken? Nee, op beide punten, en dit is een ontwerpgrens in plaats van een configuratie die je hebt gemist. Op de modelpagina van OpenAI staan Chat Completions, Responses en Batch vermeld als de ondersteunde endpoints, en Fine-tuning en Assistants staan expliciet vermeld als niet-ondersteund, en er is geen rij voor GPT-6 Astra in de fine-tuning-prijstabel van OpenAI. Als je architectuur afhankelijk is van een fine-getuned vlaggenschipmodel, moet Astra in plaats daarvan via prompting worden aangestuurd, waardoor de kosten verschuiven van training naar invoertokens — en bij $10,00 per miljoen voor een grote systeemprompt is dat een echte begrotingspost, geen voetnoot.
Zal het model beveiligingswerk weigeren dat ik gemachtigd ben uit te voeren? Soms wel, en het is de moeite waard om dat te weten voordat je gaat bouwen. GPT-6 Astra is het eerste OpenAI-model dat de Critical-drempel voor cyberbeveiligingscapaciteiten bereikt onder het Preparedness Framework van het bedrijf, en in de geleverde vorm weigert het geavanceerde cyber-taken, zoals het schrijven van proof-of-concept-exploits. OpenAI zegt van plan te zijn de toegang te verruimen met minder beperkende waarborgen via zijn Daybreak-programma. Voor een verdediger komt dit naar voren als een weigering die geen snelheidslimiet en geen bug is — houd er rekening mee in je foutafhandeling in plaats van ertegenaan te blijven opnieuw proberen.
Heb ik speciale goedkeuring nodig om dit model aan te roepen? Niet voor het standaard endpoint — er is geen wachtlijst en geen goedkeuringsstap om gpt-6-astra aan te roepen, alleen een account met facturering. Waarvoor je mogelijk wél goedkeuring nodig hebt, is alles eromheen: Zero Data Retention, dat via een aanvraag moet worden goedgekeurd; dataresidentie buiten de Verenigde Staten, waarvoor een aparte aanvulling nodig is; en een tierverhoging, als je van plan bent om tokens op agentschaal via een Tier 1-account te sturen. Het model is het makkelijke deel van de inkoop.
Wat je in de gaten moet houden, en wie nu in beweging moet komen
Als je op dit model bouwt, zijn de vier dingen die het monitoren waard zijn allemaal aan de leverancierskant en allemaal datumgebonden. Of OpenAI een gedateerde snapshot publiceert voor gpt-6-astra — wat van het kale id een bewegend doelwit zou maken en pinning zinvol zou maken. Of de drempel van 272.000 tokens verschuift, want die ene regel weegt zwaarder op je factuur dan welke benchmark dan ook op de pagina. Of de tarieven van Bedrock en Foundry naar de lijstprijs van OpenAI convergeren of daarboven blijven, want dat bepaalt de inkooproute net zo sterk als het model zelf. En of het Daybreak-programma verandert wat de endpoint weigert, wat voor beveiligingsteams het verschil is tussen een bruikbare tool en een demo.
Wat betreft wie actie moet ondernemen, is de scheidslijn duidelijk. Als je al betaalt voor GPT-5.6 Sol tegen promotietarieven voor agentwerk met een lange horizon, is die 2,5x reëel en is de vraag beperkt: verslaat de taakvoltooiingsgraad op je eigen workload het prijsverschil? Draai het op een deel van het echte verkeer en kom erachter — het uitgewerkte voorbeeld hierboven vertelt je wat dat deel kost voordat je begint. Als je werk bestaat uit chat met een korte context of hoogvolumeclassificatie, is dit niet jouw model; de herprijzing voor lange context en het outputtarief van $50,00 maken het een dure manier om iets te doen wat GPT-5.6 Luna voor een fractie van de prijs doet. En als je een enterprise bent met een compliancevereiste, begin dan eerst het ZDR-gesprek, want dat is bepalend voor de Batch-korting, de residency-toeslag en je keuze van route — en niets daarvan is een beslissing die je kunt nemen op de dag dat je het nodig hebt.
Vergeleken in dit artikel2
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
