Titelkaart voor het artikel, met als kop 'GPT-6 Astra Benchmarks' en de ondertitel 'Elke score, wie die heeft gemeten, en waar de cijfers niets meer betekenen'. Drie statistiekchips lezen 'FrontierMath Tier 4: 98% (verzadigd)', 'Terminal-Bench 4.0: 57.9% (door leverancier gerapporteerd)' en 'DeepSWE v1.1: 74% (onafhankelijk, gedeelde eerste plaats)'. Een voetregel luidt: 'Model uitgebracht op 3 september 2026. Cijfers opnieuw gelezen op 16 september 2026.' Het OrcaRouter-logo staat in de rechteronderhoek van het opgevulde canvas.
Guides & Insights

GPT-6 Astra-benchmarks: elke score, wie die heeft gemeten, en waar de cijfers niets meer betekenen

Auteur

Elias Hawthorne

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

GPT-6 Astra scoort 98% op FrontierMath Tier 4 en 99,9% op ARC-AGI-3, en Ope​nAI zelf noemt beide benchmarks verzadigd — waardoor de twee meest geciteerde cijfers op de pagina van het model juist de twee zijn die je het minst vertellen over de vraag of je het moet gebruiken. Tegenover GPT-5.6 Sol en Claude Fable 5.1 liggen de rijen die echt onderscheidend zijn ergens anders: een 57,9% op Terminal-Bench 4.0, een 74% op DeepSWE v1.1 die onafhankelijk is en ook een gelijkspel, en een tijd-per-taak-cijfer dat meer beslist over bruikbaarheid dan welk percentage hier dan ook. Het model zelf is van 3 september 2026 — dertien dagen oud op het moment van publicatie, geen lanceringsnieuws. Dit is een referentiepagina voor wat GPT-6 Astra scoort, wie elke meting heeft uitgevoerd, en wat elk cijfer wel en niet aantoont.

De reden dat een model van dertien dagen oud deze week nog steeds een pagina waard is, is dat de dingen waar een lezer iets mee kan pas na de lancering kwamen. Brede beschikbaarheid afgerond: Ope​nAI zei op 8 september dat Astra volledig was uitgerold naar Plus-, Pro-, Business- en Enterprise-gebruikers in Co​dex en ChatGPT Work, nadat het op 3 september was geopend met de regel dat het "vandaag wordt uitgerold naar een beperkt aantal organisaties en in de komende dagen beschikbaar zal komen voor alle ChatGPT Plus-, Pro-, Business- en Enterprise-gebruikers, alsook via de Ope​nAI API, Microsoft Azure en AWS Bedrock." Enterprise-toegang, bij de lancering standaard uitgeschakeld, werd iets dat een beheerder kan inschakelen onder de voor hen geldende tariefkaart, en de enterprisewerkpagina van Ope​nAI voor het model — gepubliceerd op 9 september — werd geleverd met beheerderscontroles en vier enterpriseplug-ins. En de eerste onafhankelijke evaluaties van het model verschenen, en dat is wat dit verandert van een scorebord dat van een leveranciersslide wordt afgelezen in iets wat een koper kan afwegen.

De volledige benchmarklijst, met de bron op elke rij

Alles hieronder is door Ope​nAI gerapporteerd, tenzij de rij iets anders vermeldt. Dat onderscheid is geen decoratie: slechts één van deze belangrijke cijfers is geproduceerd door iemand anders dan het bedrijf dat het model verkoopt, en dat is degene die een gelijkspel blijkt te zijn.

FrontierMath Tier 4 — 98%. Gerapporteerd door de leverancier, Ope​nAI, en door Ope​nAI beschreven als verzadigend voor het niveau.

ARC-AGI-3 — 99,9%. Door de leverancier gerapporteerd, eveneens als verzadigd beschreven. Ope​nAI voegt eraan toe dat Astra "ons menselijke baseline voor actie-efficiëntie op 96% van de niveaus heeft overtroffen en daarmee in feite menselijke pariteit op de benchmark bereikt" — een specifiekere en interessantere bewering dan de 99,9%, en nog steeds Ope​nAI's eigen meting.

ExploitBench — 100%. Door de leverancier gerapporteerd, en een perfecte score.

Terminal-Bench 4.0 — 57,9%. Door leverancier Ope​nAI gerapporteerd, tegenover 37,3% voor GPT-5.6 Sol en 55,8% voor Claude Fable 5.1, met respectievelijk ongeveer 9% en 63% lagere geschatte API-kosten per taak. Voor de kostencijfers wordt in het materiaal dat we hebben gelezen geen gepubliceerde methodologie gegeven.

DeepSWE v1.1 — 74%. Gemeten door Datacurve, niet door Ope​nAI. Dit is de onafhankelijke rij.

OSWorld 2.0 — 72,6%. Door de leverancier gerapporteerd, bij ongeveer 40 minuten per taak, wat OpenAI neerzet als ongeveer 47% minder tijd per taak dan GPT-5.6 Sol.

Mind2Web — 1,9x snellere taakvoltooiing dan "de huidige GPT-5.6 Sol-ervaring", met een bijgewerkte Co​dex-harness. Door de leverancier gerapporteerd, en de vergelijking is met een Sol met een andere harness, niet met hetzelfde scaffold met een ander model erin.

Veiligheid — intern bij Ope​nAI. Astra produceerde 89% minder vaak onbedoelde uitkomsten dan GPT-5.6 Sol en 74.7% minder vaak dan Claude Fable 5.1. In een evaluatie die was gemodelleerd naar het Hugging Face-incident, ging GPT-5.6 Sol zonder productiebeveiligingen in 48% van de gevallen verder dan het toegestane doel; bij Astra gebeurde dat in 0% van de gevallen.

A single-column scoreboard card titled 'GPT-6 Astra - the scoreboard' with six labelled rows: 'FrontierMath Tier 4: 98% (saturated)', 'ARC-AGI-3: 99.9% (saturated)', 'Terminal-Bench 4.0: 57.9% (vs GPT-5.6 Sol 37.3%)', 'DeepSWE v1.1: 74% (Datacurve, tied at top)', 'OSWorld 2.0: 72.6% at about 40 min per task', and 'List price: $10.00 in / $50.00 out per 1M'. The footer reads 'Vendor-reported by OpenAI except DeepSWE v1.1, measured by Datacurve. Read September 16, 2026.' The OrcaRouter logo is composited in the bottom-right.

Verzadigd betekent dat de benchmark geen reden meer is om te kopen

Wanneer OpenAI zegt dat FrontierMath Tier 4 en ARC-AGI-3 verzadigd zijn, zegt het iets specifieks dat letterlijk genomen moet worden: de tests onderscheiden niet langer. Een benchmark verdient zijn bestaan door modellen te scheiden — door een gat te creëren tussen het beste systeem en het volgende, zodat een koper een getal als een verschil kan lezen. Zodra elk frontiermodel op of binnen de ruisafstand van het plafond uitkomt, meet de score niet langer de modellen, maar begint hij de resterende ruimte van de test te meten.

Wat dat voor deze pagina betekent, is dat de 98% en de 99,9% niet mogen worden gebruikt om wat dan ook te kiezen. Ze zijn geen bewijs dat Astra beter is dan GPT-5.6 Sol of Claude Fable 5.1 op het gebied van wiskunde of abstract redeneren; ze zijn bewijs dat alle drie de niveaus zijn ontgroeid. Het verschil tussen 99,9% en 98% kan in geen enkele betekenisvolle zin worden gelezen als een voordeel van 1,9 punt, omdat de variatie van run tot run bij evaluaties van deze omvang groter is dan het verschil. Een leverancierscijfer op het plafond is een uitspraak over het plafond.

Ze zijn niet waardeloos. Verzadiging is echte informatie over een tier: het vertelt je dat een benchmark die je in 2025 misschien hebt gebruikt om modellen te vergelijken, ze niet langer zal ordenen, en dat je hem niet meer moet meewegen in een inkoopbeslissing. Het vertelt je ook dat de interessante capaciteitsclaim ergens anders is komen te liggen — het cijfer voor menselijke actie-efficiëntie van 96%-van-niveaus is OpenAI's poging om iets voorbij het plafond te zeggen, en het is de subclaim die je moet aanvechten, niet de 99,9%.

Er is een tweede waarschuwing die geldt voor alle drie de bovenste rijen. FrontierMath Tier 4 en ARC-AGI-3 zijn in voldoende detail gepubliceerd om herkenbaar te zijn, maar de harness-, sampling- en scoringsconfiguratie die Ope​nAI gebruikte, wordt niet uiteengezet in het materiaal dat wij hebben gelezen, en een 99,9% op een benchmark waarbij het protocol een privéconfiguratie is, is een getal dat je kunt citeren en niet kunt controleren. Wanneer een score geen gepubliceerde methodologie heeft, zeg dat dan en ga verder. Dat is wat wij met deze doen.

ExploitBench's 100% meet een capaciteit die de meeste gebruikers niet kunnen besteden

Een perfecte score is ook een plafond, en deze heeft een ongebruikelijke tweede helft. Astra is het eerste model dat de Kritieke cybersecurity-capaciteitsdrempel onder Ope​AI's Preparedness Framework bereikt, en daarom was de lancering überhaupt beperkt. In de geleverde vorm weigert het model geavanceerde cybertaken, zoals het schrijven van proof-of-concept-exploits; Ope​AI zegt dat het de toegang wil verruimen met minder beperkende waarborgen via zijn Daybreak-programma.

ExploitBench is dus tegelijkertijd het meest indrukwekkende cijfer op de lijst en het minst bruikbare. Het toont aan dat de capaciteit bestaat en dat OpenAI die heeft gemeten en op basis van die meting heeft gehandeld — wat de eerlijke lezing is van een Critical-classificatie, en de reden waarom de uitrol gefaseerd verliep in plaats van onmiddellijk. Het toont niet aan dat je met die capaciteit iets kunt doen via de publieke API, want dat kan naar ontwerp grotendeels niet. Als offensieve beveiliging jouw gebruiksscenario is, is de relevante regel in de documentatie niet 100%, maar het weigeringsgedrag en het toegangspad van het Daybreak-programma.

Terminal-Bench 4.0: een voorsprong van 24,6 punten op Sol en een verschil van 2,1 punten dat niets beslecht

Terminal-Bench 4.0 is het punt waarop de leverancierscijfers nuttig beginnen te worden, omdat de spreiding aan de ene kant breed genoeg is om tegen ruis bestand te zijn en aan de andere kant smal genoeg om nietszeggend te zijn. Tegenover de 37,3% van GPT-5.6 Sol is de 57,9% van Astra een verschil van 24,6 punten — groot genoeg dat verschillen in meetomgeving het waarschijnlijk niet volledig kunnen wegverklaren, hoewel het nog steeds één leverancier is die zijn eigen model meet en een voorganger die hij ook heeft gebouwd. Tegenover de 55,8% van Claude Fable 5.1 ligt de voorsprong van 2,1 punt binnen het bereik waarin we ronduit moeten zeggen dat die niets beslecht. Twee modellen, gemeten in twee verschillende meetomgevingen, op een benchmark waarvan de toleranties voor de scoring niet zijn gepubliceerd op de pagina die we lazen, met twee punten verschil, vormen een gelijkspel met extra stappen. Als je beslissing afhangt van die 2,1, heb je geen beslissing gevonden — je hebt een marketingkreet gevonden.

De bewering over kosten per taak verdient een eigen zin van wantrouwen. OpenAI schat dat Astra ongeveer 9% lagere API-kosten per taak heeft dan Sol en 63% lager dan Claude Fable 5.1 voor deze workload. Dat zijn schattingen, gepubliceerd zonder de administratie op taakniveau erachter, en "kosten per taak" is geen eigenschap van een model — het is een eigenschap van een model, een harness, een tokenbudget en een retrybeleid samen. De richting is plausibel: Fable 5.1 is een $10/$50-model zoals Astra, maar een taak waarvoor het meer stappen nodig heeft, kost meer. Zie de percentages als de eigen boekhouding van OpenAI, niet als een tariefkaart.

DeepSWE v1.1: de onafhankelijke rij, en de gelijke stand daarin

Het enige cijfer dat niet door OpenAI is geproduceerd, is het cijfer dat het meest de moeite waard is om te hebben — en het is ook het cijfer dat het meest genuanceerd moet worden. Op Datacurves DeepSWE v1.1, een langetermijn-benchmark voor software-engineering met 113 taken verdeeld over 91 repositories in vijf talen, uitgevoerd via één enkele mini-swe-agent-harness, scoorde GPT-6 Astra 74% ±3% Pass@1 tegen een gemiddelde kostprijs van $6,52 per taak, waarbij 30k outputtokens werden geproduceerd in 29 stappen. Datacurve noemt het resultaat een record.

Lees het bord, en het record is een gelijkspel. Dezelfde ranglijstmomentopname die we op 16 september 2026 lazen — gedateerd 3 september 2026 — toont gemini-3.8-flash [high] ook op 74%, met een strakker interval van ±1%, en claude-opus-5 [max] op 74% ±4%, met gpt-5.6-sol [max] één punt daarachter op 73% ±3%. Drie modellen delen de hoogste score met overlappende betrouwbaarheidsintervallen, en de ranglijst zelf vermeldt dat de beste modellen binnen een smalle band clusteren. Niets erop markeert een recordhouder. Een record dat drie modellen tegelijk vasthouden, binnen foutmarges, is een heel andere bewering dan "nieuw record", en de eerlijke versie luidt: Astra bereikt de topcluster op de sterkste beschikbare onafhankelijke code-evaluatie, en onderscheidt zich er niet van.

Wat het verschil maakt, en wat de score alleen verbergt, is hoe het daar is gekomen. Astra's 74% kostte 29 stappen en 30k outputtokens. De gelijk geklasseerde gemini-3.8-flash-inzending had 166 stappen en 143k outputtokens nodig; claude-opus-5 had 99 stappen en 118k nodig. Dezelfde score, ruwweg een vijfde van het werk — dat is een echte en nuttige eigenschap voor iedereen die per token betaalt of op een agent wacht, en de cijfers van Datacurve ondersteunen dat op een manier die de leveranciersrijen van OpenAI niet kunnen. De kostenregel snijdt echter de andere kant op: met $6.52 per taak is Astra alleen de goedkoopste van de drie als je er niet naar kijkt dat gemini-3.8-flash dezelfde score haalde voor $2.36. Op deze benchmark is Astra efficiënt in stappen en middengeprijsd in dollars. Neem de gelijke score en het aantal stappen; neem geen "record".

OSWorld 2.0 en tijd per taak: het getal dat bepaalt of een agent bruikbaar is

OpenAI rapporteert 72,6% op OSWorld 2.0 bij ongeveer 40 minuten per taak, ongeveer 47% minder tijd per taak dan GPT-5.6 Sol. Dit verdient meer gewicht dan de positie in de lijst doet vermoeden, want voor computer-use-agents is de score slechts de helft van de beslissing. Een voltooiingspercentage van 72,6% is goed; een voltooiingspercentage van 72,6% bij 40 minuten per taak is een ander product dan hetzelfde percentage bij 75 minuten, en het verschil is geen percentage. Het is hoeveel taken een team op een werkdag kan afronden, hoeveel kloktijd iemand wacht terwijl een agent werkt, en of één vastgelopen taak een middag opslokt.

Twee kanttekeningen, die beide belangrijker zijn dan de kop. Ten eerste is het cijfer door de leverancier gerapporteerd en hebben we geen onafhankelijke OSWorld 2.0-score voor Astra gevonden om het daaraan te toetsen — de onafhankelijke indexvermelding die we lazen bevat OSWorld niet onder de componenten, dus er is geen tweede meting om naast deze te leggen. Ten tweede is 'ongeveer 40 minuten' een gemiddelde, en gemiddelden verbergen het deel dat operators daadwerkelijk voelen: de staart. Of het traagste deciel van de taken binnen een uur of binnen vier uur klaar is, bepaalt of een agent een mens naast zich nodig heeft, en geen enkele leverancier publiceert die verdeling. De Mind2Web-bewering — 1,9x snellere taakvoltooiing dan de huidige GPT-5.6 Sol-ervaring — heeft hetzelfde soort probleem, iets verergerd doordat de vergelijking uitgaat van een anders opgetuigde Sol dan van dezelfde scaffold met een ander model erin. Sneller is hier geloofwaardig; hoeveel sneller, bij jouw workload, is niet gemeten.

Screenshot of the Artificial Analysis model page for GPT-6 Astra (max), captured 16 September 2026, showing an Artificial Analysis Intelligence Index of 53 ranked #3 of 199, output speed 52.9 tokens per second ranked #111 of 199, a cost of $3.26 per Intelligence Index task ranked #71 of 199, $10.00 input and $50.00 output per 1M tokens with a 90% cache discount, 60M output tokens generated on the Intelligence Index, a 1M-token context window, a knowledge cutoff of April 30, 2026, reasoning support marked 'Yes', and a total cost of $5324.10 to run the full index.

Veiligheidsevaluaties zijn ook metingen, en deze zijn intern.

De veiligheidscijfers horen in een benchmarkreferentie thuis, niet in een voetnoot, want het zijn hetzelfde soort bewering als de prestatierijen: een meting, verricht door een belanghebbende partij, met een vermelde vergelijking. Astra veroorzaakte 89% minder vaak onbedoelde uitkomsten dan GPT-5.6 Sol en 74,7% minder vaak dan Claude Fable 5.1. Bij een evaluatie die is gemodelleerd naar het Hugging Face-incident overschreed GPT-5.6 Sol zonder productiebeveiligingen in 48% van de gevallen het doel waarvoor het gemachtigd was; bij Astra gebeurde dat in 0%.

De richting is betekenisvol en het rekenkundige plaatje is niet symmetrisch. De ene kant van die tweede vergelijking is expliciet een model waarvan de waarborgen zijn verwijderd, en de andere is Astra zoals geleverd — dus het gat van 48 tegenover 0 is deels een meting van guardrails, niet van het onderliggende model, en het lezen als "Astra is veiliger dan Sol" overschat wat er is getest. De cijfers van 89% en 74,7% zijn intern bij OpenAI, zonder externe replicatie, bij een evaluatie waarvan we de opzet niet kunnen inspecteren. Alle drie wijzen dezelfde kant op en alle drie zijn ze van de leverancier zelf; beschouw ze als bemoedigend en niet gereproduceerd. Voor een zakelijke koper zijn het ook de rijen die het meest waar moeten zijn — en dat is precies waarom het de rijen zijn waarvan je een leverancier om bewijs moet vragen in plaats van de rijen die je van een lanceringspagina accepteert.

Prijs: $10 / $50, gelezen op 16 september 2026 — en de 2,5x die een noemer nodig heeft

Een benchmarkpagina die de prijs weglaat, is een pagina die halverwege stopt. In Ope​nAI's eigen prijsdocumentatie van 16 september 2026 staat dat het standaardtarief voor korte context voor gpt-6-astra $10,00 per miljoen inputtokens is, $1,00 per miljoen gecachte input en $50,00 per miljoen output. Verzoeken met een lange context zijn ongeveer twee keer zo duur — rond $20 input en $75 output per miljoen. Onder 1,05 miljoen tokens context hoef je geen rekening te houden met een lange-contextvermenigvuldigingsfactor, maar boven de drempel verandert het effectieve tarief, en dat is het waard om te modelleren voordat je aanneemt dat het bedrag van $10 geldt voor een agent-run op een grote codebase.

De vergelijking die iedereen afdrukt is Astra tegenover GPT-5.6 Sol, en dit is waar een niet-gedateerde multipel misgaat. Het tarief van Sol op dezelfde pagina, dezelfde dag, is $4,00 input / $0,40 gecachet / $20,00 output — en Ope​nAI verklaart dat dit promotietarief ten minste tot 21 november 2026 beschikbaar is. Tegen dat promotietarief is Astra 2,5x op zowel input als output. Tegen Sol's pre-promotielijsttarief van $5,00 / $0,50 / $30,00 is Astra 2x op input en ongeveer 1,67x op output. Beide getallen zijn waar; ze worden gedeeld door verschillende noemers. De 2,5x is wat je vandaag betaalt, de 2x en 1,67x zijn wat je zou betalen als Sol's promotie afloopt — en aangezien Ope​nAI geen post-promotietarief heeft gepubliceerd, kan niemand je vertellen welke jouw budget voor 2027 zou moeten gebruiken. Als je "2x" of "2,5x" ziet zonder een genoemd tariefniveau en een datum, lees je een half feit.

Nog twee opmerkingen over de prijsstelling, want die worden verward met de lijstprijs. Endpoint-prijzen wijken af van OpenAI's eigen kaart: Azure-endpoints zijn zowel op $10/$50 als op $11/$55 vermeld, minstens één endpoint is op $20/$100 vermeld, en een router-vermelding toont $10/$50 met een batch-tier van $5/$25. Dat zijn prijzen voor afzonderlijke endpoints, niet OpenAI's lijstprijs, en ze zijn niet onderling uitwisselbaar. En ter vergelijking, op dezelfde pagina en datum: GPT-5.6 Terra kost $2.00 / $0.20 / $12.00 en GPT-5.6 Luna kost $0.20 / $0.02 / $1.20 — dus Astra is geen model waar je bulkverkeer automatisch doorheen routeert. Het is geprijsd voor het werk dat de benchmarkrijen hierboven beschrijven: langlopende, end-to-end taken waarbij 47% minder wall-clocktijd en minder agentstappen een 2,5x token-tarief kunnen goedmaken, en niet voor chat.

Dat is de rekensom waarbij een routeringslaag zijn bestaansrecht verdient, en het is de moeite waard om concreet te zijn over waarom. GPT-6 Astra staat in de OrcaRouter-catalogus als openai/gpt-6-astra, en het platform geeft de lijsttarieven van OpenAI door tegen 0% opslag — dus een prijswijziging van een leverancier, inclusief het promotietarief waarop deze sectie is gebaseerd, is bij ons dezelfde dag live in plaats van volgens een prijsherzieningscyclus. Het betekent ook dat de tier-vraag hierboven niet langer hypothetisch is: je kunt Astra inzetten op het langetermijnwerk en Sol, Terra of Luna op het volume laten, achter één sleutel, zonder een tweede contract of een codewijziging, en tussen hen een failover uitvoeren wanneer een van hen is gedegradeerd.

Screenshot of the OrcaRouter model page for GPT-6 Astra (catalog id openai/gpt-6-astra) captured 16 September 2026 with the site language set to EN, showing a 1M-token context window, 128K maximum output, text, image and file input, INPUT $10.00 and OUTPUT $50.00 per 1M tokens, p50 TTFT 6.70 s, p95 TTFT 10.00 s, 181.0M tokens of traffic in seven days, and an OpenAI-compatible Python code sample pointed at https://api.orcarouter.ai/v1 using the model id openai/gpt-6-astra.

Specificaties, de Codex-wijziging en wat OpenAI niet heeft gepubliceerd

Model-id — gpt-6-astra in Ope​nAI's eigen documentatie.

Context en uitvoer — contextvenster van 1.050.000 tokens, maximaal 128.000 uitvoertokens.

Kennisafsluitdatum — 30 april 2026. Ondersteuning voor redeneertokens: ja.

Modaliteiten — invoer vermeld als bestand, afbeelding en tekst. Die specifieke vermelding is afkomstig van een router, niet van Ope​nAI, en we labelen die als door de router gerapporteerd in plaats van door de leverancier bevestigd.

Beschikbaar in — ChatGPT Work, Co​dex en de API, plus Microsoft Azure en AWS Bedrock. Enterprise-workspaces zijn standaard uitgeschakeld; een beheerder schakelt toegang in volgens de toepasselijke tariefkaart en krijgt controles om goedgekeurde websites en desktopapplicaties te beperken, uploads en downloads te beheren en browsergeschiedenis te beheren. ChatGPT Work en Co​dex voegen bevestigingsbeleid toe vóór ingrijpende acties en geautomatiseerde beoordeling van onveilige of ongeautoriseerde tool-aanroepen. Vier enterprise-plug-ins zijn meegeleverd in ChatGPT Desktop: Oracle Analytics, Power BI (een Microsoft Fabric-service), Navan en Avalara. Zero Data Retention is beschikbaar voor in aanmerking komende API-klanten op ondersteunde endpoints, onder voorbehoud van goedkeuring.

Eén mechanisme is het vermelden waard, omdat het verandert hoe het model zich gedraagt bij langdurige taken, niet hoe het scoort. Co​dex krijgt met Astra een nieuwe contextaanpak: notities blijven behouden over contextvensters heen in plaats van herhaaldelijk tot één samenvatting te worden samengeperst, en eerdere contextvensters blijven doorzoekbaar, zodat vereisten en testresultaten uit eerdere berichten en tooluitvoer vindbaar blijven. Ope​nAI noemt het experimenteel, ingeschakeld in de Co​dex config.toml, en zegt dat het de standaard voor Astra wordt. Op een benchmark gemeten in 29 stappen is dat het mechanisme dat het aantal stappen het waarschijnlijkst verklaart.

Wat niet gepubliceerd is, is even belangrijk als wat wel gepubliceerd is. Ope​nAI heeft geen aantal parameters of trainingscompute voor dit model genoemd, en wij publiceren er ook geen. Het cijfer "meer dan 100.000 GPU's bij Stargate" doet uit tweede hand de ronde en staat niet op de pagina's die wij hebben gelezen. Ook vermeldt de documentatie van Ope​nAI geen afzonderlijk geprijsde of afzonderlijk gedocumenteerde "Astra Pro" of enige andere tier — de berichtgeving verwijst naar zo'n tier, maar een routervermelding is geen leveranciersdocumentatie, en wij presenteren geen tier die we niet in Ope​nAI's eigen documentatie konden vinden.

Wat een lezer hier eigenlijk uit zou moeten meenemen

Sorteer de rijen op hoeveel invloed ze op een beslissing zouden moeten hebben. Het verzadigde tweetal — 98% op FrontierMath Tier 4 en 99,9% op ARC-AGI-3 — zou die beslissing helemaal niet moeten beïnvloeden; ze zeggen dat de benchmarks uitgespeeld zijn, niet dat Astra ze heeft gewonnen. De 100% van ExploitBench is echt en grotendeels niet te verzilveren via het publieke model, door het ontwerp, wat een bewuste veiligheidskeuze is in plaats van een beperking om te omzeilen. Terminal-Bench 4.0 is de sterkste prestatieclaim van een leverancier, met een echte voorsprong op Sol en een verschil van 2,1 punt met Claude Fable 5.1 dat te nipt is om er een uitspraak over te doen. DeepSWE v1.1 is de enige onafhankelijk gemeten rij, het plaatst Astra in een gedeelde eerste plaats met drie deelnemers aan de top in plaats van alleen, en de aantallen stappen en tokens zijn het deel van dat resultaat dat het citeren waard is. De 40 minuten per taak van OSWorld 2.0 is het getal met de meeste operationele betekenis op de pagina en het minst onafhankelijk gecontroleerde. De veiligheidsrijen zijn intern, niet gereproduceerd en wijzen de goede kant op.

Dat levert een duidelijke tweedeling op. Als je deze week een model kiest voor agentisch werk met een lange horizon — urenlang coderen, computergebruik, end-to-endtaken waarbij anders een mens zou moeten babysitten — dan is Astra het model met de meeste actuele onderbouwing, en het kostenargument berust op tijd die per taak wordt bespaard, niet op tokens die per aanroep worden bespaard. Als je kiest voor werk met een hoog volume en korte interacties, dan is de factor 2,5x ten opzichte van Sols promotietarief het getal dat de doorslag geeft, en het antwoord is waarschijnlijk nee. En als je kiest op basis van een 98% of een 99,9%, kies je op basis van de twee rijen die geen informatie meer overbrengen.

Vragen die het waard zijn om te stellen, die deze pagina niet heeft beantwoord

Is de voorsprong van 2,1 punt op Claude Fable 5.1 in Terminal-Bench echt? Niet op basis van dit bewijs. Beide cijfers komen van OpenAI, dat zijn eigen model meet tegen een concurrent, in testharnassen die we niet kunnen vergelijken, zonder gepubliceerde scoretolerantie. Het is een voorsprong volgens de eigen boekhouding van OpenAI, en die valt binnen het bereik waarin een herhaling hem kan omkeren. De manier om het te beslechten is beide op je eigen taken te draaien, wat een paar uur werk is en meer waard is dan de 2,1 punten.

Waarom kroont het leaderboard van Datacurve Astra niet, terwijl het lanceringsmateriaal van OpenAI een record aanhaalt?Omdat het leaderboard meet, en de lanceringspagina verkoopt. Datacurves eigen momentopname toont drie modellen op 74% met overlappende betrouwbaarheidsintervallen en wijst geen koploper aan. Een recordclaim op een leaderboard met een gelijke stand is niet zozeer een leugen als wel een keuze van noemer — dezelfde faalmodus als de 2,5x-multiple, en de reden dat we hier elk getal van een datum hebben voorzien.

Als de toonaangevende benchmarks verzadigd zijn, wat moet een koper dan in plaats daarvan gebruiken? Tijd per taak, kosten per voltooide taak en het aantal stappen bij langdurig werk — de dimensies waar de cijfers nog uiteenlopen en nog steeds correleren met wat een team betaalt. Dat is een meting die moeilijker gepubliceerd te vinden is, en dat is precies waarom lanceringspagina's van leveranciers nog steeds met de verzadigde varianten uitpakken.

De open vraag

Het getal dat deze pagina het snelst zal doen verouderen, is de prijs. Sols promotietarief loopt minstens tot en met 21 november 2026, en Ope​nAI heeft geen tarief na de promotie gepubliceerd; wanneer dat verandert, verandert de 2,5x in dit artikel mee, in de richting van de 2x. Het tweede is of iemand deze evaluaties onafhankelijk op dezelfde harness opnieuw uitvoert — DeepSWE is het voorbeeld van hoe dat eruit zou moeten zien, en OSWorld 2.0 en Terminal-Bench 4.0 zijn de twee rijen die zo'n behandeling het meest nodig hebben. Tot dan is de eerlijke samenvatting van de benchmarks van GPT-6 Astra dat de indrukwekkende cijfers verzadigd zijn, de onderscheidende cijfers door de leverancier gerapporteerd en dicht bij elkaar liggen, en het enige onafhankelijke cijfer een gelijkspel is dat het eigen lanceringsmateriaal van de leverancier een record noemt.

Vergeleken in dit artikel2

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt