Een gegenereerde titelkaart voor Claude Opus 5.5 vs GPT-6 Astra, met als ondertitel 'Een gat van zes dollar, en een toeslag boven 272.000 tokens', met een plat balansschaalpictogram en een voettekstregel die luidt 'Index volgens Artificial Analysis bij maximale inspanning; prijzen volgens de leveranciers.' Het echte OrcaRouter-logo is rechtsonder gecompositeerd.
Guides & Insights

Claude Opus 5.5 vs. GPT-6 Astra: het gat van $6, en de tweede prijs die Astra boven 272K rekent

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Twee leveranciers hebben deze maand benchmarktabellen voor hun topmodellen gepubliceerd, elk met hun eigen model als winnaar, en geen van beide tabellen bevat ook maar één rij waarin de twee modellen tegen elkaar zijn getest. Claude Opus 5.5, verschenen op 22 september 2026 voor $4 per miljoen inputtokens, en GPT-6 Astra, verschenen op 3 september 2026 voor $10 per miljoen inputtokens, hebben samen precies twee benchmarks die overlappen — en die verdelen ze: Opus 5.5 wint het AutomationBench-aanverwante werk in de tabel van Anthropic en Astra wint het in die van OpenAI, en Astra ligt in beide duidelijk voor op wetenschappelijk redeneren. Dat is wat het leveranciersmateriaal je kan vertellen. Het onafhankelijke beeld is minder dubbelzinnig en wijst de andere kant op, en het prijsbeeld is nog schever dan een van beide.

Wat elke partij publiceerde

De tabel van Anthropic voor Opus 5.5 gebruikt een eigen harness en eigen effort-instellingen, en waar Astra wordt vermeld, zijn de cijfers van Anthropic, niet van een heruitvoering. Beschouw de hele set als door de leverancier gerapporteerd:

• Terminal-Bench 4.0 — Claude Opus 5.5 66,4% vs. GPT-6 Astra 57,9% (Anthropic merkt op dat de Opus-run xhigh effort gebruikte)

• FrontierCode v1.1 — Claude Opus 5.5 54,4% vs GPT-6 Astra 53,3%

• GDPval-AA v2.1, kenniswerk — Claude Opus 5.5 1.846 Elo vs. GPT-6 Astra 1.542

• AutomationBench — Claude Opus 5.5 40,0% vs GPT-6 Astra 41,4% (Astra ligt voor)

• Terminal-Bench-Science 0.1 — Claude Opus 5.5 58,7% vs. GPT-6 Astra 64,6% (Astra ligt voor)

• Humanity's Last Exam, met hulpmiddelen — Claude Opus 5.5 67,7% vs GPT-6 Astra 57,2%

De kant van OpenAI is moeilijker op één lijn te krijgen, omdat OpenAI Astra tegen zijn eigen voorganger heeft gepubliceerd in plaats van tegen het vlaggenschip van Anthropic, en de benchmarks die het koos — computergebruik, front-endengineering, algemene kennis — komen grotendeels helemaal niet voor in de tabel van Anthropic. Dat is geen oneerlijkheid, het is normaal lanceergedrag, en het is precies waarom een vergelijking op basis van twee leverancierstabellen een vergelijking van twee selecties is in plaats van van twee modellen. Het enige waarover beide tabellen het eens zijn, is dat Astra sterk is in agentische wetenschap en computergebruik, en dat de twee modellen op het gebied van coderen dicht genoeg bij elkaar liggen dat de keuze van harness het resultaat kan beïnvloeden.

De onafhankelijke lezing, die geen van beide leveranciers koos.

A two-column scoreboard comparing Claude Opus 5.5 and GPT-6 Astra across six shared rows: Intelligence Index (58, ranked #1 of 210, against 53, ranked #6), price in and out ($4.00 / $20.00 per million against $10.00 / $50.00), long-context surcharge (none against 2x input and 1.5x output above 272K), context window (1M tokens on both), output speed (not yet published against 52.5 tokens per second) and time to first token (not yet published against 352.15s). The footer reads 'Index, speed and latency figures per Artificial Analysis; prices and the 272K step per the vendors.'

Artificial Analysis draait elk model in één gepubliceerde configuratie, dus zijn cijfers zijn de enige hier die door dezelfde beoordelaar onder dezelfde omstandigheden zijn geproduceerd:

• Intelligentie-index — Claude Opus 5.5 58, gerangschikt als #1 van 210 tegenover GPT-6 Astra 53, gerangschikt als #6

• Configuratielabel — Claude Opus 5.5 "Adaptief redeneren, maximale inspanning, standaard fallback", GPT-6 Astra "max"

• Uitvoersnelheid — GPT-6 Astra 52,5 tokens/sec, aan de onderkant van zijn prijsklasse tegenover Claude Opus 5.5, nog niet gepubliceerd

• Tijd tot eerste token — GPT-6 Astra 352,15 s tegenover een mediaan van 3,83 s op het leaderboard; Claude Opus 5.5 nog niet gepubliceerd

• Prijs — Claude Opus 5.5 $4,00 in / $20,00 uit per miljoen vs. GPT-6 Astra $10,00 / $50,00

• Context en uitvoer — GPT-6 Astra 1M context en 128K maximale uitvoer vs Claude Opus 5.5 1M en 128K

Een verschil van vijf punten in de index is op zichzelf niet beslissend, en het moet ook niet als zodanig worden gelezen — beide modellen vallen in dezelfde capaciteitsband, en dat is wat "frontier" dit kwartaal betekent. Wat de Astra-rijen wel aantonen, is dat de premie geen capaciteitsvoorsprong koopt op het enige board waarop beide modellen voorkomen. De latentie-rij is de eerlijke complicatie: 352 seconden tot het eerste token is veruit het hoogste in deze groep, hoewel het bij maximale inspanning is gemeten en een redeneermodel dat nadenkt voordat het iets uitvoert, volgens deze maatstaf altijd traag zal lijken. Het cijfer van 52,5 tokens/sec is het meer overdraagbare, en het ligt aan de lage kant voor een model van $10/$50.

Astra's tweede prijs, boven 272.000 tokens

A generated graphic titled 'Where GPT-6 Astra's price steps', with a subtitle reading 'Crossing 272,000 input tokens reprices the whole call, not the excess.' Two panels compare per-million-token rates: below 272,000 input tokens Claude Opus 5.5 is $4.00 / $20.00 against GPT-6 Astra at $10.00 / $50.00, and above 272,000 input tokens Claude Opus 5.5 stays at $4.00 / $20.00 while GPT-6 Astra moves to approximately $20.00 / $75.00. The footer reads 'Per-million-token rates. Astra's step per OpenAI; Opus 5.5 bills its full 1M window at one rate per Anthropic.'

De tariefkaart is waar deze twee helemaal niet meer te vergelijken zijn, want de prijsstelling van Astra kent een sprongetje. De standaardtarieven zijn $10,00 input, $1,00 gecachte input, $12,50 cache-schrijven en $50,00 output per miljoen tokens. Maar kom je boven de 272.000 inputtokens, dan wordt de hele aanvraag opnieuw geprijsd — niet het overschot, de hele call — tegen 2x de input- en cachetarieven en 1,5x de output. Daarmee komt werk met een lange context uit op ongeveer $20 input en $75 output per miljoen tokens.

Claude Opus 5.5 doet dit niet. Anthropic factureert $4,00 en $20,00 met het volledige 1M-tokenvenster tegen standaardprijzen, en stelt expliciet dat een verzoek van 900K tokens tegen hetzelfde tarief per token wordt gefactureerd als een verzoek van 9K tokens. Dus de opvallende verhouding tussen deze twee — waarbij Astra 2,5x Opus 5.5 kost in beide richtingen — is niet de verhouding die geldt voor de workloads waarvoor beide modellen daadwerkelijk worden verkocht. Bij een agent met een lange horizon en een grote werkcontext is de vergelijking $20/$75 tegenover $4/$20, wat een factor vijf op de input en bijna vier op de output is. Batchprijzen versterken dit eerder dan dat ze het oplossen: Opus 5.5 halveert naar $2,00/$10,00, terwijl de flex-tier van Astra halveert naar $5,00/$25,00 op een basis die in het geval van een lange context al vijf keer hoger is.

Dit is de meest beslissingsrelevante asymmetrie in de vergelijking, en die is onzichtbaar in elke lanceringstabel van beide bedrijven, omdat beide leveranciers het hoofdtarief noemen. Als je prompts onder 272K tokens zitten, negeer dit. Als je een agent bouwt die een repository of een documentenset leest, ga dan uit van $20/$75 voordat je iets vergelijkt.

Toegang maakt deel uit van de specificatie.

Astra is het eerste OpenAI-model dat de Critical-drempel voor cyberbeveiligingscapaciteit overschrijdt onder het eigen Preparedness Framework van het bedrijf, en de uitrol weerspiegelt die classificatie in plaats van capaciteit. Toegang werd eerst geopend voor een beperkte groep organisaties, enterprise-toegang vereist dat een beheerder deze inschakelt voordat gebruikers het zien, en het uitgeleverde model wijst sommige categorieën werk ronduit af. Claude Opus 5.5 komt met een variant van hetzelfde probleem vanuit de andere richting: het wordt geleverd met het beveiligingsniveau dat Anthropic voorheen reserveerde voor Claude Fable 5.1, wat betekent dat de meeste cyberbeveiligingsverzoeken worden omgeleid naar Claude Opus 4.8 en biologisch werk terugvalt op Claude Opus 5, tenzij het account is geverifieerd.

Beide gedragingen komen op dezelfde plek naar voren, namelijk in je evaluatie. Artificial Analysis noemt de configuratie van Opus 5.5 precies "Default Fallback" omdat verzoeken bij een ander model terecht kunnen komen dan het model dat je hebt opgegeven, en bij prompts op het gebied van beveiliging of levenswetenschappen gebeurt dat regelmatig. Als je workload in die domeinen ligt, is de modelstring in je verzoek geen garantie over het model dat heeft geantwoord, en je kwaliteitscijfers zullen bij een onbekende fractie van de aanroepen een kleiner model bevatten. Geen van beide leveranciers verbergt dit — beide documenteren het — maar geen van beide koppen vermeldt het ook.

Kiezen tussen hen

De beslissing die deze vergelijking feitelijk voorlegt, is of een long-context-werklast Astra's getrapte prijsstelling rechtvaardigt, en voor de meeste teams zal het antwoord nee zijn: Opus 5.5 is goedkoper op elke regel onder 272K, dramatisch goedkoper daarboven, scoort hoger op het enige onafhankelijke leaderboard, en bereikt 1M tokens aan context zonder toeslag. Astra's zaak is smaller en reëel — wetenschappelijk redeneren, computergebruik en de tooling van het OpenAI-ecosysteem — en als je evaluaties het daarin voorop plaatsen, is de meerprijs een begrotingspost in plaats van een fout.

Waar dat praktisch wordt, is in hoe je de twee het tegen elkaar laat opnemen, want een eerlijke vergelijking vereist beide modellen op dezelfde sleutel en dezelfde factuur. Beide kunnen via OrcaRouter worden gerouteerd tegen de lijstprijs van de provider met 0% opslag — Claude Opus 5.5 bij Anthropic voor $4,00/$20,00 en GPT-6 Astra voor $10,00/$50,00 — wat betekent dat de 272K-beslissing kan worden getest op je eigen verkeer in plaats van te worden beargumenteerd op basis van twee persberichten. Astra vastzetten op de taakklassen waarin het wint en automatische failover de rest laten opvangen, is een routeringsregel, en een verzoek dat de 272K-grens overschrijdt, kan via een goedkopere route worden gestuurd zonder codewijziging, omdat de regel in de router zit in plaats van in je applicatie.

A screenshot of OrcaRouter's own model page for openai/gpt-6-astra, headed 'GPT-6 Astra' and credited to OpenAI, showing a 1M-token context, 128K max output, a text, image and file input modality, and a stat strip reading INPUT $10.00 and OUTPUT $50.00 per 1M tokens with a 10.00s p50 time to first token and 298.0M tokens of traffic over 7 days.

Wat zou het antwoord veranderen

Eén ding zou dat doen: een gecontroleerde head-to-head bij gelijke inspanning op gedeelde benchmarks. Geen van beide leveranciers heeft er een gepubliceerd en geen van beide heeft er belang bij, waardoor de onafhankelijke index de enige beschikbare vergelijking onder gelijke omstandigheden blijft — en die index plaatst Opus 5.5 vijf punten en vijf rangen boven Astra tegen minder dan de helft van de tokenprijs. Het tegenargument dat aandacht verdient, is dat beide modellen op maximale inspanning zijn gescoord, terwijl Opus 5.5 standaard op medium staat; als de voorsprong van Astra bij wetenschappelijk werk met een lange horizon een run met gelijke inspanning overleeft, wordt de zaak voor de meerprijs sterker in plaats van zwakker. Totdat iemand die run uitvoert, is de verdedigbare stelling dat Astra een specialist is die als generalist geprijsd wordt, en dat Opus 5.5 de generalist is die toevallig hoger scoort.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt