Ett genererat titelkort för Claude Opus 5.5 vs GPT-6 Astra, med undertexten 'En sexdollarskillnad, och en tilläggsavgift över 272 000 tokens', med en platt balansvågsikon och en sidfotsrad som lyder 'Index enligt Artificial Analysis vid maximal ansträngning; priser enligt leverantörerna.' Den riktiga OrcaRouter-logotypen är komponerad i nedre högra hörnet.
Guides & Insights

Claude Opus 5.5 vs GPT-6 Astra: $6-klyftan, och det andra priset Astra tar ut över 272K

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Två leverantörer publicerade benchmarktabeller för sina flaggskepp den här månaden, och var och en visar sin egen modell som vinnare, och ingen av tabellerna innehåller en enda rad där de två modellerna ställdes mot varandra. Claude Opus 5.5, släppt den 22 september 2026 för 4 dollar per miljon indatatokens, och GPT-6 Astra, släppt den 3 september 2026 för 10 dollar per miljon indatatokens, har mellan sig exakt två benchmarks som överlappar – och de delar dem, där Opus 5.5 tar AutomationBench-nära arbete i Ant​hropics tabell och Astra tar det i Open​AIs, och Astra ligger klart före på vetenskapligt resonemang i båda. Det är vad leverantörens material kan berätta för dig. Den oberoende bilden är mindre tvetydig och pekar åt andra hållet, och prisbilden är mer snedvriden än någon av dem.

Vad varje sida publicerade

Anthropics tabell för Opus 5.5 använder sin egen harness och sina egna effort-inställningar, och där den listar Astra är siffrorna Anthropics, inte en omkörning. Behandla hela uppsättningen som leverantörsrapporterad:

• Terminal-Bench 4.0 — Claude Opus 5.5 66,4 % mot GPT-6 Astra 57,9 % (Anthropic noterar att Opus-körningen använde xhigh effort)

• FrontierCode v1.1 — Claude Opus 5.5 54,4 % mot GPT-6 Astra 53,3 %

• GDPval-AA v2.1, kunskapsarbete — Claude Opus 5.5 1 846 Elo mot GPT-6 Astra 1 542

• AutomationBench — Claude Opus 5.5 40,0 % mot GPT-6 Astra 41,4 % (Astra leder)

• Terminal-Bench-Science 0.1 — Claude Opus 5.5 58,7 % mot GPT-6 Astra 64,6 % (Astra leder)

• Humanity's Last Exam, med verktyg — Claude Opus 5.5 67,7 % mot GPT-6 Astra 57,2 %

OpenAI:s sida är svårare att jämka, eftersom OpenAI publicerade Astra mot sin egen föregångare snarare än mot Anthropics flaggskepp, och de benchmarks som valdes — datoranvändning, frontend-utveckling, allmän kunskap — förekommer mestadels inte alls i Anthropics tabell. Det är inte oärlighet, det är normalt lanseringsbeteende, och det är precis därför en jämförelse byggd på två leverantörstabeller är en jämförelse av två urval snarare än av två modeller. Det enda som båda tabellerna är överens om är att Astra är stark inom agentisk vetenskap och datoranvändning, och att de två modellerna ligger tillräckligt nära varandra inom kodning för att valet av testmiljö skulle kunna ändra resultatet.

Den oberoende läsningen, som ingen av leverantörerna valde

A two-column scoreboard comparing Claude Opus 5.5 and GPT-6 Astra across six shared rows: Intelligence Index (58, ranked #1 of 210, against 53, ranked #6), price in and out ($4.00 / $20.00 per million against $10.00 / $50.00), long-context surcharge (none against 2x input and 1.5x output above 272K), context window (1M tokens on both), output speed (not yet published against 52.5 tokens per second) and time to first token (not yet published against 352.15s). The footer reads 'Index, speed and latency figures per Artificial Analysis; prices and the 272K step per the vendors.'

Artificial Analysis kör varje modell i en publicerad konfiguration, så dess siffror är de enda här som har producerats av samma utvärderare under samma förhållanden:

• Intelligensindex — Claude Opus 5.5 58, rankad #1 av 210 mot GPT-6 Astra 53, rankad #6

• Konfigurationsetikett — Claude Opus 5.5 "Adaptivt resonemang, Maximal ansträngning, Standardreserv", GPT-6 Astra "max"

• Utdatashastighet — GPT-6 Astra 52,5 tokens/sek, i den lägre änden av sin prisklass jämfört med Claude Opus 5.5 som ännu inte publicerats

• Tid till första token — GPT-6 Astra 352,15 s mot en median på resultattavlan på 3,83 s; Claude Opus 5.5 ännu inte publicerad

• Pris — Claude Opus 5.5 $4.00 in / $20.00 ut per miljon vs GPT-6 Astra $10.00 / $50.00

• Kontext och utdata — GPT-6 Astra 1M kontext och 128K max utdata vs Claude Opus 5.5 1M och 128K

Ett gap på fem punkter i indexet är inte avgörande i sig, och det bör inte tolkas som ett. Båda modellerna hamnar i samma kapacitetsband, vilket är vad "frontier" innebär det här kvartalet. Vad Astra-raderna däremot fastställer är att premiumen inte köper ett kapacitetsförsprång på den enda resultattavla där båda modellerna förekommer. Latensraden är den ärliga komplikationen: 352 sekunder till första token är högst i den här gruppen med bred marginal, även om den mäts vid maximal ansträngning och en resonerande modell som tänker innan den ger ifrån sig alltid kommer att se långsam ut enligt detta mått. Siffran 52,5 tokens/sek är den mer överförbara, och den ligger i underkant för en modell på $10/$50.

Astras andra pris, över 272 000 tokens

A generated graphic titled 'Where GPT-6 Astra's price steps', with a subtitle reading 'Crossing 272,000 input tokens reprices the whole call, not the excess.' Two panels compare per-million-token rates: below 272,000 input tokens Claude Opus 5.5 is $4.00 / $20.00 against GPT-6 Astra at $10.00 / $50.00, and above 272,000 input tokens Claude Opus 5.5 stays at $4.00 / $20.00 while GPT-6 Astra moves to approximately $20.00 / $75.00. The footer reads 'Per-million-token rates. Astra's step per OpenAI; Opus 5.5 bills its full 1M window at one rate per Anthropic.'

Prislistan är där dessa två inte längre är jämförbara överhuvudtaget, eftersom Astras prissättning innehåller ett steg. Standardpriserna är $10.00 för indata, $1.00 för cachad indata, $12.50 för cacheskrivning och $50.00 för utdata per miljon tokens. Men om du passerar 272 000 indatatoken omprissätts hela begäran – inte det överskjutande, utan hela anropet – med 2x priser för indata och cache samt 1,5x för utdata. Det gör att arbete med lång kontext landar på ungefär $20 för indata och $75 för utdata per miljon tokens.

Claude Opus 5.5 gör inte detta. Anthropic debiterar $4,00 och $20,00 med det fulla fönstret på 1 miljon token enligt standardprissättning, och anger uttryckligen att en begäran på 900 000 token debiteras till samma pris per token som en på 9 000 token. Så det förhållande som lyfts fram mellan dessa två – Astra kostar 2,5x Opus 5.5 i båda riktningarna – är inte det förhållande som gäller för de arbetsbelastningar som båda modellerna faktiskt säljs för. För en agent med lång horisont som bär en stor arbetskontext är jämförelsen $20/$75 mot $4/$20, vilket är en faktor fem på indata och nästan fyra på utdata. Batchprissättning förvärrar det snarare än åtgärdar det: Opus 5.5 halveras till $2,00/$10,00 medan Astras flexnivå halveras till $5,00/$25,00 på en bas som redan är fem gånger högre i scenariot med lång kontext.

Detta är den enskilt mest beslutsrelevanta asymmetrin i jämförelsen, och den är osynlig i varje lanseringstabell från endera företaget, eftersom båda leverantörerna anger rubrikpriset. Om dina prompter ligger under 272K tokens, ignorera det. Om du bygger en agent som läser ett kodförråd eller en dokumentuppsättning, prissätt den till $20/$75 innan du jämför något.

Åtkomst är en del av specifikationen

Astra är den första OpenAI-modellen som passerar tröskeln för Critical cybersäkerhetskapacitet enligt företagets eget Preparedness Framework, och utrullningen speglar den klassificeringen snarare än kapaciteten. Åtkomst öppnades först för en begränsad uppsättning organisationer, företagsåtkomst kräver att en administratör aktiverar den innan användarna ser den, och den levererade modellen avböjer vissa kategorier av arbete direkt. Claude Opus 5.5 kommer med en version av samma problem från andra hållet: den levereras med den skyddsnivå som Anthropic tidigare reserverade för Claude Fable 5.1, vilket innebär att de flesta cybersäkerhetsförfrågningar omdirigeras till Claude Opus 4.8 och biologiskt arbete faller tillbaka till Claude Opus 5 om inte kontot är verifierat.

Båda beteendena visar sig på samma ställe, nämligen i din utvärdering. Artificial Analysis betecknar Opus 5.5:s konfiguration som "Default Fallback" just för att förfrågningar kan hamna på en annan modell än den du angav, och för säkerhets- eller livsvetenskapspromptar händer det rutinmässigt. Om din arbetsbelastning finns inom dessa domäner är modellsträngen i din förfrågan inte någon garanti för vilken modell som svarade, och dina kvalitetssiffror kommer att omfatta en mindre modell i en okänd andel av anropen. Ingen av leverantörerna döljer detta – båda dokumenterar det – men ingen av dem nämner det i sina rubriker heller.

Att välja mellan dem

Det beslut som den här jämförelsen faktiskt ställer är huruvida en arbetsbelastning med lång kontext motiverar Astras stegprissättning, och för de flesta team blir svaret nej: Opus 5.5 är billigare på varje rad under 272K, dramatiskt mycket billigare över det, får högre poäng på den enda oberoende resultattavlan och når 1M tokens kontext utan tilläggsavgift. Astras argument är snävare och reellt — vetenskapligt resonemang, datoranvändning och OpenAI-ekosystemets verktyg — och om era utvärderingar visar att den ligger före på dessa punkter är prispåslaget en radpost snarare än ett misstag.

Där det blir praktiskt är i hur du kör de två mot varandra, eftersom en rättvis jämförelse kräver att båda modellerna använder samma nyckel och samma faktura. Båda kan routas via OrcaRouter till leverantörens listpris med 0 % påslag — Claude Opus 5.5 till Anthropics $4.00/$20.00 och GPT-6 Astra till $10.00/$50.00 — vilket innebär att 272K-beslutet kan testas på din egen trafik i stället för att argumenteras utifrån två pressmeddelanden. Att låsa Astra till de uppgiftsklasser där den vinner och låta automatisk failover sköta resten är en routingregel, och en begäran som passerar 272K-gränsen kan skickas via en billigare väg utan kodändring, eftersom regeln finns i routern i stället för i din applikation.

A screenshot of OrcaRouter's own model page for openai/gpt-6-astra, headed 'GPT-6 Astra' and credited to OpenAI, showing a 1M-token context, 128K max output, a text, image and file input modality, and a stat strip reading INPUT $10.00 and OUTPUT $50.00 per 1M tokens with a 10.00s p50 time to first token and 298.0M tokens of traffic over 7 days.

Vad skulle ändra svaret

En sak skulle vara avgörande: en kontrollerad head-to-head vid matchad ansträngning på gemensamma benchmarkar. Ingen av leverantörerna har publicerat en sådan, och ingen av dem har incitament att göra det, vilket lämnar det oberoende indexet som den enda tillgängliga jämförelsen under samma förutsättningar – och det indexet placerar Opus 5.5 fem poäng och fem placeringar över Astra till mindre än halva tokenpriset. Motargumentet som förtjänar uppmärksamhet är att båda modellerna poängsattes vid maximal ansträngning, medan Opus 5.5 levereras med medium som standard; om Astras fördel när det gäller vetenskapligt arbete över långa horisonter överlever en körning med matchad ansträngning, blir argumentet för premiumpriset starkare snarare än svagare. Till dess att någon kör den är den försvarbara ståndpunkten att Astra är en specialist som är prissatt som en generalist, och att Opus 5.5 är generalisten som råkar få högre poäng.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen