
Claude Opus 5.5 vs GPT-6 Astra: Ett smaktest som sprang ifrån benchmarkarna
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Någon bad Claude Opus 5.5 att göra en kort video om ett rivaliserande labb som löser Navier–Stokes, publicerade resultatet och skrev sedan meningen som gör den här jämförelsen värd att göra: modellen är "väldigt trevlig", den har "utmärkt smak", och det är den första Claude sedan Opus 4.7 som de faktiskt vill köra tungt — men de behåller fortfarande GPT-6 Astra och GPT-5.6 Sol som sina huvudsakliga modeller, eftersom deras arbete är forskningstungt. Det är tre påståenden i ett inlägg, och de drar åt olika håll. En modell kan vara det mest behagliga att arbeta med och ändå inte vara den du skickar produktionstrafik till. Den intressanta frågan är inte vilken modell som är bättre. Det är vilken av de två bedömningarna som överlever kontakten med siffrorna, och vilken som visar sig vara ett uttalande om smak.
Inlägget är en utövares rapport, inte en benchmarkkörning – behandla det som en signal om hur modellen känns i kreativt och öppet arbete, inte som bevis om kapacitet. Allt numeriskt nedan är märkt med vem som producerade det.
Vad ett smaktest kan och inte kan säga dig
Artefakten spelar roll här. Att göra en video om ett matematiskt resultat är inte en kodningsuppgift med en tröskel för godkänt/underkänt. Det finns inget kompileringssteg, ingen testsvit, ingen Terminal-Bench-harness som betygsätter om det hela är något att ha. Modellen var tvungen att välja en infallsvinkel, bestämma vad som skulle visas, hålla det sammanhängande och sluta. När en utövare säger att en modell har ”utmärkt smak”, är det detta de beskriver: omdöme om omfattning och betoning som visar sig i arbete där specifikationen är medvetet vag.
Det är en verklig förmåga, och det är just den som benchmarksviter är sämst på att mäta. Det är också därför samma person kan berömma en modell utan att byta till den. Smak är vad man vill ha när man utforskar. Det är inte vad man vill ha när man har 200 000 rader kod att granska och en räkning att motivera.
Anthropics egen lanseringsinramning pekar på samma förmåga, i prosa snarare än video: Claude Opus 5.5 presenteras som att skriva mindre "Claudish" – mindre harklingar, mindre garderingar, större villighet att sätta poängen först. Oberoende läsbarhetsbedömning stöder riktningen i det påståendet även där den inte håller med om storleken. Leverantören rapporterar också att ett internt faktakontrolltest klarade 16 av 18 försök, mot noll av 18 för både Claude Fable 5.1 och Claude Opus 5; siffran är Anthropics egen, inte reproducerad, och bör läsas som ett påstående snarare än ett resultat.
Två resultattavlor, en meningsskiljaktighet som spelar roll

I råa publicerade benchmarks ligger Claude Opus 5.5 oftast före GPT-6 Astra. Problemet är att de två mest citerade källorna inte är överens om hur mycket.
Anthropics lanseringstabell placerar Claude Opus 5.5 på 66,4 % i Terminal-Bench 4.0, med GPT-6 Astra på 57,9 % och Claude Fable 5.1 på 55,8 %. Det är ett leverantörsrapporterat försprång på 8,5 punkter inom agentisk kodning – den typ av marginal som avgör en diskussion i en säljpresentation. Artificial Analysis, som kör sin egen testrigg, mätte Claude Opus 5.5 till 59,6 % i samma benchmark: i nivå med GPT-6 Astra vid xhigh effort, och omkring 11 punkter över Claude Opus 5. Försprånget är verkligt i båda mätningarna. Storleken är det inte.
Där de två modellerna byter plats är mer användbart än där de inte gör det:
• Terminal-Bench 4.0 (agentisk kodning) — Claude Opus 5.5 66,4 % enligt Anthropics egen tabell, 59,6 % enligt Artificial Analysis; GPT-6 Astra 57,9 %.
• Humanity's Last Exam, med verktyg — Claude Opus 5.5 67,7 % enligt leverantören, oberoende uppmätt till 61,4 %; GPT-6 Astra 57,2 %.
• GDPval-AA v2.1 (kunskapsarbete i verkligheten inom 44 yrken) — Claude Opus 5.5 1 846 Elo; GPT-6 Astra 1 542 Elo. Båda siffrorna kommer från den oberoende resultattavlan hos Artificial Analysis, inte från leverantören.
• Terminal-Bench-Science 0.1 — GPT-6 Astra 64,6 % mot Claude Opus 5.5 58,7 %. Det här är en ren Astra-vinst, och det är det vetenskapsinfluerade agentiska benchmark-testet.
• AutomationBench — GPT-6 Astra 41,4 % mot Claude Opus 5.5 40,0 %. Knappt, men Astra igen.
• FrontierCode v1.1 — Claude Opus 5.5 54,4 % mot GPT-6 Astra 53,3 %. Inom en poäng.
Läs den listan så som en utövare skulle läsa den. De forskningsintensiva arbetsbelastningarna – de med en vetenskaplig eller litterär komponent, de som kör en lång verktygsanvändande loop och behöver att modellen håller fotfästet – är precis där GPT-6 Astra håller ställningarna. Tavlorna för kunskapsarbete och kodning där Claude Opus 5.5 drar ifrån är de du skulle peka på om ditt jobb var att leverera programvara. Båda personerna i den här konversationen läser sin egen benchmark korrekt. De läser bara olika benchmarks.
Ansträngningsinställningen gör mer arbete än vad modellen gör.
Det finns en andra, mindre smickrande anledning till att rubrikmarginalerna är svaga. Leverantörsjämförelserna körs inte med samma inställning.
Claude Opus 5.5:s publicerade siffror kommer från en extra hög (xhigh) konfiguration för resonemangsansträngning, jämfört med GPT-6 Astra på high. Oberoende körningar från Artificial Analysis sätter båda modellerna på xhigh, och kodningsgapet försvinner – leverantörens 8,5-punktsförsprång blir oavgjort. Det är inte en anklagelse om fusk; det är vad som händer när en leverantör väljer den konfiguration som visar modellen bäst och ett oberoende labb väljer den konfiguration som matchar konkurrensen. Innan du flyttar en arbetsbelastning på grundval av en benchmarktabell bör du kontrollera vilken ansträngningsinställning den kördes med, för svaret är ofta ”den smickrande”.
Tokenräkningen berättar samma historia ur en annan vinkel. I Anthropics eget lanseringsmaterial förbrukar Claude Opus 5.5 i storleksordningen 119 000 tokens per problem, varav ungefär 84 000 går till tänkande, medan GPT-6 Astra löser jämförbara problem på ungefär 27 000 tokens. Tänkandetokens faktureras som utdatatokens. En modell som använder fyra gånger så många tokens till en femtedel av utdatapriset går nästan jämnt ut – och det är innan man räknar in att den billigare modellen ofta är den man ändå hade varit beredd att köra på en högre ansträngningsnivå.
Ytterligare en varning gäller specifikt Claude Opus 5.5: Anthropics skyddsroutning kan skicka vissa cyber- och bioangränsande förfrågningar till en mer restriktiv väg, vilket drar ner de publicerade resultaten på dessa utvärderingar jämfört med vad den underliggande modellen skulle producera. Om ditt arbete berör dessa domäner kommer gapet mellan benchmarken och din erfarenhet att vara verkligt, och det kommer att gå i riktning mot att benchmarken är optimistisk.
Vad en verklig uppgift kostar för var och en

Claude Opus 5.5 är den billigare modellen på prislistan, och det är inte ens nära:
• Claude Opus 5.5 — 4,00 $ per miljon indata-tokens, 20,00 $ per miljon utdata-tokens, 0,20 $ per miljon cachade indata-tokens, 5,00 $ per miljon cache-skrivningar. Kontext på 1M tokens, max 128k utdata.
• GPT-6 Astra — 10,00 USD per miljon indata, 50,00 USD per miljon utdata, 1,00 USD per miljon cachad indata, 12,50 USD per miljon cacheskrivningar. Efter 272 000 indatatoken i en enskild begäran omprissätts hela begäran till 20,00 USD för indata och 100,00 USD för utdata; batch-nivån är 5,00/25,00 USD.
Så Claude Opus 5.5 är 2,5 gånger billigare på indata och 2,5 gånger billigare på utdata, med cachad indata fem gånger billigare. Om dina uppgifter är tokenliknande är det hela beslutet, och smakfrågan är dekoration.
Förbehållet om tokenanvändning ovan är det som gör att det inte är så enkelt, och GPT-6 Astras omprissättning för lång kontext är den andra fällan. Överskrid 272 000 indatatokens i en begäran och hela begäran – inte bara överskottet – flyttas till långkontextpriset. En forskningsarbetsbelastning som proppar in en stor korpus i ett enda anrop är exakt den form som utlöser det. Batchning till halva priset är den legitima utvägen, och den ligger i den långsammare kön.
Den ärliga sammanfattningen är att kostnadsbilden inverteras beroende på vad man gör. För en uppgift där båda modellerna använder jämförbara tokenmängder vinner Claude Opus 5.5 på pris med bred marginal. För en lång agentisk forskningsloop där tokenantalet divergerar på det sätt som Anthropics eget lanseringsmaterial visar, konvergerar de två – vilket är en mycket mindre spännande rubrik än en kostnadsminskning på 40 %, och närmare vad praktikern rapporterade.
Varför den forskningsintensiva användaren inte bytte
Lägg ihop bitarna, och raden "föredrar fortfarande Astra" upphör att vara en motsägelse mot raden "god smak". Det är samma iakttagelse från ett annat säte.
Arbetsbelastningarna som användaren nämnde är långa, öppna, verktygsanvändande och dyra per körning. På dem håller GPT-6 Astra ställningarna inom vetenskap och automation, använder en bråkdel av tänkandetokenen och ligger – enligt oberoende mätning – jämsides i kodning när båda modellerna körs med samma ansträngning. Claude Opus 5.5:s fördelar koncentreras till det arbete där man kan se resultatet och bedöma det: prosa, designval, att avgränsa en tvetydig brief, att avgöra vad en video om Navier-Stokes faktiskt borde visa. Det är smak, och smak är precis den del som inte syns på någon benchmark-axel.
Om du hoppades på en dom att en modell vinner, stöder bevisen inte det. Den försvarbara versionen är snävare: Claude Opus 5.5 är den bättre modellen för arbete där omdöme är flaskhalsen, GPT-6 Astra är den bättre modellen för arbete där uthållig ansträngning över långa kontexter är flaskhalsen, och prisskillnaden mellan dem krymper till nästan ingenting för den andra typen av arbete. Det är ett routingbeslut, inte en konvertering.
Köra båda utan en migrering

Det här är delen där de två modellerna slutar vara ett antingen-eller. GPT-6 Astra finns på OrcaRouter idag till OpenAIs eget listpris — $10,00 indata, $50,00 utdata, $1,00 för cachad läsning, $12,50 för cacheskrivning — med 0 % påslag, leverantörens listpris förs rakt igenom. Det innebär att en ändring av leverantörens pris hamnar hos oss samma dag, i stället för närhelst en återförsäljare synkroniserar.
Claude Opus 5.5 går att nå via Anthropics eget API och flera tredjepartsplattformar; vi listar inte den som något vi erbjuder, och du bör vara skeptisk mot alla som påstår något annat innan modellen har fått spridning. Vad du kan göra i dag är att sätta båda modellerna bakom en nyckel och en slutpunktsform, och routa per arbetsbelastning i stället för per preferens: skicka den öppna, bedömningstunga förfrågan till Claude Opus 5.5 och den långa forskningsloopen till GPT-6 Astra utan att underhålla två kontrakt eller två klientintegrationer.
Automatisk failover är det som gör det säkert att testa. En ny modell är ännu inte en produktionsväg, och routning genom en enda slutpunkt innebär att en leverantörsincident eller en hastighetsbegränsning flyttar begäran i stället för att låta den misslyckas. Om du vill ta reda på om smakgapet är verkligt i ditt eget arbete är det det billiga sättet att ta reda på det – kör den vid sidan av det du redan har i stället för att ersätta det, och låt din egen svit avgöra i stället för lanseringstabellerna.
Frågan som benchmarks inte kan besvara
Två saker är värda att hålla ögonen på, och ingen av dem är ännu en benchmark-poäng.
Det första är huruvida asymmetrin i ansträngningsinställningen löses. Just nu ger en leverantörstabell på xhigh mot en konkurrent på high en ledning på 8,5 punkter som oberoende testning med matchade inställningar förvandlar till oavgjort. I takt med att oberoende labb publicerar körningar med matchade inställningar på resultattavlorna för science och automation, där GPT-6 Astra för närvarande leder, kan den bilden röra sig i endera riktningen — och den kommer att röra sig utifrån bevis snarare än utifrån någons inramning.
Den andra är frågan om token-effektivitet. Om Claude Opus 5.5:s tankeoverhead minskar i en punktrelease upphör dess 2,5x-fördel i prislistan att vägas upp, och prisargumentet vinner helt. Om så inte sker ligger den praktiker som behöll GPT-6 Astra som sitt huvudverktyg inte efter nyhetscykeln. Denne tolkade sin egen arbetsbelastning korrekt, och lanseringstabellen mätte helt enkelt inte den.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
