
Claude Opus 5.5 vs GPT-5.6 Sol: Två lanseringstabeller som knappt överlappar varandra
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
Ställ Claude Opus 5.5 och GPT-5.6 Sol sida vid sida den här veckan och det första du lägger märke till är inte en vinnare. Det är att de två leverantörerna publicerade benchmark-tabeller som knappt har en enda rad gemensam. Lanseringsmaterialet för Claude Opus 5.5, släppt den 22 september 2026, placerar den 29 poäng före GPT-5.6 Sol på Terminal-Bench 4.0. Lanseringsmaterialet för Sol, allmänt tillgängligt sedan den 9 juli 2026, leder i stället med Terminal-Bench 2.1, där Sol Ultra fick 91,9 %, och Artificial Analysis Coding Agent Index, där den tog förstaplatsen på 80. Båda tabellerna är verkliga. Båda kördes av leverantören som vinner dem. Den användbara frågan är inte vilken modell som är bättre i abstrakt mening — det är vilket benchmark, kört under vems testramverk, som säger dig något om din arbetsbelastning. Det är en svårare fråga än vad något av lanseringsinläggen vill att du ska ställa, och det är den som den här jämförelsen är uppbyggd kring.
De två modellerna, sida vid sida

• Leverantör — Anthropic vs OpenAI
• Släppt — Claude Opus 5.5 den 22 september 2026 vs GPT-5.6 Sol den 9 juli 2026
• Pris per miljon tokens — $4,00 indata / $20,00 utdata jämfört med $5,00 indata / $30,00 utdata
• Cache-läsning — $0.20 per miljon på Opus 5.5; Sols cache-pris sätts per plattform och publiceras inte som en enda jämförbar siffra
• Kontextfönster — 1M tokens på båda
• Maximal utdata — 128K tokens på båda, med 300K på Anthropics Batch API bakom en beta-header
• Kunskapsgräns – juni 2026 för Opus 5.5 mot 16 februari 2026 för Sol
• Resonemangsstyrning — adaptivt tänkande alltid på, standard medium ansträngning, skalan går från låg till max jämfört med en inställning för maximal resonemangsansträngning plus ett Ultra-läge som koordinerar parallella subagenter
• Produktlinje — Opus 5.5 är den första i en 5.5-familj, med Sonnet 5.5 och Haiku 5.5 utlovade under de kommande veckorna, jämfört med Sol som flaggskeppet i en familj med tre nivåer tillsammans med Terra och Luna
Två av dessa rader gör mer arbete än de andra. Gapet i kunskapsavskärning är fyra månader brett, vilket spelar roll om dina prompter berör något som hände i våras. Och Opus 5.5 underbjuder nu Sol på både input- och outputpris — en helomvändning jämfört med för tre månader sedan, då Sol var det billigare sättet att nå output i frontierklass och Claude Opus 5 låg på $5/$25.
De enda raderna där båda modellerna faktiskt förekommer
Det finns exakt en publicerad tabell som innehåller båda modellerna, och den är Anthropics. Varje siffra i den är leverantörsrapporterad, framtagen av företaget som säljer en av de två modellerna:
• Terminal-Bench 4.0 — Claude Opus 5.5 66,4 % mot GPT-5.6 Sol 37,3 %
• Terminal-Bench-Science 0.1 — 58,7 % mot 22,4 %
• FrontierCode v1.1 (Main) — 54,4 % mot 47,5 %
• CursorBench 4.0 — 57,8 % vs 41,7 %
• AutomationBench — 40,0 % mot 28,8 %
• GDPval-AA v2.1 — 1846 Elo mot 1588
Det är en totalseger, och marginalerna i de två Terminal-Bench-raderna är tillräckligt stora för att de förtjänar att granskas snarare än att accepteras. Anthropics egen fotnot gör en del av det arbetet åt dig: Opus 5.5-körningen i Terminal-Bench använde xhigh effort i stället för standardinställningen, och vid standardinställningen medium effort minskar FrontierCodes försprång till 54,6 % mot 47,5 % – en skillnad på sju punkter i stället för rubriksiffrorna. Anthropic kopplar också en allmän varning till hela tabellen och säger att benchmarkmarginaler på den här kapacitetsnivån är "en mindre tillförlitlig guide till skillnader i verkligheten" och att dess interna gap till Claude Fable 5.1 är mindre än vad poängen antyder. En leverantör som nedtonar sin egen tabell är den mest trovärdiga meningen i den.
Notera också vad som saknas i den tabellen: något benchmark där OpenAI:s modell vinner. En leverantörstabell som bara innehåller fördelaktiga rader är inte bevis för en totalseger; det är bevis för radurval.
Vad OpenAIs egna siffror säger
Sols lanseringsmaterial berättar en annan historia, med andra benchmarks, i en annan testrigg. Rapporterat vid lanseringen i juli:
• Terminal-Bench 2.1 — 91,9 % för Sol Ultra och 88,8 % för standard-Sol, mot Claude Mythos 5 på 88,0 % och Claude Fable 5 på 84,3 %
• Artificial Analysis Coding Agent Index — 80, som vid tidpunkten beskrevs som det bästa som fanns, 2,8 poäng över Claude Fable 5
• Agents' Last Exam, långvariga professionella arbetsflöden – 53,6, vilket OpenAI rapporterade som 13,1 poäng före Claude Fable 5
• BrowseComp — 92,2 %; OSWorld 2.0 — 62,6 %; SWE-Bench Pro — 64,6 %
Ingen av dessa rader innehåller Claude Opus 5.5, eftersom den inte existerade i juli. Sols tabell byggdes för att slå Fable 5 och Mythos 5, och det gör den. Huruvida den slår Opus 5.5 besvaras helt enkelt inte av någon av leverantörernas material – de två tabellerna sammanställdes med två månaders mellanrum mot olika motståndare.
Raden för SWE-Bench Pro förtjänar en särskild kommentar, eftersom det är den enda platsen i OpenAI:s lanseringsmaterial där deras modell visas förlora: 64,6 % för Sol mot 80 % för Claude Fable 5. OpenAI svarade med att ifrågasätta benchmarkens validitet och uppskattade att ungefär 30 % av dess uppgifter är trasiga. Det kan mycket väl vara sant. Det är också en användbar påminnelse om att ”den här benchmarken är bristfällig” är ett påstående som båda labben gör, och alltid om den benchmark där de förlorar.
Seleproblemet, som ingens tabell löser

Anledningen till att de två tabellerna inte stämmer överens är inte att en leverantör ljuger. Det är att agentiska kodningsbenchmarkar mäter en modell plus en scaffold, och scaffolderna skiljer sig åt. Terminal-Bench 4.0 och Terminal-Bench 2.1 är olika revisioner av samma idé, körda av olika personer, med olika verktygsbudgetar och olika regler för återförsök. Anthropics Opus 5.5-siffror togs fram i Anthropics harness; OpenAIs Sol-siffror i Codex-liknande verktygsmiljö. Flytta endera modellen till den andras harness så ändras poängen.
Oberoende data, där sådan finns, beskriver en jämnare kamp än någon av tabellerna. Ett agentbenchmark från en tredje part från augusti 2026, kört över flera modeller på verkligt applikationsarbete, utsåg GPT-5.6 Sol till den bästa kombinationen av noggrannhet, kostnad och hastighet – omkring 0,52 USD och fem minuter per körning – medan Claude Opus 5, inte 5.5, var mest noggrann i 92 % av körningarna. En separat resultattavla för företagsinriktade koduppgifter placerade Claude Opus 5 först med 96,4 % och GPT-5.6 Sol på tredje plats med 86,5 %, återigen en jämförelse av Sol med den tidigare Opus snarare än den nya. Ingen av dem är en direkt jämförelse med Opus 5.5, och ingen av dem avgör något. De visar dock att när någon annan än en leverantör gör jämförelsen, blir marginalerna små.
Den praktiska slutsatsen är att sluta läsa tabellerna som en rangordning och börja läsa dem som en lista av hypoteser. Om ditt arbete är terminalautomatisering med lång horisont är Anthropics Terminal-Bench-gap en hypotes värd att testa på dina egna uppgifter. Om det är professionell forskning i flera steg är resultatet för Sol's Agents' Last Exam samma typ av hypotes. Inget av talen överförs till din arbetsbelastning utan en körning.
Kostnad per slutförd uppgift, vilket är den enda kostnaden som spelar roll
På prislistan är Claude Opus 5.5 nu billigare i båda riktningarna: 4,00 USD mot 5,00 USD för indata, 20,00 USD mot 30,00 USD för utdata, och en cache-läsningstaxa på 0,20 USD som är 60 % lägre än vad Claude Opus 5 tog ut. För en agent som skickar en lång systemprompt på nytt varje tur är den cache-raden den dominerande kostnaden och anledningen till att en långvarig session kan bli väsentligt billigare utan någon ändring av prompten.
Men priset per token har aldrig avgjort en agents faktura. OpenAI:s argument för Sol vid lanseringen vilade på token-effektivitet snarare än prislappen – man rapporterade en förbättring på 54 % i token-effektivitet för kodning, med uttoken och förfluten tid på under hälften av Claude Fable 5:s, till cirka en tredjedel lägre kostnad. Anthropic för fram det spegelvända argumentet för Opus 5.5: cirka 40 % lägre kostnad för att köra typiska arbetsbelastningar än Claude Opus 5, på en prislista som bara sänktes med 20 %, där kundutlåtanden från Box, Kiro, Factory och GitHub alla hänvisar till stora minskningar av tokens eller steg. Båda påståendena pekar i samma riktning – modellen som blir klar på färre turer vinner – och inget av dem är oberoende granskat.
Där oberoende beräkningar av kostnad per uppgift faktiskt finns, gynnar de för närvarande Sol: en analys som publicerades i september satte GPT-5.6 Sol till 1,56 USD per löst problem på SWE-bench Verified med 96,2 % framgång, mot Claude Opus 4.8 på 88,6 %. Det är Sol mätt mot en äldre Anthropic-modell, inte mot Opus 5.5, så det är en utgångspunkt snarare än ett domslut — men det är en påminnelse om att en modell som löser problemet vid första försöket är billigare än en billigare modell som behöver tre försök. Den enda mätning som avgör detta för dig är din egen uppgift, körd på båda sätten, med tokenantalet framför dig.
Det är ett routingproblem snarare än ett inköpsproblem, och det är värt att vara precis om vilken sida av det som redan är lösbar. GPT-5.6 Sol finns på OrcaRouter i dag till OpenAIs eget listpris med 0 % påslag – leverantörens listpris förs vidare direkt, så en ändrad leverantörstaxa är live hos oss samma dag i stället för efter en synk. Claude Opus 5.5 är inte en av våra rutter ännu; den finns via Anthropics eget API och de stora molnen. När den väl är på plats betjänar samma nyckel båda, vilket är det som förvandlar experimentet till en routingregel i stället för ett andra avtal och ett andra SDK: skicka arbetsbelastningen till den modell som dina egna siffror talar för, håll automatisk failover riktad mot den andra, och låt en routing-DSL-rad avgöra per förfrågan i stället för per kvartal. En prissänkning på någon av sidorna är en konfigurationsändring, inte en migrering.

Där de två verkligen skiljer sig åt
Rensa bort benchmarkarna och fyra skillnader kvarstår, alla kontrollerbara:
• Kunskapsgräns. Juni 2026 för Opus 5.5 mot 16 februari 2026 för Sol. Fyra månader är en verklig lucka för allt som rör nya bibliotek, aktuella händelser eller nyligen ändrade API:er, och ingen benchmark fångar det.
• Skyddsroutning. Opus 5.5 levereras med skyddsåtgärder av Fable 5.1-klass: de flesta cybersäkerhetsförfrågningar omdirigeras till Claude Opus 4.8 och biologiarbete faller tillbaka på Claude Opus 5 om inte kontot är verifierat. Om din produkt ligger inom någon av dessa domäner besvaras en del av din trafik av en mindre modell. Sol har ingen motsvarande dokumenterad routning, även om OpenAI visserligen nämner sina egna cybersäkerhetsrelaterade säkerhetsutvärderingar.
• Orkestrering. Sol levererar ett Ultra-läge som koordinerar flera parallella subagenter, fyra som standard, samt en inställning för maximal resonemangsansträngning. Opus 5.5 har inget av detta som plattformsfunktion; dess hävstång är parametern för ansträngning, och komposition av flera modeller är något du bygger eller dirigerar snarare än något leverantören ger dig.
• Familjeekonomi. Sol är en av tre nivåer, med Terra och Luna under sig – och Lunas pris sänktes med 80 % och Terras med 20 % i en uppdatering den 30 juli. Anthropics billigare syskon, Sonnet 5.5 och Haiku 5.5, är annonserade men inte släppta. Om din arbetsbelastning är blandad erbjuder OpenAI för närvarande de billigare nivåerna redan idag.
Att välja mellan dem
Välj Claude Opus 5.5 om ditt arbete är långkörande agentisk kodning eller kunskapsarbete, om priset per token spelar roll, om dina prompter berör något från de senaste fyra månaderna, eller om en kontext på 1M tokens till $0.20 per miljon cachade är det som gör din arkitektur överkomlig. Börja på medelansträngning, inte den ärvda höga inställningen, och mät om låg håller.
Välj GPT-5.6 Sol om du vill ha ett leverantörsbundet orkestreringsläge, om du behöver en billigare nivå under flaggskeppet idag i stället för om några veckor, eller om din arbetsbelastning är av det slag som Sols eget lanseringsunderlag täcker bäst – långsiktiga professionella arbetsflöden och datoranvändning, där den rapporterade sina starkaste resultat.
Om du redan använder Claude Opus 5, observera att Opus 5.5 inte är direkt utbytbar: tänkande kan inte längre inaktiveras, påtvingad verktygsanvändning returnerar ett fel, tänkandeblock är bundna till modellen och konversationen, och det äldre computer_20251124 datoranvändningsverktyget accepteras inte i Claude API eller Google Cloud. De tre första gäller även för Claude Fable 5.1. Att byta till Sol är en helt annan integration.
Vad som faktiskt skulle avgöra den här jämförelsen är en enda oberoende körning av båda modellerna vid matchad ansträngning, i ett matchat testramverk, på samma uppgiftsuppsättning. I skrivande stund denna vecka har ingen publicerat en sådan. Tills någon gör det är den ärliga hållningen den som bevisen stöder: Anthropics tabell talar för Opus 5.5 och producerades av Anthropic; OpenAIs tabell talar för Sol och producerades av OpenAI; de oberoende resultat som finns jämför Sol med den tidigare Opus och beskriver en mycket jämnare kamp; och de två rader som kommer att avgöra din faktura — tokens per slutförd uppgift och cacheläsningsvolym — är de två rader som ingen av leverantörerna publicerar.
Jämförda i den här artikeln3
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
