
GPT-6.1 Sol vs Claude Opus 5.5: En verklig klyfta, ojämnt fördelad
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 141 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 294 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Gapet på fem komma åtta poäng mellan Claude Opus 5.5 och GPT-6.1 Sol på Artificial Analysis Intelligence Index är det största av alla par i den här uppsättningen, och till skillnad från de flesta av dem kommer det inte att slutas genom en inställningsändring. Claude Opus 5.5, som släpptes den 22 september 2026 och debiteras med 4,00 dollar per miljon indata-tokens och 20,00 dollar per miljon utdata-tokens, får 57,6 poäng. GPT-6.1 Sol, som släpptes den 29 september 2026 till 2,00 och 10,00 dollar, får 51,8 poäng. Claude Opus 5.5 är modellen med högst poäng, med en marginal som är större än den som skiljer de flesta frontier-modeller från varandra, och det kostar 8,3× mer per uppgift att nå dit — 5,98 dollar mot 0,72 dollar. Än så länge vinner den dyra modellen helt enkelt, vilket är den minst intressanta versionen av den här jämförelsen. Det som gör den värd att läsa är att de 5,8 poängen inte är jämnt fördelade över testsviten: på den enda axeln som avgör det mesta av arbetet med långa dokument och långa sessioner ligger de två modellerna inom två poäng från varandra.
Båda är flaggskeppsmodeller i samma marknadssegment: kontextfönster i 1M-klass, utdatatak på 128K, text-, bild- och filinmatning, utökat tänkande på ena sidan och en femstegs ansträngningsstege på den andra. Claude Opus 5.5 efterträder Claude Opus 5 och är positionerad för krävande resonemang, kodning och agentiskt arbete över långa tidshorisonter; GPT-6.1 Sol ligger en nivå under GPT-6 Astra och är positionerad för agentisk kodning, datoranvändning och dokumenttungt professionellt arbete. De riktar sig mot samma uppgifter. Mätningen säger att de inte är lika bra på alla.
Var de 5,8 poängen faktiskt finns
Ett sammansatt index döljer sina komponenter. Hämta de enskilda utvärderingarna, och gapet slutar se ut som ett gap och börjar se ut som en profil.
• Humanity's Last Exam — Claude Opus 5.5 61,4 % mot GPT-6.1 Sol 52,9 %, en skillnad på 8,5 punkter i abstrakt resonemang
• SciCode — Claude Opus 5.5 66,9 % mot GPT-6.1 Sol 54,2 %, en spridning på 12,7 punkter för kod av forskningskvalitet
• Återkallning i lång kontext – Claude Opus 5.5 84,7 % mot GPT-6.1 Sol 83,0 %, en skillnad på 1,7 procentenheter när det gäller att hämta fakta från en lång indata
• Terminal-Bench 4.0 — Claude Opus 5.5 59,6 % mot en Sol-siffra som inte publicerats i samma revision
• Kontextfönster — GPT-6.1 Sol 1 050 000 tokens mot Claude Opus 5.5 1 000 000 tokens, med ett utdatatak på 128 000 tokens för båda
• Kostnad per indexuppgift — Claude Opus 5.5 $5.98 vs GPT-6.1 Sol $0.72
Fördelningen är själva berättelsen. Där uppgiften är abstrakt resonemang – en svår tentamensfråga, ett kodningsproblem på forskningsnivå utan ett befintligt svar att kopiera – ligger Claude Opus 5.5 avgjort före, och en SciCode-skillnad på 12,7 punkter är inte brus. Där uppgiften är att hitta rätt avsnitt i en mycket lång indata och använda det, är de två modellerna i praktiken jämbördiga, och GPT-6.1 Sol håller den positionen med 50 000 fler token i kapacitet. En stor del av produktionsarbetet med LLM:er är av det andra slaget: sökförstärkt besvarande, granskning av avtal och inlämnade dokument, analys av loggar och transkript, kodgranskning i ett stort kodförråd. Det arbetet mäts av den tredje punkten, inte de två första, och på den punkten ger premiumversionen 1,7 punkter.
Att läsa indexraderna ärligt
Två förbehåll hör hemma bredvid de siffrorna snarare än längst ner på sidan.
Konfigurationerna skiljer sig åt. Artificial Analysis visar Claude Opus 5.5 i en "Max, Default Fallback"-konfiguration och GPT-6.1 Sol vid maximal ansträngning. Båda är de starkaste inställningarna som respektive modell publiceras under, vilket gör jämförelsen rättvis, men det är en jämförelse mellan två tak snarare än två standardinställningar som faktiskt levereras. Claude Opus 5.5:s egna standardinställningar i ett hostat API kan skilja sig från körningen i diagrammet, och GPT-6.1 Sols standardansträngning är medium.
Raden för Terminal-Bench är avsiktligt tom på ena sidan. Claude Opus 5.5:s 59,6 % kommer från den Artificial Analysis-revision i vilken den publicerades; motsvarande siffra för GPT-6.1 Sol finns inte tillgänglig i en matchande revision. Att citera en siffra från en annan körning av samma benchmark skulle vara en falsk jämförelse, och det ärliga draget är att lämna cellen tom i stället för att fylla den med något som är ungefär rätt.
Mångordigheten drar åt samma håll här som den gjorde mot de billigare syskonen: Claude Opus 5.5 emitterar 260M uttoken i indexsviten mot GPT-6.1 Sols 67M, en skillnad på 3,9× vid en taxa som redan är dubbelt så hög. Det är därifrån en kvot på 8,3× per uppgift kommer, när prislistan visar 2× på indata och 2× på utdata. Premien är inte 8,3× för att modellen kostar 8,3× – den är 8,3× för att den kostar 2× och tänker 3,9× så länge.
Argumentet för att betala det
Om ditt arbete liknar de två första punkterna är beräkningen enkel, och den talar till förmån för Claude Opus 5.5. En skillnad på 12,7 punkter på vetenskaplig kod av forskningskvalitet, eller 8,5 punkter på svårt abstrakt resonemang, är skillnaden mellan en agent som stänger ett ärende utan övervakning och en som behöver en människa vid var tredje steg. Agentisk kodning över en stor kodbas är den arbetsbelastning som båda leverantörerna nämner först, och det är den arbetsbelastning där spridningen är som störst. Att betala 5,98 $ i stället för 0,72 $ per uppgift för att undvika en misslyckad körning som kostar en ingenjör tjugo minuter är inte ett tveksamt val.
Det finns ett andra argument som inte handlar om poäng alls. Claude Opus 5.5 är femton dagar gammalt och har genererat en mängd tredjepartsutvärdering, granskning och driftsättningserfarenhet som en åtta dagar gammal modell inte har. För en produktionsväg är mognaden hos den omgivande kunskapen värd något som indexet inte prissätter.
Argumentet mot, och siffran som avgör
Motargumentet är raden för lång kontext. Om den dominerande formen på din trafik är "stor indata, kort svar" – och för väldigt många team är den det – då är axeln du debiteras för inte den axel du konsumerar. Vid återkallning i lång kontext skiljer de två modellerna sig 1,7 punkter vid ett prisförhållande på 8,3×, och den billigare modellen har det större fönstret. Det är fallet där premien är verklig, uppmätt och spenderad på kapacitet som arbetsbelastningen aldrig utnyttjar.
Det avgörande talet är alltså inte indexet. Det är andelen av dina uppgifter som ser ut som SciCode snarare än som återkallning. Team som kan besvara den frågan utifrån sina egna loggar bör besvara den utifrån sina egna loggar; en benchmarksvit är en proxy för en blandning av arbetsuppgifter, och blandningen är variabeln.
Båda på en och samma tangent, vilket är det som gör att frågan går att besvara.


Claude Opus 5.5 finns på OrcaRouter till sitt eget pris på $4.00 / $20.00 med cacheläsningar till $0.20. GPT-6.1 Sol finns på OrcaRouter till $2.00 / $10.00, och stiger till $4.00 / $15.00 över 272,000 prompt-tokens, med cacheläsningar till $0.10. Båda till leverantörens listpris, utan påslag, på en nyckel och en faktura.
Det spelar större roll än vanligt för den här kombinationen, eftersom de två modellerna inte är substitut — de är ett routningsbeslut. Skicka arbetet med långa dokument och hög volym till GPT-6.1 Sol, behåll det tunga resonemanget och kodmodifieringsarbetet på Claude Opus 5.5, och båda ligger bakom samma slutpunkt med samma autentiseringsuppgifter. Om en rutt försämras flyttar automatisk failover anropet i stället för att misslyckas, och eftersom routningen är deklarativ kan den uttryckas per uppgiftsklass i stället för per applikation. Att testa uppdelningen är en konfigurationsändring, inte en migrering.
Det sista som är värt att säga gäller hållbarheten hos den här jämförelsen. Båda modellerna är dagar eller veckor gamla. GPT-6.1 Sol har en publicerad oberoende konfiguration; Claude Opus 5.5 har en. En enstaka körning per modell är en ögonblicksbild, och det intressanta felmodet är inte att ett av dessa tal är fel — det är att en konfiguration med medelhög ansträngning, eller en andra utvärderare, ritar om profilen. Fram till dess är den försvarbara tolkningen den som komponenterna ger: ett avgörande gap i svår resonemangsförmåga och forskningskod, ett litet i långkontextarbete, och en räkning på 8,3× som måste motiveras av den del av din arbetsbelastning som liknar det förra.

Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
