Genererade ett hero-titelkort för Claude Opus 5.5 vs Grok 4.6, uppdelat av en vertikal avdelare: "Claude Opus 5.5" med "$4.00 / $20.00" till vänster, "Grok 4.6" med "$2.00 / $6.00" till höger, och taglinen "EN MODELL LÄSER, DEN ANDRA AGERAR" längst ned, med OrcaRouter-logotypen i det nedre högra hörnet.
Guides & Insights

Claude Opus 5.5 vs Grok 4.6: En modell läser, den andra agerar

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Claude Opus 5.5 och Grok 4.6 är de två billigaste sätten att köpa en modell i frontierklass som klarar en halv miljon tokens i kontext – och de är inte samma produkt. På ett mätetal ligger Grok 4.6 tre punkter från det absoluta taket: 94,9 på GPQA Diamond, en uppsättning naturvetenskapliga frågor på avancerad nivå där Anthropics flaggskepp ligger i samma intervall. På nästa mätetal ligger den trettioåtta punkter efter. På Terminal-Bench 4.0, det agentiska terminalbenchmarket som ber en modell att slutföra verkligt arbete i ett shell, betygsatte Artificial Analysis Grok 4.6 till 21,21 % och Claude Opus 5.5 till 59,60 %. Det är inte ett tryckfel åt något håll, och hela formen på den här kombinationen ligger i att förklara varför båda siffrorna är sanna samtidigt.

Två släpp, en prisklass, fyra månader isär

SpaceXAI släppte Grok 4.6 den 12 augusti 2026 som det nuvarande flaggskeppet i Grok-serien, till 2,00 USD per miljon indatatoken och 6,00 USD per miljon utdatatoken, med ett kontextfönster på 500 000 token och en inmatningsyta för text, bild och fil. Anthropic släppte Claude Opus 5.5 den 22 september 2026, ungefär sex veckor senare, till 4,00/20,00 USD med ett kontextfönster på 1 000 000 token och 128 000 utdatatoken. Båda stöder konfigurerbar resonemangsansträngning, verktygsanrop och strukturerade utdata; båda talar ett OpenAI-kompatibelt chattgränssnitt liksom respektive leverantörs eget format.

Så den naiva läsningen är en enkel avvägning: Grok 4.6 kostar hälften så mycket på input och ungefär en tredjedel på output, medan Claude Opus 5.5 svarar med dubbelt så stort kontextfönster. Den avvägningen är verklig, och vid arbete med långa dokument kan den vara det enda som spelar roll. Det är inte heller där den intressanta divergensen finns, eftersom de två modellerna har mätts i samma oberoende testramverk och inte landade på samma plats på de axlar som spelar roll för agentiskt arbete.

Vad katalogen säger om de axlar som båda mättes på

OrcaRouters katalog innehåller benchmark-härkomst per rad — varje siffra anger vilken utvärderare den kommer från — så paren nedan kommer alla från en och samma källa för båda modellerna, Artificial Analysis, i stället för ett leverantörsnummer på ena sidan och en tredje part på den andra:

• GPQA Diamond — Claude Opus 5.5 finns inte med på denna axel i vår katalog; Grok 4.6 får 94,9 %

• Humanity's Last Exam – 61,4 % för Claude Opus 5.5 mot 42,9 % för Grok 4.6

• SciCode — 66,9 % mot 56,5 %

• Långkontextsåterkallning — 84,7 % mot 80,3 %

• Terminal-Bench 4.0 — 59,60 % mot 21,21 %

• AA Intelligence Index — 57,6 mot 44,3

GPQA-raden lämnas medvetet tom på Anthropic-sidan i stället för att fyllas i från en leverantörspresentation. Grok 4.6:s 94,9 i den raden är den starkaste siffran på dess modellkort, och den är äkta – en oberoende mätning, inte ett SpaceXAI-påstående – och den säger något verkligt om modellen: när uppgiften är en välformulerad fråga med ett försvarbart svar presterar Grok 4.6 i absoluta framkanten. Läs den bredvid Terminal-Bench 4.0:s 21,21 % och formen blir begriplig. Att producera ett korrekt svar om vetenskap och att utföra en femstegsuppgift i ett shell mot ett verkligt filsystem är olika kompetenser, och Grok 4.6 har kommit mycket längre med den första än med den andra.

Ett förbehåll beträffande den sammankopplingen innan den används som ett utlåtande: de två modellernas siffror från Artificial Analysis registrerades vid olika utvärderingsdatum, och Grok 4.6:s är den äldre uppsättningen. Jämförelsen är mellan en modell som utvärderades i augusti och en som utvärderades i september i en testrigg som själv har reviderats under den perioden. Riktningen på gapet är konsekvent över fem separata axlar, vilket är anledningen till att vi betraktar det som signal, men de exakta poängvärdena bör läsas som en jämförelse mellan augusti och september, inte som en jämförelse samma dag.

Ett index byggt av någon som inte säljer någotdera.

Det finns ett andra oberoende mått, och det är överens om riktningen samtidigt som det är mycket mindre villigt att göra fina åtskillnader. Epoch Capabilities Index, byggt av Epoch AI som en sammansättning av fler än femtio benchmarks och omskalat så att Claude 3.5 Sonnet ligger på 130 och GPT-5 på 150, placerar Claude Opus 5.5 på 167,35 i filen vi läste den 2 oktober 2026. Grok 4.6 ligger på 156,61, från en utvärdering den 12 augusti. Det är en skillnad på 10,74 punkter på en skala där ungefär fem punkter observerades motsvara en fördubbling av METR:s tidshorisontmått vid indexets lansering — stor, och med god marginal utanför de två modellernas publicerade intervall på 164,0 till 172,0 och 154,66 till 158,93, vilka inte överlappar varandra alls.

Värt att notera vad detta index inte avgör. Det placerar Claude Sonnet 5.5 på 165,2 och Claude Fable 5.1 på 164,82, båda över Grok 4.6, och båda är billigare per miljon utdatatokens än Grok 4.6:s taxa för den andra nivån. Den som enbart väljer efter kapacitet per dollar har ett tredje och fjärde alternativ inom samma leverantörsfamilj, och parkopplingen i den här artikeln handlar om något annat: vad de två modellerna är bra på var för sig.

Prislistorna, och raden som bara förekommer på en av dem

A two-column scoreboard comparing Claude Opus 5.5 and Grok 4.6 across six rows. Left column Claude Opus 5.5: input $4.00, output $20.00, cache read $0.20, context 1M tokens with 128K max output, AA Intelligence Index 57.6, Epoch Capabilities Index 167.35. Right column Grok 4.6: input $2.00 doubling to $4.00 above 200K tokens, output $6.00 doubling to $12.00, cache read $0.50, context 500K tokens, AA Intelligence Index 44.3, Epoch Capabilities Index 156.61. A footer line reads 'Prices and catalogue figures per the OrcaRouter catalogue; Index figures per Artificial Analysis and the Epoch Capabilities Index.'

Grok 4.6:s prislista har ett steg som Claude Opus 5.5:s inte har: förfrågningar över 200 000 prompttokens debiteras till dubbla baspriset, så indata går från 2,00 USD till 4,00 USD och utdata från 6,00 USD till 12,00 USD, medan cacheläsningen går från 0,50 USD till 1,00 USD. Claude Opus 5.5 tar 4,00 USD/20,00 USD med cacheläsningar på 0,20 USD oförändrat över hela fönstret på 1 000 000 tokens. Den inversionen är den praktiska konsekvensen av att köpa lång kontext från endera modellen, och den vänder på prislappsjämförelsen när en arbetsbelastning faktiskt växer:

• Pris vid 30 000 indatatokens – Claude Opus 5.5 är den dyra, på cirka 28 cent för 30 000 in och 8 000 ut, mot cirka 11 cent för Grok 4.6

• Pris vid 250 000 indatatoken – ordningen vänds, eftersom Grok 4.6 har klivit till sin fördubblade nivå medan Claude Opus 5.5 inte har det

• Cacheläsningar – 0,20 USD per miljon för Claude Opus 5.5, mot 0,50 USD för Grok 4.6, som stiger till 1,00 USD över tröskeln.

• Maximal utdata — 128 000 tokens för Claude Opus 5.5; Grok 4.6:s utdatatak finns inte publicerat i katalogposten

Grok 4.6 har också en lucka som är värd att säga rakt ut i stället för att lämna till att upptäckas senare. Dess dokumentation anger inte någon siffra för maximal utdata alls – fältet är omätt, inte noll – så en arbetsbelastning som är beroende av mycket långa enskilda svar har inget publicerat tal att planera mot på den sidan av jämförelsen.

Prestandakolumnen som inte bör läsas

Vår katalog innehåller också en panel för tjänsteprestanda per modell, och på Grok 4.6 är det det mest missvisande på sidan. Kortet visar en p50-latens på 10 000 millisekunder och en felfrekvens på 97,58 % över ett sjudagarsfönster, med 26 184 tokens som betjänades under perioden. Dessa fält beskriver inte en långsam modell. De beskriver en modell som knappt anropades: vid den trafiknivån är urvalet för tunt för att en latensfördelning ska betyda något, och felfrekvensen återspeglar en handfull försök snarare än en tjänstekvalitet. Att behandla det blocket som bevis för att Grok 4.6 är långsam skulle vara att läsa en mätartefakt som en mätning.

Claude Opus 5.5:s panel har däremot en population bakom sig – ett p50 i 4,4-sekundersintervallet över ett sjudagarsfönster med dagliga stickprov, och 156 miljoner tokens serverade under samma period. Även det bör läsas som vad det är: vår egen playground-trafik, som är ett urval av våra användare snarare än en egenskap hos modellen.

Vilken man ska routa, och hur man tar reda på det i sitt eget arbete

Uppdelningen som siffrorna beskriver är tillräckligt stabil för att agera på. Claude Opus 5.5 är valet för agentiskt arbete och arbete med lång horisont – gapet i Terminal-Bench 4.0 på 59,60 % mot 21,21 % är den största skillnaden på någon axel som båda modellerna mättes på, och det är den axel som förutsäger om en modell kan tilldelas en uppgift i stället för en fråga. Det är också valet när prompten är genuint lång, eftersom prislistan inte trappas upp och fönstret är dubbelt så stort. Grok 4.6 är valet för frågeformat arbete i volym: en GPQA Diamond-poäng på 94,9 % för $2.00/$6.00 inom de första 200 000 tokenen är en mycket bra affär för arbetsbelastningar för hämtning och svar som aldrig växer in i den fördubblade nivån.

Båda finns på OrcaRouter till leverantörens listpris med 0 % påslag — Claude Opus 5.5 för $4.00/$20.00 med cacheläsningar för $0.20, Grok 4.6 för $2.00/$6.00 med nivån över 200K tillämpad exakt så som SpaceXAI anger den — bakom en nyckel, så uppdelningen ovan kan testas på din egen promptuppsättning i stället för att diskuteras. Där båda routas, automatisk failover ligger under, vilket är värt att ha när den billigare modellen är den som håller den agentiska vägen.

Domen som detta par förtjänar: Grok 4.6 är den bättre läsaren och Claude Opus 5.5 är den bättre arbetaren. 94,9 på GPQA Diamond och 21,21 på Terminal-Bench är samma modell mätt två gånger, och att veta vilket av dessa två tal din arbetsbelastning liknar är hela beslutet.

Screenshot of the OrcaRouter model page for Claude Opus 5.5 (anthropic/claude-opus-5.5), showing the model header, a 1M-token context window with up to 128K output, the Vision, Tools, JSON and Reasoning capability tags, and the input and output price figures per million tokens.Screenshot of the OrcaRouter model page for Grok 4.6 (grok/grok-4.6), showing the model header, the context window of 500,000 tokens, the text, image and file input surface, the capability tags, and the input and output price figures per million tokens.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen