Hero-kort med titeln Claude Sonnet 5.5 vs Grok 4.6, med underrubriken prislistan säger en sak, tokenräkningen en annan, med piller som visar output $10 vs $6, kostnad per uppgift $7.60 vs $1.86, och Index 56 vs 44, samt en sidfot som citerar Artificial Analysis v4.3.2 och leverantörspriser.
Guides & Insights

Claude Sonnet 5.5 vs Grok 4.6: Prislistan säger en sak, tokenräkningen säger en annan

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Rubrikens aritmetik verkar vara avgjord redan innan artikeln börjar. Grok 4.6 kostar 2 USD per miljon indatatoken och 6 USD per miljon utdatatoken; Claude Sonnet 5.5 kostar 2 USD och 10 USD. Space​XAI:s modell är 40 % billigare på utdata, matchar på indata och har varit allmänt tillgänglig sedan den 12 augusti 2026 – tillräckligt länge för att dess egenheter ska vara dokumenterade i stället för att bara vara rykten. Anthro​pics modell kom den 28 september 2026, en dag innan detta skrevs, och är det nyaste i klassen med god marginal.

Sedan kommer du till de oberoende effektivitetssiffrorna, och ordningen kastas om. Artificial Analysis mäter GPT- och Claude-klassade modeller utifrån kostnad per uppgift vid sidan av sitt Intelligence Index, och i revisionen v4.3.2 ligger de två modellerna här på $1,86 per indexuppgift för Grok 4.6 och $7,60 för Claude Sonnet 5.5. Modellen med den lägre prislistan är den dyra att driva, med en faktor fyra. Att lista ut varför, och när den omkastningen gäller och inte gäller, är hela jämförelsen.

Två modeller, två positioner i sina egna familjer

Grok 4.6 är den nuvarande flaggskeppsmodellen i Grok-serien — SpaceXAI:s egen utvecklardokumentation listar den som den senaste, och den efterträdde Grok 4.5 med samma kontextfönster på 500 000 tokens, samma yta för text-, bild- och filinmatning och samma basprissättning. Den stöder konfigurerbar resonemangsansträngning, inbyggd verktygsanropning, strukturerade utdata och hela samplingsytan, och som en förstklassig OpenAI Responses-modell passar den in i befintliga agentramverk utan ett översättningslager. Artificial Analysis har den på ett Intelligence Index på 44, rankad 31:a av de 216 modeller som den mäter, med en GPQA Diamond-siffra på 94,9 %.

Two-column scoreboard for Claude Sonnet 5.5 and Grok 4.6 across six rows. Left column Claude Sonnet 5.5: input $2.00 per million, output $10.00 per million, 1M-token context, AA Intelligence Index 56, cost per Index task $7.60, verbosity 410M output tokens. Right column Grok 4.6: input $2.00 per million, output $6.00 per million, 500K-token context, AA Intelligence Index 44, cost per Index task $1.86, verbosity 94M output tokens. A footer line reads Index, cost per task and verbosity per Artificial Analysis v4.3.2; prices per the vendors.

Claude Sonnet 5.5 är den andra posten i Anthropics 5.5-generation och modellen som företaget har positionerat som den bästa kombinationen av snabbhet och intelligens i sitt sortiment. Den levereras som claude-sonnet-5-5/ på Claude API och de tre stora molnen, har ett kontextfönster på 1M tokens med ett synkront utdatatak på 128K, behåller Claude Sonnet 5:s $2 / $10-priser för indata, utdata och cachelagring, och är tillgänglig med noll datalagring. På samma indexrevision får den 56 och rankas som tredje av 216.

Så de två är egentligen inte på samma marknad. Den ena är en frontier-modell med 500 000 tokens som har varit till salu i sju veckor till ett lågt pris. Den andra är en allmän nivå med 1M tokens som inte kostar mer per token än sin föregångare och får tolv poäng högre på kompositen. Jämförelsen är ändå värd att göra, eftersom båda är modeller med $2 i indatapris och det är där inköpsbesluten faktiskt börjar.

Fyragångersgapet som ingen sätter på en bild

Prislistor prissätter tokens. Fakturor är denominerade i uppgifter, och antalet tokens en modell förbrukar för att nå ett svar är ett designval snarare än en konstant. Det är där dessa två går isär, och de uppmätta siffrorna är slående:

• Pris för utdata — Claude Sonnet 5.5 $10 per miljon mot Grok 4.6 $6 per miljon

• Kostnad per Intelligence Index-uppgift — Claude Sonnet 5.5 $7,60 vs Grok 4.6 $1,86

• Mångordighet på indexet — Claude Sonnet 5.5 410M utdatatokens mot Grok 4.6 94M

• Intelligensindex — Claude Sonnet 5.5 56 vs Grok 4.6 44, båda på v4.3.2

• Utdatasthastighet — Grok 4.6 uppmättes till 67 tokens per sekund mot ett medianvärde på 82,7; Anthropic rapporterar att Claude Sonnet 5.5 genererar utdata 30 %+ snabbare än Claude Sonnet 5, som Artificial Analysis tidsmätte till 78,7 tokens per sekund

Linjen om mångordighet är mekanismen. En modell som genererar fyra gånger så många tokens behöver inte en 67 % högre utmatningshastighet för att kosta fyra gånger så mycket per uppgift – men det hjälper, och båda effekterna pekar i samma riktning här. Anthropics egen inramning stöder tolkningen snarare än motsäger den: lanseringsmaterialet hävdar att Claude Sonnet 5.5 ”kostar upp till 30 % mindre per uppgift” än Claude Sonnet 5 vid identiska priser per token, vilket är ett påstående om antal tokens, inte om hastigheter. Jämfört med en extern baslinje som är betydligt snålare blir samma egenskap modellens största kostnadsrisk.

Inget av detta får indexgapet att försvinna. Tolv poäng i composite är en verklig skillnad i förmåga, och en billigare uppgift som misslyckas är inte billigare. Det betyder att den ärliga frågan inte är "vilket pris som är lägre" utan "hur många tokens den svårare uppgiften tar", och den siffran finns bara när du kör din egen arbetsbelastning.

Artificial Analysis model page for Claude Sonnet 5 (Adaptive Reasoning, Max Effort), released June 2026, showing an Intelligence Index of 38, an output speed of 78.7 tokens per second against an average of 83, a cost of $2.00 per million input tokens and $10.00 per million output tokens, $5.09 per Intelligence Index task, a verbosity of 370M output tokens, and a 1M-token context window.

Kontext, insats och integrationens utformning

Den andra skillnaden är av arkitektonisk natur, och den avgör vilken av de två du kan använda utan att behöva skriva om något.

OrcaRouter model page for grok/grok-4.6, attributed to SpaceXAI and dated 2026-08-12, showing a 500K-token context window, text, image and file input, an input price of $2.00 and output price of $6.00 per million tokens, a p50 time to first token of 3.00 seconds, and OpenAI-compatible base URL https://api.orcarouter.ai/v1

Claude Sonnet 5.5 ändrar sex beteenden jämfört med Claude Sonnet 5, varav fem är brytande. Att skicka thinking: {"type": "disabled"}/ returnerar nu en 400 och måste ersättas med between_tools/. Tvingad verktygsanvändning – tool_choice/ med "any"/ eller ett namngivet verktyg – avvisas direkt, så en loop som tvingar fram ett schemagiltigt anrop måste flyttas till auto/ med strikt verktygsanvändning eller strukturerade utdata. Det äldre computer_20251124/ datoranvändningsverktyget avvisas i Claude API och Google Cloud. Tankeblock är nu bundna till modellen och kontot som skapade dem, så en konversation kan föra sitt resonemang framåt från Claude Sonnet 5 men inte i sidled till en annan modellfamilj. Och rådgivarverktyget accepterar inte längre Claude Opus 4.8, Claude Opus 4.7 eller Claude Sonnet 5 som rådgivare bakom en Sonnet 5.5-exekutor.

Grok 4.6 begär inget av detta. Det är en modell i OpenAI-format med samplingsytan intakt, och migreringen från Grok 4.5 är en ändring av modellsträngen. Dess egen kostnadsstruktur har dock en hake, och den är en spegelbild av Anthropics: taxan på $2 / $2 gäller upp till 200 000 indatatokener, och allt därutöver debiteras till $4 / $12. Sonnet 5.5 tar ut standardtaxan över hela 1 miljon.

Ställ de två strukturerna bredvid varandra, och valet handlar inte längre om vilken leverantör som är billigare:

• Korta prompter, kompakt utdata — Grok 4.6:s snålare tokenvanor och lägre utdatahastighet vinner avgörande

• Mycket långa indata — Claude Sonnet 5.5:s enhetliga 1M-taxa börjar överträffa en nivå som fördubblas långt innan kontextgränsen

• Stora enskilda utdata — Sonnet 5.5:s 128K-tak matchar Grok 4.6:s, och den når 300K i Message Batches API bakom output-300k-2026-03-24/ headern

• Befintlig OpenAI-formad kod — Grok 4.6 kräver inga ändringar; Sonnet 5.5 kräver arbetet ovan med verktygsanvändning och tänkande

Få båda på en och samma autentiseringsuppgift

Att hålla en jämförelse mellan två leverantörer i huvudet är lätt. Att köra en är där kostnaden gömmer sig: två konton, två uppsättningar gränser, två faktureringsytor, och ett tokenantal som måste mätas två gånger innan det betyder något.

OrcaRouter komprimerar det till en enda OpenAI-kompatibel endpoint som täcker över 200 modeller, med leverantörens listpris vidarebefordrat och utan påslag, så att en prisändring från leverantören på antingen Grok- eller Claude-sidan är live här samma dag i stället för vid nästa avtalsförnyelse. Hela Grok 4.x-serien finns i katalogen till leverantörens egna priser, och Claude Sonnet 5 har gått att routa sedan den 30 juni till Anthropics 2 / 10 USD — modellen som merparten av Claude API-trafiken fortfarande körs på, uppmätt till 150 uttoken per sekund med en p50-tid till första token på ungefär fem sekunder.

Specifikt finns Claude Sonnet 5.5 ännu inte i vår katalog. Tills dess är leverantörens eget API vägen till den, och sättet att testa den utan att satsa en arbetsbelastning på en modell som ingen oberoende har benchmarkat bortom en enda sammansatt poäng är att skicka en procentandel av trafiken till den bakom automatisk failover, med Grok 4.6 eller Claude Sonnet 5 som fångar upp det den tappar. Att prova en helt ny nivå är ett routningsbeslut, inte ett migreringsprojekt.

Vad ska man göra, jag vet inte vad man ska göra med numrerade span-markörer.

Grok 4.6 är den bättre modellen att ta till när uppgiften är kort, utdata är kompakt och integrationen redan talar OpenAI. Den är mätbart snålare per uppgift än något annat i den här prisklassen, dess samplingskontroller är intakta, och sju veckors tillgänglighet innebär att dess fellägen har hittats av andra.

Claude Sonnet 5.5 är den bättre modellen när indata är enorm, när den sammansatta poängen är det du köper, eller när arbetet är tillräckligt agentiskt för att ett indexgap på tolv punkter och ett utdatatak på 128K betyder mer än en fyrdubbel skillnad i kostnad per uppgift. Migrationschecklistan är verklig, och det är en dags arbete snarare än en redigering av modellsträngen.

Det som skulle avgöra saken är en mätning av tokens per uppgift på din egen trafik, utförd på båda. Varje siffra i den här artikeln som avgör utfallet – 1,86 $ mot 7,60 $, 94M mot 410M – är en proxy för den där siffran, och den är den enda av dem som du själv kan ta fram.

Jämförda i den här artikeln4

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen