
Grok 4.6 vs Claude Opus 5: Samma 61, två olika ekonomier
- DeepSeekNYDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M tokens
- z-aiNYZ.ai: GLM 5.32026-08-1860Intelligens75Kodning
- obsidianNYQwen3.8 27B2026-08-1552Intelligens68Kodning
- qwenNYQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNYDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligens69Kodning
- grokNYSpaceXAI: Grok 4.62026-08-1261Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligens77Kodning
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligens77Kodning
Artificial Analysis kör varje frontmodell genom samma nio utvärderingar och publicerar fakturan. På sitt Intelligence Index, Grok 4.6 och Claude Opus 5 landar på samma siffra — 61 — vilket gör detta till en sällsynt head-to-head där det sammansatta indexet inte kan tala om för dig vilken du ska använda. Det som kan avgöra är en mindre känd siffra från samma källa: på AA-Briefcase kunskapsarbetssviten slutförde Grok 4.6 en uppgift på ungefär 53 turer och ungefär en halv miljard inmatningstokens, medan Claude Opus 5 med maximal ansträngning behövde ungefär 103 turer och två miljarder tokens för samma arbete. Det är en fyra-till-en-skillnad i tokenförbrukning mellan två modeller vars toppsiffra är identisk, och den dyker bara upp när du slutar jämföra modellkort och börjar jämföra räkningar.
Båda modellerna är aktuella flaggskeppslanseringar, vilket gör detta till en ren jämförelse snarare än en generationsskillnad. Grok 4.6 släpptes den 12 augusti 2026 från SpaceXAI som en förfining av Grok 4.5-grunden — samma bas med 1,5 biljoner parametrar och mixture-of-experts, omskolad med längre övervakning och förstärkningsinlärningskörningar som syftar till långvariga agenter. Claude Opus 5 släpptes den 24 juli 2026 från Anthropic som ett flaggskepp med fast datumstämpel, adaptivt tänkande, ett kontextfönster på 1 miljon token samt bild- och filinmatning. De ligger på samma punkt på den oberoende resultattavlan och på motsatta punkter på prislistan: $2 / $6 per miljon token för Grok 4.6 jämfört med $5 / $25 för Claude Opus 5. Det intressanta arbetet är att räkna ut vilken hälft av den meningen som avgör ditt produktionsval.
61:an som döljer en effektivitetsklyfta på fyra till ett.
The Intelligence Index är en sammansättning av nio utvärderingar, vilket är både dess styrka och dess blinda fläck. Ett enda tal som medelvärdesberäknar poäng för resonerande, matematik, kodning och kunskapsarbete döljer hur en modell kommer dit – och dessa två kommer dit på motsatta sätt. Artificial Analysis egen portföljliknande professionella kunskapsarbetssvit är det tydligaste fönstret in i detta: den mäter verkliga långsiktiga uppgifter, och den registrerade Grok 4.6 vid cirka 53 vändningar och 0,5B inmatade tokens per uppgift jämfört med Claude Opus 5 Max vid ungefär 103 vändningar och 2B inmatade tokens. När det gäller ekonomi per uppgift är det skillnaden mellan en modell som avslutar ett forsknings-och-producera-jobb på en fjärdedel av tokens och en som bränner igenom dem.
Orsaken är ett designval, inte en bugg. Grok 4.6 tränades specifikt för att verifiera sitt eget arbete allt eftersom och för att stanna när en deluppgift verkligen är slutförd — xAI beskriver långa uppgiftsbanor med självtestning som träningsmål. Claude Opus 5 är tränad för resonemangets djup och kunskapens bredd, och dess standardbeteende är att tänka hårdare och konsultera mer än vad som är strikt nödvändigt. Båda är "resonerande modeller"; de fördelar ansträngning på olika sätt, och fördelningen är specifikationen som spelar roll för agentarbetsbelastningar.

Gapet spelar störst roll för agenter som anropar en modell i en loop – forskningsagenter, kodagenter som kör dussintals varv, dokumentpipelines som bearbetar batchar över natten. Varje varv faktureras, och varje inmatningstoken är kontext som måste skickas på nytt vid nästa anrop. En modell som blir klar på 53 varv med 0.5B tokens är inte bara billigare per token; den är billigare per uppgift med ungefär en storleksordning än en som tar 103 varv med 2B tokens, innan du ens multiplicerar med listpriset.
Specifikationsbladet, båda sidorna
Där de skiljer sig på papper, på en rad vardera:
• Intelligence Index — Grok 4.6 får 61 poäng, rankad #6 av 184; Claude Opus 5 får 61 poäng, rankad tillsammans överst på listan. Oavgjort, enligt Artificial Analysis.
• Listpris per 1M tokens — Grok 4.6 för $2 in / $6 ut (dubblerat till $4 / $12 för prompts med 200K eller fler inmatningstokens); Claude Opus 5 för $5 in / $25 ut, med 50 % batchrabatt till $2.50 / $12.50.
• Kontextfönster — 500K tokens för Grok 4.6 jämfört med 1,000,000 för Claude Opus 5, den i särklass tydligaste spec-fördelen som någon av modellerna har.
• Maxutdata — Claude Opus 5 tillåter upp till 128K utdatatokens (300K via batch-API:et); Grok 4.6:s utdatatak är lägre, i nivå med ett typiskt långt svar.
• Indata — båda accepterar text och bild; Claude Opus 5 accepterar även filer, och Anthropics version av multimodal inmatning når in i dokumenten mer direkt.
• GDPVal-AA v2 (kunskapsarbete) — Grok 4.6 på 1 753 Elo mot Claude Opus 5 på 1 852 Elo. Opus 5 tar hem kronan för kunskapsarbetets kvalitet på det mått där portföljeffektiviteten gynnade Grok. [Artificial Analysis]
• CursorBench v3.2 — 69.9% för Grok 4.6 jämfört med 70.0% för Claude Opus 5, i praktiken jämna på det coding-agent benchmark som båda mättes på. [Artificial Analysis]
• Resonemangskontroll — Claude Opus 5 har ett ansträngningsreglage från låg till max och adaptivt tänkande aktiverat som standard; Grok 4.6 erbjuder resonemangsansträngning men är som standard inställd på att gynna långa agentbanor.
Poängen med att ställa dessa sida vid sida är att ingen av modellerna dominerar. Claude Opus 5 är den bättre generalisten på papperet: mer kontext, högre outputtak, filinmatning, högre kvalitet på kunskapsarbete. Grok 4.6 är det bättre värdet och den mer effektiva agenten. Den enda frågan som återstår är vilken av dessa som beskriver det arbete du faktiskt har.

Där Claude Opus 5 motiverar sitt premiumpris
Anthropics lanseringssiffror — leverantörsrapporterade, inte oberoende verifierade — placerar Claude Opus 5 på 96,0 % på SWE-bench Verified och 79,2 % på SWE-bench Pro, med en OSWorld-poäng på 70,6 % för datoranvändning. På det breda sammansatta måttet matchar dess 61 Grok 4.6, och på GDPVal-AA ligger den mätbart före. Vad det innebär i praktiken är en modell som håller stånd genom hela kunskapsarbetarens dag: utkast, analys, resonemang kring långa dokument, bild- och textuppgifter samt kodning, allt på ett ställe med en miljon tokens utrymme.
Kontextfönstret är den ärliga anledningen att sträcka sig efter den. En gräns på 500 000 tokens är stor, men det är inte en hel kodbas plus ett forskningskorpus plus mellanresultaten från en lång agentsession. Team som gör djup analys i ett enda pass över mycket stora korpusar — en komplett repository, ett års finansiella rapporter, en lång PDF-stapel — kommer att slå i taket för Grok 4.6 och aldrig nå Claude Opus 5:s. För dessa arbetsbelastningar är det extra kontextutrymmet ingen lyx; det är skillnaden mellan att få jobbet att rymmas och att behöva orkestrera runt gränsen.
Där Grok 4.6 är det bättre köpet.
Vänd på samma fakta och Grok 4.6 är det bättre köpet för agentpipelines, och inte med en liten marginal. Den är 2,5× billigare på input och 4,2× billigare på output jämfört med Opus 5:s listpris, och dess token-effektivitet per uppgift förstärker det: AA-Briefcase-siffrorna antyder ungefär 4× färre tokens och 2× färre turer för samma kunskapsarbetsresultat. Multiplicera 4× med 2,5× och en uppgift som kostar 1,00 USD i Opus 5:s kostnadsmodell kostar i storleksordningen 0,10 USD i Grok 4.6:s kostnadsmodell — innan batchrabatter på Opus-sidan sluter en del av gapet.
När det gäller agentisk kodning specifikt förbättrades Grok 4.6:s DeepSWE 1.1-resultat från 54% till 65,9% mellan 4.5 och 4.6, och dess CursorBench-poäng ligger inom en halv poäng från Opus 5:s samtidigt som den självverifierar sitt eget arbete längs vägen. För ett team som kör tusentals agentiska anrop om dagen, där varje anrop är en flervarvsloop, är ekonomin per uppgift och de kortare trajektorierna skillnaden mellan en livskraftig produkt och en brinntakt. Det är det xAI argumenterar för, och de oberoende effektivitetsdata stöder den riktningen.
Routningsbeslutet
Här är matchen där en router förtjänar sin existens, eftersom det rätta svaret är "båda, med uppdelningen definierad av arbetslastens form." Grok 4.6 och Claude Opus 5 är båda live på OrcaRouter till respektive leverantörs listpris – $2 / $6 för grok/grok-4.6, $5 / $25 för anthropic/claude-opus-5 – med 0 % påslag, så siffran i din kostnadsmodell är samma som faktureras. Rörsystemet som gör uppdelningen praktisk: en API-nyckel för båda modellerna, automatisk failover om en providers slutpunkt försämras mitt under en lång agentkörning, och en routing-DSL som kan skicka korta, högvolymsvändor till Grok 4.6 och eskalera det långsiktiga, kontextkrävande arbetet till Claude Opus 5 inom ett enda anrop. Du behöver inget andra avtal för att köra en tvådelad arkitektur, och du kan finjustera uppdelningen allteftersom riktig trafikdata kommer in, istället för att gissa utifrån modellkort.

Den ärliga läsningen
Oavgjordheten i det sammansatta indexet är verklig, och den är en fälla. Modeller med samma poäng är inte utbytbara; de skiljer sig åt just där poängen är blind. Claude Opus 5 är det säkrare standardvalet för breda, kontexttunga kunskapsarbeten med dokument och bilder där ett 1M-tokenfönster och djup resonemang väger tyngre än kostnad. Grok 4.6 är det bättre standardvalet för högfrekventa agentloopar där tokeneffektivitet per uppgift och en 2,5× prisfördel ackumuleras till en skillnad på en tiopotens i fakturan. Om din arbetsbelastning är den förra, betala för Opus 5 och sluta oroa dig för priset. Om det är den senare är 61-poängspariteten på papper det bästa skäl du någonsin kommer att ha att testa Grok 4.6 först — benchmarken säger att de är likvärdiga, och fakturan säger att de inte är det.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
