Ett genererat hero-titelkort för en artikel med rubriken 'Grok 4.7 vs Grok 4.6 — samma pris, olika modell', med underrubriken 'Vad släppet den 21 september faktiskt ändrade' och statistikchips som visar Terminal-Bench 4.0 38,0 % mot 20,3 %, AA Index 46 mot 44 och $2/$6 på båda.
Guides & Insights

Grok 4.7 vs Grok 4.6: Samma pris på $2/$6, men en annan modell under skalet

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

SpaceXAI släppte Grok 4.7 den 21 september 2026, och det första som är värt att lägga märke till med den är vad som inte förändrades: priset. Grok 4.7 kostar 2 dollar per miljon input-tokens och 6 dollar per miljon output-tokens, exakt vad Grok 4.6 har kostat sedan den lanserades den 12 augusti 2026. Samma prislista, samma kontextfönster på 500 000 tokens, samma text- och bildinmatning — och ändå är de två modellerna inte nära varandra på de utvärderingar som spelar roll för agentiskt arbete. Enligt SpaceXAI:s egna publicerade siffror är Grok 4.7 nästan dubbelt så bra som Grok 4.6 på Terminal-Bench 4.0, 38,0 % mot 20,3 %. Det är hela mönstret i den här jämförelsen: ett generationsbyte till samma pris där nästan hela vinsten hamnar på ett ställe, och de delar av Grok 4.6 som irriterade produktionsteamen finns fortfarande kvar.

Vad förändrades egentligen mellan de två modellerna?

SpaceXAI:s egen beskrivning av släppet är snäv, och det är värt att citera dess form snarare än adjektiven. Grok 4.7 är byggd på en större basmodell än Grok 4.6, och den fick en längre träningskörning med förstärkningsinlärning inriktad på uppgifter som "kan ta timmar att slutföra". Företaget säger att den körningen vässade tre saker: självverifiering, hantering av lång kontext och beteende i Grok Bot-miljön. Det finns inget påstående om en ny arkitektur, en ny modalitet eller en annan serving-stack.

Den inramningen spelar roll eftersom den förutser var benchmarkvinsterna dyker upp, och de dyker upp precis där. En längre RL-körning på svåra uppgifter som tar flera timmar påverkar terminal- och repositoryarbete mycket mer än den påverkar ett kunskapsquiz. Om du hoppades att Grok 4.7 skulle vara en bredare modell än Grok 4.6, säger versionsanteckningarna något annat — den har samma modellform, tränad vidare in i den svåra änden av agentiskt arbete.

Parameternarrativet är det enda av detta som inte är en leverantörsupplysning. Musk sade i början av september att Grok 4.7 har omkring 2,1 biljoner parametrar mot Grok 4.6:s 1,5 biljoner, en ökning med 40 %, och den siffran har upprepats överallt sedan dess. Den har aldrig förekommit på ett specifikationsblad från SpaceXAI. Betrakta det som ett påstående om basmodellen som fått stor spridning, inte en bekräftad specifikation – och notera att parameterantal säger mycket lite om inferenskostnad eller förmåga när arkitekturen är gles, vilket Grok-linjens är.

Benchmarkgapet, med källhänvisningen bifogad

Varje siffra i det här avsnittet kommer från SpaceXAI:s lanseringsmaterial. Inget av det har oberoende reproducerats när detta skrivs, och det ärliga sättet att läsa det är som en uppsättning påståenden som råkar vara ovanligt specifik — vilket gör den granskningsbar senare, men gör den inte verifierad nu.

• Terminal-Bench 4.0 — Grok 4.7 38,0 % (enligt leverantören) mot Grok 4.6 20,3 %. Den enskilt största skillnaden i versionen, och den som stämmer överens med påståendet om "längre RL på svårare uppgifter".

• CursorBench 4.0 — Grok 4.7 46,3 % (enligt leverantören) mot Grok 4.6 40,4 %. En verklig ökning, men en blygsam sådan — under sex punkter, på ett benchmark som ligger närmare vardagligt arbete i editorn än autonoma terminalsessioner.

• DeepSWE v1.1 — Grok 4.7 71,0 % vid hög resonemangsansträngning (enligt leverantören) mot Grok 4.6 65,2 %. Återigen en solid men oansenlig förbättring.

• EEBench — Grok 4.7 64,0 % (enligt leverantören). Ingen siffra för Grok 4.6 publicerades tillsammans med den, så den här säger dig inget om uppgraderingen.

• AA-Briefcase v1.1 — Grok 4.7 på 1 657 Elo (enligt leverantörens uppgifter), i utvärderingen av professionellt kunskapsarbete.

Läs listan som en helhet och mönstret är konsekvent: Grok 4.7 är betydligt bättre där uppgiften är lång och agentisk, och marginellt bättre där uppgiften är kort. Terminal-Bench-hoppet är ungefär en fördubbling; förbättringarna i redigeringsarbete är ensiffriga procenttal. Om din arbetsbelastning är autocomplete-formad betalar du samma $2/$6 för en liten förbättring. Om din arbetsbelastning är "kör i två timmar och kom tillbaka", riktar sig utgåvan direkt till dig.

Vad oberoende mätningar säger hittills

Det finns ett oberoende tal, och det är värt att formulera noggrant eftersom det är lätt att misläsa. Artificial Analysis poängsätter Grok 4.7 till 46 på sitt Intelligence Index, version v4.3.2, vilket placerar den på 16:e plats av 655 modeller på listan. Grok 4.6 ligger på 44 på samma skala. En tvåpoängsskillnad på ett sammansatt index är inte den fördubbling som Terminal-Bench visar, och den avvikelsen är informativ snarare än motsägelsefull: indexet blandar resonemang, kunskap, matematik och kodning, så en stor förbättring i en agentisk del späds ut av allt som modellen inte förändrade.

Två ytterligare detaljer från samma sida är mer användbara än rubrikpoängen. För det första genererade Grok 4.7 240 miljoner utdatatokens när den körde indexet, mot en median på 92 miljoner – den är en mångordig resonemangsmodell, och med en utdatakostnad på 6 dollar per miljon är den mångordigheten en kostnadspost. För det andra placerar indexets sammansatta resultat den bland de starkaste modellerna i sin prisklass, vilket är den jämförelse som faktiskt spelar roll för en köpare. Artificial Analysis har inte publicerat ett ifyllt pris för Grok 4.7 på modellsidan, så ta inte siffran för kostnad per uppgift därifrån; använd leverantörens $2/$6.

A generated two-column comparison scoreboard for Grok 4.7 and Grok 4.6 with six rows: Terminal-Bench 4.0 38.0% vs 20.3%, CursorBench 4.0 46.3% vs 40.4%, DeepSWE v1.1 71.0% vs 65.2%, AA Intelligence Index 46 vs 44, context 500K on both, and price $2/$6 on both, with a footer noting all benchmark figures are vendor-reported and the index scores are per Artificial Analysis v4.3.2.

Prisklippan som ingen av modellerna åtgärdade

Här är delen av Grok 4.6-prislistan som produktionsteam lärde sig att hata, och Grok 4.7 ändrade den inte. Under 200 000 indatatokens är priset 2 USD in och 6 USD ut. Över det prissätts hela begäran om till 4 USD in och 12 USD ut. Inte de överskjutande tokensen – hela begäran. Ett anrop på 210 000 tokens kostar dubbelt så mycket som ett anrop på 199 000 tokens, för 11 000 extra tokens.

Med ett kontextfönster på 500 000 tokens på båda modellerna är det lätt att gå över stupkanten. Långa agentkörningar med stor kontext och prompter för hela kodbaser är precis de arbetsbelastningar som Grok 4.7 trimmades för, vilket innebär att modellens bästa användningsområde också är det som mest sannolikt utlöser fördubblingen. Om du flyttar arbete till Grok 4.7 eftersom det hanterar långa agentiska sessioner bättre, budgetera för omprissättningen innan du flyttar det, inte efter.

Det finns också en hastighetsnivå att ta hänsyn till. SpaceXAI tillhandahåller en snabb variant av Grok 4.7 som fördubblar utdatahastigheten och fördubblar listpriset. Det är ett legitimt byte för interaktiv kodning, och ett dåligt sådant för batcharbete – samma uppgift med samma kvalitet kostar dubbelt så mycket för en besparing i väggklockstid som ingen tittar på.

Migrera från Grok 4.6 utan en omskrivning

Den praktiska goda nyheten är att detta är ett modellbyte, inte en plattformsmigrering. Båda modellerna tar in text och bilder och returnerar text, båda använder samma nivåer för resonemangsinsats från low till xhigh, och förfrågningsformen är den som SpaceXAI har tillhandahållit sedan Grok 4.5. Kod som anropar Grok 4.6 med en effort-parameter behöver inte byggas om för att anropa Grok 4.7.

Det är i utvärderingen som bytet inte är gratis. Grok 4.7:s vinster är koncentrerade till långa agentiska körningar, så en testsvit byggd av korta prompter med en enda tur kommer att visa dig nästan ingenting — du kommer att se förbättringen på CursorBench-nivå och dra slutsatsen att uppgraderingen inte var värd ansträngningen, när argumentet för den finns i uppgifter som din svit aldrig testar. Det mått som faktiskt skulle avgöra saken är slutförandet av uppgifter över flerstegsarbete: accepterade patchar, införda regressioner, verktygsanrop per slutförd uppgift, och hur ofta en körning behöver mänsklig räddning. Det är de axlar som leverantörens egna siffror pekar på, och det är de som ingen publicerad benchmark täcker för din kodbas.

Verbositet är det andra man bör mäta. En modell som genererar 240 miljoner tokens på ett standardindex kommer att generera fler tokens på din arbetsbelastning än dess föregångare gjorde, och vid $6 per miljon utdata kan det tyst radera värdet av en uppgradering till samma pris. Mät utdata-tokens per slutförd uppgift i en vecka innan du bestämmer dig.

Screenshot of the Artificial Analysis model page for Grok 4.7 (xhigh), showing an Intelligence Index of 46 on index version v4.3.2, a 500k token context window, text and image input with text output, and a verbosity figure of 240M output tokens generated on the index.

Vilken ska man ringa?

Beslutet är verkligen enkelt, vilket är ovanligt för en modelljämförelse. Grok 4.6 förblir det rätta valet för kortvarig, kostnadskänslig trafik: chatt, klassificering, sammanfattning och kodassistans i redigeringsverktygsstorlek, där Grok 4.7:s vinster är små och dess ordrikedom är en kostnad. Grok 4.7 är det rätta valet för den arbetsbelastning den byggdes för – långsiktig agentisk kodning och terminalarbete där en uppgift körs i timmar och självverifiering är skillnaden mellan ett slutfört jobb och ett som har fastnat.

Att köra båda är inte en kompromiss här, det är rätt svar, och det är billigt att göra. Grok 4.6 finns i OrcaRouters katalog till SpaceXAI:s listpris med 0 % påslag som förs vidare rakt igenom, så priskortet $2/$6 ovan är vad du betalar — och eftersom vi för vidare leverantörens listpris i stället för att lägga på ett påslag blir varje leverantörsprisändring aktiv hos oss samma dag som den börjar gälla. En API-nyckel täcker Grok 4.6 och 200+ andra modeller, så att flytta trafik mellan dem per uppgift är en konfigurationsändring snarare än ett andra avtal. Om du vill testa Grok 4.7 på en produktionsväg innan du litar på den är det säkrare mönstret att behålla fallbacken på Grok 4.6 — en modell du kan routa i dag — och låta automatisk failover mellan leverantörer flytta tillbaka begäran när den nya modellen beter sig illa.

Screenshot of the OrcaRouter model page for Grok 4.6 (model ID grok/grok-4.6), showing SpaceXAI's list pricing of $2.00 per million input tokens and $6.00 per million output tokens, a 500K token context window, and the reasoning and vision capability tags.

Vad du ska titta på härnäst

Två saker kommer att avgöra den här jämförelsen, och ingen av dem har hänt ännu. Den första är en oberoende reproduktion av Terminal-Bench 4.0-siffran – 38 % är ett tillräckligt stort hopp för att någon kommer att köra om det, och om det håller är argumenten för Grok 4.7 i agentiska pipelines starka på sakliga grunder snarare än på marknadsföring. Den andra är resten av Grok-färdplanen: SpaceXAI har offentligt placerat Grok 4.8, Grok 4.9 och Grok 5 efter den här lanseringen, och Grok 4.6:s egen livstid var omkring fem veckor. Att satsa på Grok 4.7 som ett långsiktigt plattformsantagande skulle upprepa misstaget som teamen gjorde med Grok 4.5.

För närvarande är uppgraderingen till samma pris verklig, och färdriktningen är tydlig. Siffran att hålla fast vid är att $2/$6 gav dig en modell som ungefär fördubblas på långsiktigt terminalarbete och knappt rör sig någon annanstans – och det är ett specifikt, användbart, kontrollerbart påstående snarare än ett generationssprång.

Jämförda i den här artikeln2

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen