Ett titelkort för releasedatumsartikeln om Grok 4.7 med texten 'Grok 4.7 — frågan om releasedatum' med underrubriken 'Inte släppt. Här är vad xAI faktiskt har sagt.' och tre chips: 'Initial träning klar', 'SpaceX-data inne' och 'Musk: 3–4 veckor', med en nedersta rad som lyder '~2,1T parametrar — påstående, inte specifikation'.
Guides & Insights

Grok 4.7 får 46 poäng på Artificial Analysis Intelligence Index och placerar SpaceXAI bland de fyra bästa

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Grok 4.7 får 46 poäng på Artificial Analysis Intelligence Index och placerar SpaceXAI bland de fyra bästa

Grok 4.7 är ute. SpaceXAI släppte den på måndagen den 21 september 2026 – till samma pris på 2 dollar per miljon indatatoken och 6 dollar per miljon utdatatoken som Grok 4.6, med samma kontextfönster på 500 000 token, en senare kunskapsgräns och en ny högsta resonemangsnivå. Den är tillgänglig i Cursor och Grok Build, via leverantörens eget API och via tredjeparts kodningsramverk, modellroutrar och molnplattformar. Grok 4.5 från den 8 juli ligger kvar under den som det billigare alternativet, och modellerna som den fortfarande måste slå är oförändrade: Claude Fable 5.1, Claude Opus 5 och GPT-5.6 Sol ligger alla över den i Artificial Analysis v4.3.2 Intelligence Index, där Grok 4.7:s första oberoende poäng – 46 – landar två poäng över Grok 4.6 och sju under Claude Fable 5.1. På samma utvärderares AA-Briefcase-tavla för långsiktigt kunskapsarbete landar den fyra, bakom tre Claude-poster och före Claude Opus 5 vid xhigh effort, till ungefär halva Claude Opus 5:s kostnad per uppgift – det första oberoende resultatet i den här lanseringen som läses som en pris-prestanda-vinst snarare än en lucka. Elva dagar senare har bilden breddats i kanterna snarare än i mitten: sedan den 1 oktober har den rullats ut i Groks egna webb- och mobilappar, där lägesväljaren nu namnger den på sina två svåraste poster, och den listas på OrcaRouter till SpaceXAI:s eget pris på $2/$6.

Det är lanseringen. De mer användbara siffrorna kom samma dag, från den enda utvärderaren i den här historien som inte är leverantören: Artificial Analysis publicerade sin första oberoende granskning av Grok 4.7, och det är ett resultat i tre delar – en 46:a på Intelligence Index som bara ligger två poäng före Grok 4.6, en 56:a på Coding Agent Index som ligger nio poäng före den, och 1 657 Elo på AA-Briefcase som ligger 111 poäng före. De tre siffrorna pekar åt olika håll, och spridningen mellan dem är det mest intressanta med det här släppet. Det som följer är den levererade specifikationen, leverantörens egen benchmarktabell med den etikett varje rad behöver, och sedan de oberoende poängen lästa på rätt sätt – inklusive vad de säger om förbehållet om beredskap som SpaceXAI aldrig bemötte.

Vad SpaceXAI släppte den 21 september

Börja med specifikationen, eftersom den är ovanligt nära sin föregångares. Grok 4.7 har samma pris som Grok 4.6 — $2 per miljon indatatokens och $6 per miljon utdatatokens under 200 000 indatatokens, och stiger till $4 in och $12 ut när en förfrågan passerar den tröskeln, samma struktur som Grok 4.6 introducerade. Kontextfönstret är 500 000 tokens. Kunskapsavskärningen är maj 2026, tre månader senare än Grok 4.6:s 1 februari 2026. Resonemangsansträngningen sträcker sig över fyra nivåer — låg, medel, hög och xhigh — och de publicerade siffrorna anges vid xhigh. En snabb variant körs med dubbel utdatahastighet till dubbelt pris.

Under ytan beskriver xAI tre förändringar snarare än en ny arkitektur. Basmodellen är större än Grok 4.6:s. Körningen med förstärkningsinlärning var längre och viktad mot uppgifter som tar många timmar att slutföra. Och modellen tränades för att verifiera sitt eget arbete och att hålla lång kontext bättre, inklusive inbyggd förståelse för Grok Bot-harness. Företagets egen sammanfattning i en rad är "dubbelt så snabb, till halva priset av jämförbara modeller" – ett positioneringspåstående om konkurrenter snarare än en mätning, och värt att läsas som ett sådant.

Tillgängligheten var bred från dag ett och har vidgats två gånger sedan dess. Vid lanseringen: Cursor och Grok Build, leverantörens eget API, tredjepartsramverk för kodning, modellrouterare och molnplattformar; SpaceXAI:s egen Grok Build-sida säger nu rent ut att "start building with Grok 4.7". Den 28 september lade Amazon Web Services till den i Amazon Bedrock med samma kontextfönster på 500 000 token och samma fyra nivåer för resonemangsansträngning, levererad via cross-Region-inferensprofiler, så modellen är nu nåbar via en hyperscalers egen katalog och inte bara leverantörens API. Sedan, den 1 oktober, började den rullas ut i Groks konsumentwebb och mobilappar, och två dagar senare är det fortfarande där den ligger. Den sista punkten är ovanligt tyst: SpaceXAI meddelade motsvarande steg för Grok 4.5 med ett blogginlägg med titeln "Bringing Grok 4.5 to iOS, Android, Web, and X", och har inte publicerat något för Grok 4.7, så förändringen syns i produkten i stället för att tillkännages. Den är serversidig snarare än levererad, vilket applistningarna bekräftar: både Groks iOS- och Android-listningar ändrades den 1 oktober – App Store-bygget är 1.4.47, släppt samma dag, och dess versionsinformation nämner bara "Improvements to Chat, Voice and Imagine", medan Play-listningen uppdaterades samma dag. Ändringen skickas från backend snarare än att byggas in i en binärfil. Eftersom utrullningen rapporteras i stället för att dokumenteras är den exakta omfattningen svårare att fastställa än för Bedrock-listningen, som har ett daterat AWS-inlägg bakom sig, och rapporteringen har redan glidit: kontona som följer detta beskriver nu Grok 4.7 som basmodellen i alla lägen – Fast, Expert, Build och Heavy – en lista som inte matchar vad grok.com faktiskt levererar. Läs det som trackernas egen rapportering snarare än som en leverantörsbeskrivning. Utvalda partners inom cybersäkerhet får inbjudningsbaserad tillgång till modellens red-team-funktioner.

En korrigering av den uppgift som den här artikeln höll fast vid. Det parameterantal som cirkulerade i två månader – ungefär 2,1 biljoner, cirka 40 % högre än Grok 4.6:s 1,5 biljoner – finns fortfarande inte på något specifikationsblad. xAI har inte publicerat något parameterantal för Grok 4.7, och Artificial Analysis anger modellstorleken som ej angiven. Siffran var hela tiden en grundares påstående, och lanseringen förvandlade den inte till en specifikation.

Benchmark-tabellen är xAI:s egen — här är vad som inte är det

Varje siffra i listan nedan kommer från leverantörens tillkännagivande, och ingen av dem har oberoende reproducerats. Läs den med den etiketten fäst: detta är xAI:s siffror från xAI:s egna valda utvärderingar, publicerade på releasedagen, och den första veckan efter varje lansering är när leverantörsbenchmarkar är som minst tillförlitliga. Jämförelsekolumnerna är också leverantörens egna — Grok 4.6 (high), GPT-5.6 Sol (max) och Claude Fable 5.1 (max), var och en körd på leverantörens valda ansträngningsnivå.

• CursorBench 4.0 — Grok 4.7 46,3 %, Grok 4.6 40,4 %, GPT-5.6 Sol 41,7 %, Claude Fable 5.1 51,8 %. Leverantörsrapporterat.

• DeepSWE v1.1 — Grok 4.7 71,0 % vid hög ansträngning, Grok 4.6 65,2 %, GPT-5.6 Sol 72,7 %, Claude Fable 5.1 70,0 %. Leverantörsrapporterat.

• Terminal-Bench 4.0 — Grok 4.7 37,6 %, Grok 4.6 20,3 %, GPT-5.6 Sol 37,3 %, Claude Fable 5.1 57,9 %. Leverantörsrapporterat och reviderat: Grok 4.7-raden stod som 38,0 % i tabellen på lanseringsdagen och står som 37,6 % på leverantörens sida i dag.

• EEBench — Grok 4.7 64,0 %, Grok 4.6 53,0 %, GPT-5.6 Sol 39,4 %, Claude Fable 5.1 56,4 %. Leverantörsrapporterat.

• Harvey Legal Agent — Grok 4.7 19,6 %, Grok 4.6 15,8 %, GPT-5.6 Sol 2,5 %, Claude Fable 5.1 6,7 %. Leverantörsrapporterat.

• HealthBench Professional — Grok 4.7 56,7 %, Grok 4.6 48,5 %, GPT-5.6 Sol 60,5 %, Claude Fable 5.1 62,1 %. Rapporterat av leverantören.

• AA Briefcase v1.1 — Grok 4.7 1 657, Grok 4.6 1 546, GPT-5.6 Sol 1 487, Claude Fable 5.1 1 678. Detta är den enda raden i tabellen som inte längre är enbart leverantörens: Artificial Analysis egen AA-Briefcase-tavla publicerar samma 1 657 för Grok 4.7 vid ansträngningsnivån xhigh och 1 546 för Grok 4.6 vid high. Jämförelsekolumnerna är fortfarande leverantörens val av modeller och ansträngningsnivåer.

• GDPval Elo — Grok 4.7 1 695, Grok 4.6 1 605, GPT-6 Astra 1 542, Claude Fable 5.1 1 735. Leverantörsrapporterat.

Den ärliga läsningen av den uppsättningen är inte "Grok 4.7 vinner". Den slår Grok 4.6 på alla åtta, vilket är det minsta en efterträdare är skyldig dig. Mot konkurrensfältet är det en blandad bild: det ligger före GPT-5.6 Sol på CursorBench, Terminal-Bench och EEBench, efter den på DeepSWE; det ligger efter Claude Fable 5.1 på CursorBench, Terminal-Bench, HealthBench och båda Elo-liknande måtten, före den på EEBench och Harvey-utvärderingen för juridiska agenter. Det illustrerar också hur stor del av ett benchmarkresultat som beror på ansträngningsnivån — DeepSWE:s 71,0 % är en siffra för hög ansträngning i en tabell som i övrigt anges vid xhigh.

Säkerhet är det enda området där leverantörens påståenden är ovanligt specifika. xAI säger att Grok 4.7 byggdes på en helt ny skyddsstack och kallar den den starkaste modellen företaget har testat när det gäller vägran och motståndskraft mot jailbreak. På LatchBios biosäkerhetsbenchmark rapporterar den 62,4 %; på HackerBench v0.3 rapporterar den att den släpper igenom 3,3 % av riskfyllda dual-use-prompter samtidigt som den sällan blockerar legitimt säkerhetsarbete. Det är leverantörsrapporterade utvärderingar på leverantörens egen lansering, och ingen tredje part har reproducerat dem.

De första siffrorna i den här artikeln som inte är leverantörens är de tre som Artificial Analysis publicerade den 21 september, och de går isär på ett informativt sätt. På Intelligence Index får Grok 4.7 46 vid xhigh effort på v4.3.2-skalan — 16:e plats på den rankingen — mot 44 för Grok 4.6. Den tvåpoängsökningen är enligt Artificial Analysis tillräcklig för att föra in SpaceXAI bland indexets fyra främsta labb. Läs placeringen exakt: det är ett påstående om ett labs bästa modell, inte om den här, och modellen själv ligger fortfarande fyra poäng under Claude Fable 5:s 50 och sju under de 53 som Claude Fable 5.1 och GPT-6 Astra delar. En tvåpoängsökning ligger också inom det intervall som förekommer mellan effort-nivåer för samma modell, vilket är en påminnelse om att en efterträdare som får högre poäng än sin föregångare inte är samma sak som en efterträdare som förändrar vad som är möjligt. Ytterligare en kommentar om hur man läser siffran: skalversionen spelar roll, eftersom Artificial Analysis har räknat om sitt index och värdena 61/62/63 som förekommer i större delen av bevakningen från juli och augusti tillhör den nedlagda skalan före september 2026 — de kan inte jämföras med dessa.

Coding Agent Index är den andra siffran, och det är den som har ändrats. När Grok 4.7 körs i SpaceXAI:s eget Grok Build-harness med xhigh effort får den 56 mot Grok 4.6:s 47 – nio poäng, inte två – vilket är fjärde bäst bland modeller som utvärderats i sina egna harness, bakom Claude Fable 5.1, GPT-6 Astra och Claude Opus 5, och före GPT-5.6 Sol. Indexet är ett likaviktat sammansatt mått av DeepSWE v1.1, Terminal-Bench 4.0 och SWE-Atlas-QnA över 303 uppgifter, och alla tre komponenterna förbättrades: DeepSWE från 65 % till 73 %, Terminal-Bench från 18 % till 33 %, SWE-Atlas-QnA från 58 % till 63 %. Detta är det första oberoende beviset på att fixen som xAI beskrev – längre förstärkningsinlärning viktad mot uppgifter som tar flera timmar – gjorde något, och det är den siffra som ett team som väljer en kodagent bör väga tyngst, eftersom den mäts i det harness som modellen faktiskt levereras med i stället för leverantörens egen tabell.

Förbehållet gäller vad de nio poängen kostar. Artificial Analysiss egen körning genererade 240 miljoner output-tokens på Intelligence Index, mot en median på 94 miljoner bland de modeller den följer – mer än dubbelt så många – och satte kostnaden för att utvärdera en Index-uppgift till 3,74 dollar. Vid 6 dollar per miljon output-tokens är mångordighet den post som avgör om en agentisk loop är överkomlig, så en ökning med nio poäng som köps med mer än dubbelt så mycket output som medianen är en verklig avvägning snarare än en gratis uppgradering. Samma mätning innebär också att rubrikpoängen inte bör läsas som en enda dom: per token är Grok 4.7:s fördel gentemot Grok 4.6 mindre än indexdeltat antyder, och på de allmänkunskapsutvärderingar som utgör Intelligence Index är den nära samma modell med en väsentligt högre nota. Resultatet för AA-Briefcase i nästa avsnitt är undantaget från det, och det är ett stort sådant.

The Artificial Analysis model page for Grok 4.6 (high) showing an Intelligence Index of 61 against a median of 34, pricing of $2.00 per 1M input and $6.00 per 1M output tokens, a 500K-token context window, and a released August 2026 label.

Den andra oberoende styrelsen: AA-Briefcase, och vad halva kostnaden per uppgift köper

Artificial Analysis publicerade ett tredje mätvärde för Grok 4.7 samma dag, och det är det som handlar om kunskapsarbete snarare än kod. På AA-Briefcase – dess egen resultattavla för långsiktigt agentiskt kunskapsarbete, byggd av fyra projektscenarier över flera veckor och 91 bedömda leverabler – får Grok 4.7 med xhigh effort 1 657 Elo, en fjärdeplats på resultattavlan och endast efter Anthropic-poster: Claude Fable 5.1 på max effort (1 678), Claude Opus 5 på max effort (1 673) och Claude Fable 5.1 på xhigh (1 669). Det ligger 16 Elo efter Claude Opus 5 på max effort och, på xhigh, 8 Elo före Claude Opus 5 på xhigh (1 649). Läs placeringen noggrant: "endast bakom Anthropic-modeller" är den formulering Artificial Analysis själva använde, och den är korrekt – men en fjärdeplats är inte en andraplats, och de tre raderna ovanför den tillhör alla samma leverantör.

Vinsten jämfört med föregående generation är det största enskilda klivet i släppet. Jämfört med Grok 4.6 vid hög ansträngning (1 546) vinner Grok 4.7 vid xhigh 111 Elo på AA-Briefcase – mer än femtio gånger tvåpunktsvinsten på Intelligence Index. Artificial Analysis tillskriver den nästan uteslutande analytisk kvalitet: 1 994 Elo där mot 1 690 för Grok 4.6, medan presentationskvaliteten tappar något, 1 499 mot 1 519. Det är en tydlig signatur: modellen resonerar bättre kring analysen och formaterar leveransen något sämre. Samma riktning syns i siffrorna som Artificial Analysis angav för AA-Briefcase-Lite, det offentliga due diligence-scenario som släpptes på Hugging Face – analytisk kvalitet upp från 1 698 till 1 994, presentation ned från 1 531 till 1 499. Två förbehåll för den jämförelsen. AA-Briefcase-Lite är uttryckligen demonstrativt: Artificial Analysis egen metodsida säger att det offentliga femte scenariot ”inte räknas med i officiella AA-Briefcase-resultat.” Och kvalitetssiffrorna som anges för det matchar xhigh-raderna som publicerats på huvudtavlan, så behandla stycket om Lite som en illustration av riktningen snarare än en separat resultattavla.

Kostnadslinjen är där detta resultat förändrar ett beslut. Måttet kostnad per uppgift i AA-Briefcase är den totala kostnaden för att köra hela inlämningen delad med dess 91 uppgifter; om man slår ut de totaler som Artificial Analysis har publicerat får man ungefär $9,30 per uppgift för Grok 4.7 på xhigh mot ungefär $17,79 för Claude Opus 5 på max effort — ungefär hälften, för en Elo-skillnad på 16. Artificial Analysis egen sammanfattning av resultatet är att Grok 4.7 placerar sig "strax efter Opus 5, på ~50 % av dess kostnad per uppgift." Det är samma avvägning som resten av den här artikeln beskriver, och når samma svar från ett annat håll: Grok 4.7 slår inte frontlinjen, det underbjuder den. Två förbehåll, båda ärliga. Tokenräkningen är verklig — på AA-Briefcase-Lite angav Artificial Analysis API-kostnaden för att producera exempelpresentationerna till ungefär $8 för Grok 4.7 på xhigh mot ungefär $4,40 för Grok 4.6 på xhigh, så efterföljaren kostar ungefär 80 % mer än modellen den ersätter för samma arbete. Och siffrorna per uppgift beräknas utifrån tokenanvändning till listpriser med en representativ cacheträffsannolikhet, så de ändras beroende på din cachning: de är en modell av en räkning, inte din räkning.

Var Grok 4.7 står i förhållande till Grok 4.6 och konkurrenterna

• Pris per 1M tokens — Grok 4.7 $2 in / $6 ut under 200K input, $4/$12 över det; Grok 4.6 identisk.

• Kontextfönster — 500 000 tokens för båda.

• Kunskapsgräns — maj 2026 för Grok 4.7 mot 1 februari 2026 för Grok 4.6.

• Resoneringsinsats — låg / medel / hög / xhigh för Grok 4.7 jämfört med Grok 4.6:s publicerade nivåer.

• Oberoende poäng — 46 vid xhigh effort jämfört med 44, på Artificial Analysis v4.3.2 Intelligence Index. Tillräckligt, säger Artificial Analysis, för att placera SpaceXAI bland indexets fyra bästa labb.

Oberoende kodningspoäng – 56 mot 47 i Artificial Analysis Coding Agent Index, varje modell i sin ursprungliga testmiljö. Fjärde bland modeller i ursprunglig testmiljö, före GPT-5.6 Sol.

• Oberoende kunskapsarbetspoäng — 1 657 Elo vid xhigh-ansträngning mot 1 546 för Grok 4.6 vid hög, på Artificial Analysis AA-Briefcase-tavla. Fjärde totalt, bakom tre Anthropic-poster och före Claude Opus 5 vid xhigh.

• Kostnad per AA-Briefcase-uppgift — cirka 9,30 USD jämfört med cirka 17,79 USD för Claude Opus 5 vid maximal ansträngning, på samma board. Ungefär halva notan per uppgift för en Elo-skillnad på 16.

• Utdata-tokens per Index-körning – 240 miljoner jämfört med en median på 94 miljoner bland de modeller som Artificial Analysis följer. Förbättringen är inte gratis.

• Leverantörens kodningsutvärdering – CursorBench 4.0 46,3 % mot 40,4 %.

• Betjäningshastighet — en snabb variant med dubbelt så hög utdatahastighet för dubbelt så högt pris, jämfört med Grok 4.6:s standardbetjäning.

• Säkerhet — en ny skyddsstack, med rapporterade 62,4 % på LatchBios biosäkerhetsbenchmark; Grok 4.6 släpptes utan det påståendet.

Och på samma resultattavla: Claude Fable 5.1 på 53, Claude Opus 5 på 51, GPT-5.6 Sol på 47, Kimi K3 på 44. Musks egen förutsägelse – att Grok 4.7 "borde ligga ungefär i nivå med Opus 5.0, inte 5.1" – har nu en siffra under sig, och siffran landade där han sa att den skulle: under frontlinjen, inte över den. Det uppmätta gapet till Claude Fable 5.1 är sju punkter; prisskillnaden går åt andra hållet, med Claude Fable 5.1 listad till $10/$50 per miljon tokens mot Grok 4.7:s $2/$6 – fem gånger inputpriset och mer än åtta gånger outputpriset. Det är den faktiska avvägning ett team ombeds göra, och det är en pris-prestanda-avvägning snarare än en kapacitetsvinst. AA-Briefcase är den enda tavlan i den här artikeln där ordningen ändras: där ligger Grok 4.7 på xhigh före Claude Opus 5 på xhigh, 1 657 mot 1 649, men fortfarande bakom Opus 5 på max effort på 1 673 och bakom Claude Fable 5.1 på 1 678. Det är också värt att ställa de tre oberoende poängen sida vid sida innan man drar linjen, eftersom de inte pekar i samma riktning: sju punkter efter i allmän intelligens, före GPT-5.6 Sol i kodagentindexet, 111 Elo före sin föregångare inom kunskapsarbete, och betalar för vinsterna i output-tokens. Vilket av dessa faktum som avgör ditt val beror på om arbetsbelastningen är en kodagent, en kunskapsleverans eller en chattprompt, och det är en mer användbar uppdelning än en enda rangordning.

Vad läckorna hade rätt om, och det enda de inte avgjorde

De artefakter som den här artikeln följde fram till september var verkliga, och lanseringen gör dem till ett test av vad den typen av bevisning är värd. Här är liggaren.

• Katalogens pull request hade rätt pris. Inlämningen den 21 september som lade till Grok 4.7 i Zen- och Go-katalogerna för en agentklient med öppen källkod – öppnad 05:36 UTC, automatiskt stängd av en compliance-bot kl. 07:46 UTC på grund av en saknad sektion i pull request-mallen, aldrig sammanfogad – listade modellen till Grok 4.6:s publicerade priser. Det visade sig vara exakt rätt: $2/$6, oförändrat. Men mekanismen är viktigare än resultatet. Bidragsgivaren kopierade priserna från modellen ovanför den, och kopierandet råkade vara den korrekta gissningen. Det är tur, inte auktoritet, och samma pull requests kapacitetspåståenden innehöll inte heller någon information. Ett förslag kan vara rätt och ändå inte vara ett bevis.

• Provisioneringsspåret var äkta och var inte lanseringen. Raden för grok-4.7 på Google Cloud Consoles modellkvotsida, rapporterad av gemenskapsbevakare den 16–17 september, och den daterade build-slugen grok-4-7-0907 som dök upp i ett konfigurationsfel för Grok Bot, pekade båda på en modell som förbereddes. Ingen av dem hade något datum kopplat till sig av någon, och ingen av dem var tillkännagivandet. Det de visar är att tredjepartsinfrastruktur höll på att förberedas – vilket i efterhand var korrekt och ändå inte ett schema.

• Parameterantalet bekräftades aldrig. Ungefär 2,1 biljoner, cirka 40 % över Grok 4.6, upprepades av Musk den 2 september – och saknades fortfarande i varje specifikationsblad vid lanseringen. Detta är det tydligaste fallet i hela sagan där ett tal cirkulerade tillräckligt brett för att behandlas som ett faktum utan att någonsin ha en källa från leverantören.

A what-we-know-so-far card for Grok 4.7 listing six rows: Status not released — in supplemental training, Model ID none — docs top out at grok-4.6, Release date none — Musk says 3–4 weeks, Parameters ~2.1T (claim, not verified), Training data SpaceX engineering corpus (reported), Benchmarks none published, with a footer reading that all figures are Musk claims or community reports and no independent scores exist.

Kortet ovan dokumenterar läget före lanseringen så som den här texten senast kontrollerade det: inget modell-ID, inget utgivningsdatum, inga publicerade prestandatester. Varje rad på det har sedan dess blivit överspelad av tillkännagivandet den 21 september, och det finns kvar här eftersom klyftan mellan det kortet och den skeppade modellen är den egentliga historien från de senaste sex veckorna – en frontier-lansering som inte gav någon bekräftad specifikation alls förrän dagen den släpptes.

• Förbehållet om mognad är den öppna frågan, och den har nu delvisa belägg. Musk sade i mitten av september att Grok 4.7 "avslutar för tidigt" på uppgifter med hög svårighetsgrad och att dess svarskontroll "inte är tillräckligt sträng", vilket han tillskrev en för högt satt bestraffning i förstärkningsinlärningen för långa svar, med förbehållet "möjligen". Lanseringsmeddelandet tar inte upp det. xAI:s angivna åtgärd är indirekt: längre förstärkningsinlärning med viktning mot uppgifter som tar flera timmar och bättre självverifiering är precis den förändring man skulle göra för att åtgärda ett för tidigt avslutande. Resultatet i Coding Agent Index är det första externa tecknet på att det gjorde skillnad — 56 mot Grok 4.6:s 47, medan Terminal-Bench 4.0 nästan fördubblades från 18 % till 33 %, vilket är precis den långsiktiga, mångstegsänden av spektrat. Det är inte ett entydigt svar, eftersom samma testresultat också är de som köper sina vinster med långt fler utdatatokens. Huruvida modellen fortfarande överger långa svåra uppgifter kan testas av alla med API-åtkomst, och det är fortfarande det första som är värt att testa.

• SpaceX-korpusen är fortfarande overifierad. Det rapporterade träningstillägget – Starlink-telemetri, tryckloggar från Raptors förbränningskammare, Starship-telemetri vid återinträde, interna Slack-trådar, Jira-ärenden, GitHub-förråd och ERP-poster – är communityrapportering av vad Musk sade, inte ett företagsoffentliggörande. Lanseringsmeddelandet beskriver en större basmodell och en längre körning för förstärkningsinlärning, och säger ingenting om korpusen. Om den finns där kommer inget specifikationsblad att bekräfta det; det enda beviset blir huruvida modellen åstadkommer något i verkligt ingenjörsarbete som dess gelikar inte kan.

Tidslinjen som missade fyra gånger, och vad marknaden hade rätt om

Grok 4.7 utlovades offentligt enligt fem separata tidslinjer, och de fyra första löpte ut. Den 24–25 juli sade Musk att det handlade om cirka fyra veckor, vilket innebar den 22 augusti. Den 12 augusti ändrade han till "3 till 4 veckor", vilket innebar den 2–9 september. Den 2 september snävade han in det till ungefär tio dagar, vilket pekade mot den 12 september. Den 11 september, dagen som löpte ut, sade han "några fler dagar". Den femte var inte ett fönster alls – en rad för grok-4.7 på en kvotsida i Google Cloud – och den var den som kom närmast sanningen: modellen släpptes den 21 september, strax efter det sista datum som någon hade förbundit sig till, och utan ett datum kopplat till artefakten som föregick den.

Prognosmarknaderna prickade kalendern rätt men modellen fel. Kalshis "SpaceXAI släpper Grok 4.7 före 18 september?" slutade handlas kl. 03.59 UTC den 18 september efter att senast ha handlats till 65 ¢, med 1 785 handlade kontrakt och 1 211 öppna. Varje avvecklat kontrakt på båda de stora marknaderna – Kalshis fönster för 14, 21, 28 och 31 augusti samt 4, 8 och 11 september, och Polymarkets kontrakt för 12 och 14 september – avgjordes med Nej. Polymarkets "nästa Grok-modell (4.7 eller högre) släppt senast 18 september?" låg på 64 % den 15 september efter att ha varierat mellan 42 % och 88,5 % under elva dagar. Marknaden hade rätt att gå emot de tweetdrivna spikarna, och rätt i att fönstret den 18 september skulle stänga tomt. Den var tre dagar för tidig med modellen, vilket är just det som ett daterat kontrakt inte kan prissätta.

Visningssiffrorna är värda att behålla som en kalibreringsanteckning. Musks nedräkning den 2 september, "kommer ut om 10 dagar", fick 10,29 miljoner visningar och var fel. Hans tillbakadragande den 11 september fick 2,05 miljoner och var också fel. Hans färdplansinlägg den 13–14 september fick omkring 1,99 miljoner och låg närmast sanningen – han beskrev Grok 4.8, en modell med ungefär 2,5 biljoner parametrar som tränats på en C++-stack byggd från grunden, som "en märkbar förbättring" jämfört med Grok 4.7. Räckvidden följde självförtroendet, inte träffsäkerheten, genom hela förloppet.

Två av punkterna på färdplanen är nu öppna frågor snarare än förutsägelser. Grok 4.8 har inget modell-ID, inget pris, inget kontextfönster och ingen benchmark-post någonstans. Och inramningen att Grok 4.7 tyst hade "döpts om" till Grok 4.8 – en mediekanals tolkning av att Musk nämnde 4.8 medan 4.7 var försenad – har avgjorts åt andra hållet: 4.7 släpptes som 4.7, på plats 46 i Index mot Grok 4.6:s 44, vilket är en efterträdares ökning och inte en nylansering.

Vad detta innebär för team som anropar Grok idag

Den praktiska bilden förändrades den 21 september, och den förändrades på minst dramatiska sätt som möjligt: ett nytt modell-ID med samma pris, samma kontextfönster, en tvåpunktsökning på Index, en ökning med nio punkter för kodagenter och en ökning med 111 punkter inom kunskapsarbete. Två förändringar sedan dess har större betydelse än de verkar. Grok-apparna ger nu modellen till vanliga användare i stället för bara till utvecklare, och katalogen på den här sidan listar den nu — tillsammans gör de routningslagret som beskrivs i slutet av den här artikeln från en plan till ett standardval. Om din kostnadsmodell byggdes på Grok 4.6 till $2/$6, är priset per token fortfarande korrekt för Grok 4.7 — men antalet token är det inte. Körningen som Artificial Analysis gjorde själva förbrukade 240 miljoner utdata-token på Intelligence Index, jämfört med en median på 94 miljoner bland de modeller den följer, så samma begäran kan kosta betydligt mer än dubbelt så mycket även om prislistan är identisk, vilket är den typ av förändring som aldrig syns i en pristabell. Prissätt en verklig agentisk loop utifrån utdata-token, inte utifrån priset per miljon, innan du drar slutsatsen att den här utgåvan är gratis. Om ditt skäl att byta är den pris-prestanda-front som leverantören hävdar, är det starkaste beviset för den nu AA-Briefcase snarare än leverantörens tabell: på fjärde plats på den resultattavlan, till ungefär halva kostnaden per uppgift jämfört med Claude Opus 5, ställt mot ett gap på sju punkter i Intelligence Index gentemot Claude Fable 5.1 och ett prisgap som går fem gånger i motsatt riktning för input och mer än åtta gånger för output. Och om din arbetsbelastning specifikt är en kodagent, är argumentet starkare än Index antyder: 56 på Coding Agent Index i Grok Build-harnesset, före GPT-5.6 Sol, är en annan liga än 46 på allmän intelligens. Vilket av dessa som spelar störst roll beror helt och hållet på din arbetsbelastning, och ingen utanför SpaceXAI har kört Grok 4.7 på din.

På OrcaRouters katalogkör Grok-serien nu Grok 4.7 tillsammans med Grok 4.6, Grok 4.5 och Grok 4.3, fakturerad till leverantörens listpris med 0 % påslag — 2 USD per miljon indatatoken och 6 USD per miljon utdatatoken, läsning av cachad indata till 0,50 USD, och samma steg till 4 USD in och 12 USD ut när en begäran passerar 200 000 indatatoken som SpaceXAI tar ut. Det är vad det ger att föra vidare prislistan oförändrad: priset per token i din kostnadsmodell är priset per token på din faktura, och varje modell i familjen svarar på en och samma nyckel, så att flytta en arbetsbelastning från Grok 4.6 till Grok 4.7 är en strängändring snarare än ett andra avtal. Den sidan har kontextfönstret på 500 000 token och samma OpenAI-kompatibla gränssnitt — Chat Completions och Responses — som en Grok 4.6-integration redan riktar in sig mot.

The OrcaRouter model page for grok/grok-4.6 showing the New and Featured badges, $2.00 per 1M input and $6.00 per 1M output tokens, a 500K-token context window, text and image input, and the released August 12, 2026 label for Grok 4.6 by SpaceXAI.

Det routningslagret är också det lågrisksätt att utvärdera en modell vars oberoende siffror publicerades samma dag som leverantörens. Benchmarklistan ovan är fortfarande leverantörens egen – dess valda utvärderingar, dess valda ansträngningsnivåer, dess valda jämförelsekolumner – och inget av detta har reproducerats. Det som har förändrats är att de tre Artificial Analysis-poängen inte är leverantörens, så frågan har flyttats från "är något av detta verkligt" till "vilket av dessa resultat liknar min arbetsbelastning": 46:an som säger allmän intelligens i mitten av fältet, 56:an som säger fyra bland kodningsagenter med native harness, eller 1 657:an som säger fyra inom kunskapsarbete till halva frontier-modellens kostnad per uppgift. Och siffran som avgör ekonomin är inte en benchmark alls, utan de utdatatokens som en körning förbrukar, vilket bara din egen trafik kan prissätta – 240 miljoner per Index-körning enligt mätningen från Artificial Analysis mot en median på 94 miljoner, och ungefär $8 mot $4,40 per uppsättning exempelpresentationer i dess offentliga AA-Briefcase-Lite-scenario. Automatisk redundansväxling låter dig rikta verklig trafik mot den nya modellen och falla tillbaka på en leverantör som fortfarande svarar om tokenräkningen eller beteendet med för tidigt avbrytande visar sig vara sämre än utlovat – vilket är skillnaden mellan att testa en oprövad modell och att satsa en pipeline på den.

Hur man vet först (kontrollen som fungerade)

Det här avsnittet brukade vara en lista över signaler att hålla utkik efter medan man väntade. Väntan är över, så här är samma lista bedömd mot vad som faktiskt hände.

• Modellistan var bekräftelsen, och den ändrades. I sex veckor var rådet i den här artikeln att hålla koll på leverantörens modellista i stället för tweetsen, för i samma stund som Grok 4.7 var verklig skulle listan få ett modell-ID med prissättning och ett kontextfönster kopplat till sig. Det var precis vad som hände: grok-4.7 visas nu med ett kontextfönster på 500K, prissättning på $2/$6 under 200K input och $4/$12 över det, en kunskapsgräns i maj 2026 och fyra ansträngningsnivåer. Varje Musk-fönster, varje kadensargument och varje marknadsdatum misslyckades med att ändra den listan; lanseringen ändrade den.

• Tredjepartskataloger föregår tillkännagivandet, och de är förslag snarare än driftsättningar. Pull-begäran för katalogen den 21 september var den tydligaste versionen av detta hittills, och dess stängning är lärorik: en bidragsgivare förberedde för en modell, en bot stängde ändringen på grund av en saknad mallsektion två timmar senare, och modellen släpptes två dagar efter det. Läs den typen av artefakt som avsikt med en tidsstämpel. Den ligger verkligen uppströms om tillkännagivandet, och den är inte tillgänglighet.

• Håll koll på OrcaRouter-modellkatalogen. Den har nu flyttat. Under hela september var rådet i den här artikeln att en grok-4.7-modellsida på orcarouter.ai skulle vara signalen "du kan anropa den idag via oss", eftersom en modell listas först när en leverantör har onboardat den. Katalogen innehåller nu Grok 4.7 till leverantörens pris utan påslag, så kontrollen som en läsare uppmanades att göra har ett svar: den är dirigerbar genom ett API idag.

• För synlighet på konsumentsidan har Grok-appen nu satt Grok 4.7 framför användare som aldrig kommer att öppna en API-konsol. Vid en ny läsning den 2 oktober namnger data från väljaren som grok.com serverar en utloggad besökare fortfarande modellen i två av sina fyra poster – Expert lyder "Tänker hårt · Grok 4.7" och Heavy lyder "Expertteam · Grok 4.7" – medan Fast, som är läget appen öppnas i som standard, bara beskrivs som "Snabba svar" och Auto som att välja mellan Fast och Expert. De fyra posterna är Auto, Fast, Expert och Heavy. Build är inte en av dem: Grok Build är en separat terminalprodukt på sin egen sida, och det är den sidan som modellens Build-tillskrivning faktiskt kommer från – den uppmanar besökare att "installera nu och börja bygga med Grok 4.7". Så påståendet som cirkulerade den 1 oktober och upprepades den 2 oktober – att Grok 4.7 nu är basmodellen i "Fast, Expert, Build och Heavy" – listar ett läge som appen inte tillhandahåller och utelämnar det som den öppnas i, och det är trackernas tolkning snarare än leverantörens, eftersom SpaceXAI inte har publicerat något om den här utrullningen överhuvudtaget. Motsvarande steg för Grok 4.5 fick ett eget blogginlägg; det här har en produkt som förändrades i tysthet i skuggan av en nyhetssida som inte gjorde det.

Läget i spelet

Grok 4.7 släpptes den 21 september 2026, till 2 $ per miljon indatatokens och 6 $ per miljon utdatatokens med ett kontextfönster på 500 000 tokens och en kunskapsgräns i maj 2026. Det som har förändrats under de elva dagarna sedan dess är tillgänglighetskartan snarare än modellen: Amazon Bedrock gjorde den tillgänglig den 28 september, den började rullas ut i Groks egna webb- och mobilappar den 1 oktober och rullades fortfarande ut där den 2 oktober, och den listas nu på OrcaRouter till SpaceXAI:s egen taxa utan påslag. Dess oberoende poäng kom samma dag som lanseringen och går fortfarande isär: 46 vid xhigh effort på Artificial Analysis Intelligence Index v4.3.2, två poäng över Grok 4.6 och tillräckligt för att placera SpaceXAI bland indexets fyra främsta labb; 56 på Coding Agent Index i Grok Build-harnessen, nio poäng över Grok 4.6 och fjärde bland modeller med nativ harness, före GPT-5.6 Sol; och 1 657 Elo på AA-Briefcase, 111 poäng över Grok 4.6 och fjärde på tavlan bakom tre Anthropic-poster, till ungefär halva kostnaden per uppgift jämfört med Claude Opus 5. Varje benchmark i leverantörens lanseringstabell är leverantörens egen och oreproducerad, med ett undantag: AA-Briefcase-tavlan från Artificial Analysis publicerar samma 1 657, och leverantören har sedan reviderat sin egen Terminal-Bench-rad från 38,0 % ned till 37,6 %. Vinsterna inom kodning och kunskapsarbete är verkliga, och de kostar utdatatokens – 240 miljoner per Index-körning mot en median på 94 miljoner, och cirka 8 $ mot 4,40 $ per uppsättning exempeldeck i AA:s offentliga due diligence-scenario – vilket är siffran som avgör om det här släppet är billigt. Siffran på ~2,1 biljoner parametrar som cirkulerade i två månader har fortfarande ingen leverantörskälla, och förbehållet om för tidigt avbrytande bemöttes aldrig direkt, även om hoppet i Terminal-Bench från 18 % till 33 % i Grok Build-harnessen är det första externa beviset på att fixen fungerade. Båda de signaler som den här artikeln uppmanade läsarna att hålla utkik efter har utlösts: leverantörens modellista har fått grok-4.7 med ett pris och ett kontextfönster angivna, och katalogen här listar den till samma taxa. Så det vinnande draget är enklare än i september – Grok 4.6 till 2 $/6 $ var svaret, och Grok 4.7 till 2 $/6 $ är samma svar med ett nyare modell-ID, bättre poäng för kodning och kunskapsarbete, en mycket större tokennota och en konsumentapp som namnger den i sina två svåraste lägen.

Jämförda i den här artikeln3

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen