Rubrikkort med texten ”Grok 4.7 vs Gemini 3.1 Pro” och underrubriken ”Topplistan förändrades; modellen gjorde det inte”, samt tre kort: AA Index v4.3.2 46 vs 30, Standardpris per 1M $2/$6 vs $2/$12, och Status GA vs förhandsversion.
Guides & Insights

Grok 4.7 vs Gemini 3.1 Pro: Topplistan flyttade på sig, modellen gjorde det inte

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Den 19 februari 2026 publicerade Artificial Analysis en artikel med rubriken "Gemini 3.1 Pro Preview: Den nya ledaren inom AI." Den ledde sex av tio utvärderingar och låg fyra poäng före Claude Opus 4.6. Tittar du på samma modells sida i dag är siffran 30, på sextionionde plats av 200. Leverantören ändrade ingenting. Det som har förändrats är måttstocken: Artificial Analysis reviderade sitt Intelligence Index till v4.3.2 den 19 september 2026, ompoängsatte varje modell i katalogen mot en annan uppsättning utvärderingar, och en ledare i februari blev en mittfältare i september medan modellen själv förblev orörd i förhandsversion. Det är bakgrunden till en jämförelse mot Grok 4.7 — som leverantören släppte den 21 september 2026 — och det är anledningen till att den här jämförelsen handlar mindre om vilken modell som är smartare än om vilken av dessa två du fortfarande kan lita på att den är samma sak nästa månad.

Vad var och en av dessa faktiskt är

Gemini 3.1 Pro är Googles nyaste modell på Pro-nivå och den har aldrig nått allmän tillgänglighet. Den släpptes som gemini-3.1-pro-preview den 19 februari 2026, och Googles avvecklingstabell listar den fortfarande med ”inget nedstängningsdatum meddelat” – en förhandsversion som nu har varit i förhandsversion i sju månader medan Google släppte en Flash-stege nedanför den: 3.5 Flash i maj, 3.6 i juli, 3.7 i augusti, 3.8 i september. Det finns ingen GA-Pro-modell som är nyare än Gemini 3 Pro. Den har ett indatafönster på 1 048 576 token och ett utdatatak på 65 536 token, tar in text, bilder, video, ljud och PDF och ger text som utdata, och exponerar en kontroll för tankenivå på låg, medel och hög utan någon budgetparameter och utan någon minimal inställning. Vikterna är stängda.

Grok 4.7 är en dag gammal och har även slutna vikter. Den har en kontext på 500k tokens – hälften av Geminis – och tar emot text och bilder, så den kan inte alls ta in video eller ljud, vilket är den enskilt skarpaste kapacitetsskillnaden i denna jämförelse. Den listas till 2,00 USD per miljon indatatokens och 6,00 USD per miljon utdatatokens under 200k prompttokens, med ett steg till 4,00 och 12,00 USD över den gränsen, med cachade läsningar på 0,50 och 1,00 USD; xAI listar också en snabbare variant med ungefär dubbel utdatahastighet och dubbelt pris. Ingen siffra för maximal utdata publiceras för den i dokumentationen som granskats här.

Linjalen rörde sig. Det är historien.

Båda modellerna poängsätts för närvarande enligt Artificial Analysis Intelligence Index v4.3.2, som ersatte Terminal-Bench 2.1 med Terminal-Bench 4.0 och tau3-Banking med AutomationBench-AA samt återförankrade GDPval-AA Elo-skalan. Varje modells siffra förändrades när den nya versionen infördes. Gemini 3.1 Pros siffra ändrades mer än de flesta andra modellers, eftersom dess styrkor i februari var koncentrerade till utvärderingar som det nya indexet antingen tog bort eller viktade om. När man i dag läser de två kolumnerna sida vid sida:

Sammansatt — Grok 4.7 (xhigh): 46 i Artificial Analysis Intelligence Index v4.3.2. Gemini 3.1 Pro Preview: 30 i samma version, rankad #69 av 200.

Lång kontext — Grok 4.7: 500k-fönster, AA-LCR v1.1 77 %. Gemini 3.1 Pro: 1M-fönster — dubbelt så stort — och ett utdatatak på 65K som är ungefär hälften av vad en agentisk session med lång kontext vanligtvis behöver.

Inmatningsmodalitet — Grok 4.7: text och bild. Gemini 3.1 Pro: text, bild, video, ljud och PDF. Inte ens nära, och inte ett benchmark-gap — ett kapacitetsgap.

Hastighet — Grok 4.7: ingen publicerad mätning ännu. Gemini 3.1 Pro: 124,4 utdatatokens per sekund, rankad #39 av 200, med 63,62 sekunder till första token via Google AI Studio.

Pris, standardnivå — Grok 4.7: 2,00 $ in / 6,00 $ ut per 1 miljon. Gemini 3.1 Pro: 2,00 $ in / 12,00 $ ut. Identisk indata, dubbelt så mycket utdata.

Pris, nivå för lång kontext — Grok 4.7: fördubblas till $4.00 / $12.00 vid 200k prompt-tokens. Gemini 3.1 Pro: stiger till $4.00 / $18.00 vid samma 200k-gräns. Samma indata, 50 % mer utdata.

Mognad — Grok 4.7: en dag gammal, leverantörens benchmarks till stor del inte reproducerade. Gemini 3.1 Pro: sju månader på marknaden, men fortfarande en förhandsversion utan GA-åtagande och utan nedstängningsdatum.

OrcaRouter model page for Gemini 3.1 Pro Preview showing the google/gemini-3.1-pro-preview identifier, a 1M-token context window, a 65K maximum output, audio, file, image, text and video input with text output, and list rates of $2.00 per 1M input and $12.00 per 1M output.

Problemet med förhandsvisningen är ett verkligt problem nu

En sju månader lång förhandsversion skulle vara en märklighet snarare än en risk om inget hade gått fel med den. Det har det. Från och med den 18 september 2026 började användare rapportera att Gemini 3.1 Pro hade försvunnit från modellväljaren i AI Studio, och vid tiden för detta skrivande har det inte kommit något svar från Googles anställda, inget meddelande om utfasning och ingen angiven orsak – en oavslutad tillgänglighetsincident snarare än en bekräftad avveckling. Ställ det bredvid historiken över tillkännagivanden: Google sade på I/O i maj 2026 att Gemini 3.5 Pro ”skulle rullas ut nästa månad”, och pressrapportering i slutet av augusti sade att modellen hade skrotats eftersom interna kandidater ”inte var tillräckligt mycket bättre än Flash-serien”. Googles egen Pro-sida gör fortfarande reklam för ”3.5 Pro kommer snart”, vilket är motsägelsen på en och samma skärm. Vad lösningen än blir är den praktiska tolkningen att Gemini 3.1 Pro är en förhandsversionsslutpunkt utan GA-datum, utan namngiven efterträdare och med ett aktuellt frågetecken kring tillgängligheten.

Risken med Grok 4.7 är spegelbilden och mindre till sin art. Den är en dag gammal, så dess siffror är tunna – Artificial Analysis har inte publicerat någon mätning av hastighet eller latens, och xAI:s egen benchmark-svit för den har inte reproducerats oberoende. Det som inte ifrågasätts är att modellen är allmänt tillgänglig, prissatt, dokumenterad och stabil i sin identitet. En modell vars identitet är stabil och vars siffror är obevisade är mycket enklare att bygga på än en modell vars siffror är publicerade och vars tillgänglighet inte är det.

Vad splittringen kostar i praktiken

Anta att du väljer för en dokumentpipeline. För 100k indatatokens och 8k utdata kostar Grok 4.7 $0.20 in och $0.048 ut — ungefär en fjärdedel. Gemini 3.1 Pro kostar $0.20 in och $0.096 ut — ungefär trettio cent. De två ligger inom tjugo procent av varandra, och om dina dokument är skanningar, PDF-filer, ljud eller video, är Gemini den enda av de två som överhuvudtaget kan läsa dem. Det är inte ett benchmarkargument; det avslutar jämförelsen för den arbetsbelastningen.

Anta nu att du ska välja åt en agent med lång kontext. Vid 300k indata och 8k utdata kostar Grok 4.7 1,20 USD för indata och 0,096 USD för utdata, cirka 1,30 USD. Gemini 3.1 Pro kostar 1,20 USD för indata och 0,144 USD för utdata, cirka 1,35 USD. I praktiken är de identiska – och här blir Geminis 1M-fönster och 65K-tak för utdata den begränsning som avgör saken, eftersom ett tak på 65K är där långa agentiska körningar fallerar. Ingen av modellerna är det billiga alternativet i den här duellen, och ingen av dem är dyr enligt frontier-standard.

Two-column scoreboard titled “Grok 4.7 vs Gemini 3.1 Pro - the scoreboard”: AA Index 46 vs 30, context 500k vs 1M, input modality “text + image” vs “text + image + video + audio + PDF”, max output “not stated” vs 65k, price per 1M $2/$6 vs $2/$12, and status GA vs preview.

Routning runt ett rörligt mål

OrcaRouter tillhandahåller Gemini 3.1 Pro, listad på sin egen modellsida till leverantörens priser — 2,00 $ in och 12,00 $ ut, med 1M-fönstret och maximalt 65k utdata — eftersom vi förmedlar leverantörens listpriser vidare med 0 % påslag. Det är inte en marknadsföringsfras i ett fall som detta: Google har en förhandsversion med obestämd varaktighet vars tillgänglighet svajade i september, och det användbara en router gör är att hålla integrationen stabil medan det som ligger bakom den förändras. Automatisk redundansväxling innebär att en förhandsversion-endpoint som slutar svara blir en routningshändelse i stället för ett avbrott, och routnings-DSL:en låter dig kombinera en multimodal modell med en textbaserad i ett enda anrop — vilket är exakt den form detta par antyder, där Gemini läser videon och Grok resonerar utifrån dess transkript. Grok 4.7 finns inte i OrcaRouters katalog vid tidpunkten för detta skrivande; att anropa den i dag innebär att gå via xAI:s egen API och de tredjepartsplattformar som erbjuder den.

Mönstret som är värt att bygga: behåll Gemini 3.1 Pro för allt som måste ta in video, ljud eller PDF, och behandla dess preview-status som en operativ risk att runda snarare än ett skäl att undvika den. Sätt Grok 4.7 på text- och bildarbetet där dess lägre pris för utdata och högre sammanvägda poäng gäller, och där modellen du integrerar i dag är modellen du fortfarande kommer att anropa om sex månader. Det enda du inte bör göra är att tolka rankningen på sextionionde plats som en dom över modellen – det är en dom över en revidering av ett benchmark, och samma revidering som degraderade Gemini 3.1 Pro degraderade också dussintals modeller som Google aldrig rörde.

Samtalet

På det aktuella indexet leder Grok 4.7 över Gemini 3.1 Pro med sexton poäng, och när det gäller utdatapris kostar den hälften så mycket i standardnivån och en tredjedel billigare i long-context-nivån. Om din arbetsbelastning består av text och bilder räcker det för att avgöra saken. Om din arbetsbelastning består av video, ljud eller skannade dokument är Gemini 3.1 Pro den enda av de två kandidaterna och jämförelsen tar slut där – du köper en förmåga, inte en poäng. Förbehållet som bör följa dem båda handlar om härkomst snarare än prestanda: den ena är en sju månader gammal förhandsversion utan GA-datum och med en tillgänglighetsincident i september bakom sig, den andra är en dag gammal med ett tal som gör rubriker och ingen oberoende reproduktion av något annat. Ingen av dem är ett avgjort val. Båda är värda att routa till snarare än att binda sig vid.

Artificial Analysis page for Grok 4.7 at xhigh reasoning effort: an Artificial Analysis Intelligence Index score of 46, ranked #16 of 655; Speed and Cost both reported as N/A; 240M output tokens from the Intelligence Index run, ranked #140 of 655; a 500k-token context window with text and image input and text output; and comparison charts for intelligence, speed and cost per task.

Jämförda i den här artikeln2

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen