Hjälterubrikkort med texten "GPT-6 vs Gemini 3.1 Pro", med en chip med texten "Gemini 3.1 Pro: i förhandsvisning sedan 2026-02-19", två prisrader med texten "GPT-6 Sol $2 / $10" och "Gemini 3.1 Pro $2 / $12", och en sidfot med texten "Indexsiffror enligt Artificial Analysis v4.3.2; GPT-6:s leverantörsrapporterade poster märkta i texten." OrcaRouter-logotypen är komponerad i det nedre högra hörnet.
Guides & Insights

GPT-6 vs Gemini 3.1 Pro: Googles Pro-nivå har inte lanserat en ny modell sedan februari

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Gemini 3.1 Pro har stått på Googles prislista i sju och en halv månad och har aldrig lämnat förhandsversionen. Det tillkännagavs den 19 februari 2026, det serveras fortfarande under en slutpunkt som heter Gemini 3.1 Pro Preview, och i dag finns det inget åtagande om allmän tillgänglighet och inget avvecklingsdatum – de två datum som skulle visa var modellen befinner sig i sin egen leverantörs plan. GPT-6 Sol släpptes däremot den 22 september 2026, och den 7 oktober 2026 blev det modellen bakom de betalda nivåerna i ChatGPT:s globala utrullning till fler än 1,2 miljarder veckovisa användare.

Så huvudjämförelsen är inte mellan två flaggskeppsnivåer. Den är mellan en produkt som redan är släppt och en öppen förhandsversion, och den skillnaden visar sig vara värd mer än benchmarkgapet. Ställ dem sida vid sida i Artificial Analysis Intelligence Index v4.3.2, och Goo​gles sju månader gamla förhandsversion får 29,7 mot GPT-6 Sols 47,6 samtidigt som den debiterar 1,25× mer per slutförd indexuppgift — 1,30 $ mot 1,04 $. Båda siffrorna är verkliga, och båda behöver ett förbehåll kopplat till sig innan du spenderar pengar på dem.

Det som gör detta värt att läsa i stället för att avfärda är att förhandsversionen faktiskt vinner saker. Den slår GPT-6 Sol på GPQA Diamond, på τ²-Bench för agentisk verktygsanvändning och på en långkontextmätning – och den tar emot ljud och video som indata, vilket GPT-6 Sol inte gör. En sju månader gammal förhandsversion som fortfarande vinner två av fyra duster är inte en modell att avfärda. Det är en modell vars livscykel, inte dess förmåga, är problemet.

Siffrorna, och revideringsförbehållet som måste följa med dem

Artificial Analysis kör om sin svit och publicerar om poäng under den aktuella indexrevisionen, vilket innebär att samma modell kan ha två olika siffror beroende på när du läser den. För Gemini 3.1 Pro är den variationen ovanligt stor: tidigare bevakning av den här modellen rapporterade 57 på en äldre revision, medan sidan som den ser ut i dag rapporterar 29.7 på v4.3.2. Båda siffrorna är äkta och båda finns på samma webbplats.

Det spelar roll eftersom endast värden från samma revision kan subtraheras. 29,7 och 47,6 är paret som ska användas här, eftersom båda kommer från v4.3.2 — samma körning där Claude Opus 5.5 får 57,6 och GPT-6 Astra får 52,7. Avläsningen från samma körning, en rad per dimension:

• Intelligensindex, v4.3.2 — GPT-6 Sol 47,6 vs Gemini 3.1 Pro 29,7
• Kostnad per slutförd indexuppgift — Gemini 3.1 Pro $1,30 vs GPT-6 Sol $1,04; den äldre modellen är 25 % dyrare per färdigt svar
• Indatapris — $2,00 per 1 miljon för båda, samma nivå i rubriken
• Utdatapris — GPT-6 Sol $10,00 vs Gemini 3.1 Pro $12,00; Sol är 17 % billigare
• Klausul för lång kontext — GPT-6 Sol prissätter om hela begäran till $4,00/$15,00 över 272 000 indatatoken; Gemini 3.1 Pro trappar upp till $4,00/$18,00 över 200 000
• Kontextfönster — GPT-6 Sol 1 050 000 token vs Gemini 3.1 Pro 1 048 576, i praktiken lika
• Maximal utdata — GPT-6 Sol 128 000 token vs Gemini 3.1 Pro 65 536; Sol är nästan dubbelt så mycket
• Indatamodaliteter — GPT-6 Sol text, bild, fil vs Gemini 3.1 Pro text, bild, ljud, video, PDF

A two-column comparison scoreboard for GPT-6 Sol and Gemini 3.1 Pro, showing GPT-6 Sol at an Intelligence Index of 47.6, $1.04 per index task and a 128,000-token output ceiling, against Gemini 3.1 Pro at 29.7, $1.30 and 65,536 tokens, with input and output prices of $2.00/$10.00 against $2.00/$12.00 and a preview-since-2026-02-19 chip. A footer reads "Index figures per Artificial Analysis v4.3.2; Gemini 3.1 Pro is a preview product."

Två rader där förtjänar att byggas ut eftersom de vänder på den självklara läsningen. Raden för kostnad per uppgift säger att den till synes billigare prislistan tillhör modellen som är dyrare per slutfört jobb – Gemini 3.1 Pros utdataavgift på $12 plus dess resonemangsvolym gör mer arbete än vad dess rubrikpris på $2 för indata antyder. Och steget för lång kontext är värt att läsa om på båda sidor: Gemini 3.1 Pros nivå börjar vid 200 000 tokens, lägre än GPT-6 Sols 272 000, men prissätter om utdata till $18.00 medan Sol prissätter om till $15.00. Ingen av dem är en platt prislista, och skärningspunkterna sammanfaller inte.

Där förhandsvisningen fortfarande vinner

Googles modell är inte en relik. Hämta utvärderingarna som båda korten innehåller:

• GPQA Diamond — Gemini 3.1 Pro 94,1 % mot GPT-6 Sol, ingen jämförbar siffra publicerad för denna version
• τ²-Bench agentisk verktygsanvändning — Gemini 3.1 Pro 95,6 % mot GPT-6 Sol, inte publicerad på samma resultattavla
• Återkallning av lång kontext — Gemini 3.1 Pro 82,0 % mot GPT-6 Sol 83,7 %, en skillnad på 1,7 punkter
• SciCode — Gemini 3.1 Pro 58,7 % mot GPT-6 Sol 57,6 %, i praktiken lika
• Terminal-Bench 4.0 — Gemini 3.1 Pro 4,0 % mot GPT-6 Sol 43,9 %; den enda kategorin där förhandsversionen inte är konkurrenskraftig

A screenshot of the Artificial Analysis leaderboard: the top of the table under the Model, Context Window, Creator, Intelligence Index, Cost per Task, Tokens/s, First Chunk and Response headings - Claude Opus 5.5 (max with fallback) at 58, Claude Sonnet 5.5 at 56, Claude Fable 5.1 at 53, GPT-6 Astra (max) at 53 and $3.26, Gemini 4 Argon (high) at 53 and GPT-6.1 Sol (max) at 52 and $0.72 - with the Gemini 3.1 Pro Preview row set below it, showing an index of 30 at $1.30 per index task, 67M tokens generated and 22M output tokens at 23.40 tokens per second.

En GPQA Diamond på 94,1 % och en poäng på 95,6 % för agentisk verktygsanvändning är siffror på frontier-nivå, inte på legacy-nivå, och de är anledningen till att indexgapet på 17,9 punkter överdriver det praktiska avståndet. Indexet är ett sammansatt mått över tio utvärderingar, och Gemini 3.1 Pro:s förluster är koncentrerade där testsviten har stark övervikt mot mjukvaruutveckling – Terminal-Bench 4.0 på 4,0 % är en katastrofal avvikare jämfört med dess 58,7 % på SciCode och dess 73,8 % på Terminal-Bench 2.1. En modell som ligger nära toppen i ett agentiskt benchmark och nära botten i dess efterföljare säger dig något om dess träningsdatum, inte om dess tak.

Ljud- och videoinmatning är den konkreta fördelen, och det är en tröskel snarare än en gradient. Om din pipeline tar en mötesinspelning eller en skärminspelning som indata kan Gemini 3.1 Pro ta sig in i den och GPT-6 Sol kan inte. Ingen grad av indexledarskap ersätter det.

Vad "fortfarande i förhandsversion" kostar dig, konkret

Preview-status är inte en kosmetisk etikett, och kostnaderna är av det slag som bara visar sig efter att man har byggt ovanpå något.

En förhandsgranskningsendpoint innebär inget åtagande om allmän tillgänglighet, vilket betyder att leverantören inte har lovat att modellen fortfarande kommer att finnas kvar enligt ett schema du kan planera efter. Den har inte heller något nedstängningsdatum, vilket låter som den goda versionen av det — ingenting håller på att avvecklas — men kan också läsas på motsatt sätt: Goo​gle har inte publicerat en livscykel för en modell som har befunnit sig i detta tillstånd sedan februari, samtidigt som man har levererat modeller i Flash-klassen under samma period. Gemini 3.8 Flash, Gemini 3.5 Flash-Lite, 3.6- och 3.8 Flash-linjen: Pro-nivån stannade där den var, och efterträdaren kom i stället som Gemini 4 Argon, vilket Goo​gle tillkännagav den 30 september 2026 i en etappvis utrullning till en namngiven grupp säkerhetspartner, utan att heller något datum för allmän tillgänglighet angavs.

Det är mönstret som den här jämförelsen egentligen handlar om. Om du bygger en varaktig pipeline på Gemini 3.1 Pro Preview bygger du på en modell vars egen leverantör inte har sagt när den ska gå vidare, ersättas eller pensioneras. GPT-6 Sol:s position är den motsatta: den är en allmänt tillgänglig API-produkt med en publicerad prislista, och sedan den 7 oktober 2026 är den också standard i appen som de flesta av dina kollegor använder. Enligt leverantören och ännu inte reproducerat uppger OpenAI att GPT-6 i ChatGPT sammanställer svar med text, grafik, diagram och interaktiva kontroller genom en förmåga som den kallar Intelligent UI, att svar som kräver webbsökning börjar 44 % tidigare än GPT-5.6 Instant, och att ansträngningsnivån Extra High börjar svara lika snabbt som GPT-5.6 på Medium. Inget av detta förändrar en API-integration. Allt detta är anledningen till att GPT-6 nu är det självklara förvalet och förhandsversionen inte är det.

Det finns också en enkel version av argumentet. Du betalar 25 % mer per slutförd uppgift, vid en lägre kapacitetspoäng, för en modell vars livscykel är odeklarerad. Motargumentet är verkligt – du får GPQA Diamond på 94,1 % och ljudingång – men det är ett specifikt argument för en specifik arbetsbelastning, inte ett allmänt skäl att föredra den äldre modellen.

Testar en förhandsvisning utan att satsa på den

The mistake to avoid with a model in Gemini 3.1 Pro's position is to treat "should we use it" as a single binary decision. It is not. Both Gemini 3.1 Pro Preview and GPT-6 Sol sit on OrcaRouter's catalogue behind one Ope​nAI-compatible endpoint and one key, at 0% markup over provider list price — so the preview is something you can put in a real request path, measure against your own workloads, and keep or drop without a second vendor contract or a code change.

Automatisk failover är det som gör det säkert för en modell i en preview-livscykel. Dirigera ljud- och videotrafiken till Gemini 3.1 Pro, där den är den enda av de två som kan ta emot indata; dirigera trafiken för mjukvaruutveckling och långa utdata till GPT-6 Sol; och konfigurera reservvägen så att om preview-slutpunkten fasas ut, hastighetsbegränsas eller i tysthet får ändrat pris, hamnar begäran på en allmänt tillgänglig modell i stället för att misslyckas. Det är strukturen som en sju månader gammal preview förtjänar – inte att undvika, utan en väg som inte är beroende av den.

Om du vill gå längre sammanställer routing-DSL:en flera modeller till ett logiskt anrop, så en begäran kan testas mot Gemini 3.1 Pro och GPT-6 Sol och svaret väljas enligt dina egna kriterier i stället för en leverantörs. Modellfusion gör samma sak i motsatt riktning – en panel av modeller som svarar på en fråga – vilket är ett rimligt sätt att ta reda på var en förhandsversions specifika styrkor är värda att betala för innan man binder en produktionsväg till den.

A screenshot of the OrcaRouter model page for google/gemini-3.1-pro-preview, showing the Google vendor label, a 2026-02-19 release date, a 1M-token context window, a 65K-token maximum output, text, image, audio, video and file input, and pricing of $2.00 per million input tokens and $12.00 per million output tokens.

Domen, och siffran att hålla ögonen på

För nytt arbete är GPT-6 Sol det tryggare valet på fyra av de sex dimensioner som avgör en driftsättning, och det är billigare per slutförd uppgift samtidigt som det får 17,9 indexpoäng högre vid samma revision. För arbetsbelastningar som kräver ljud- eller videoinmatning, eller där 94,1 % GPQA Diamond är det du köper, vinner Gemini 3.1 Pro Preview fortfarande, och förhandsversionsbeteckningen är en risk att hantera snarare än ett skäl att avstå.

Siffran att hålla ögonen på är inte indexet. Det är datumet i Gemini 3.1 Pro:s slutpunktsnamn. När preview-suffixet tas bort – eller när Argon når allmän tillgänglighet med en riktig API-identifierare – byter den här jämförelsen skepnad helt, och glappet på sju månader mellan Pro-nivåns senaste släpp och i dag blir det som artikeln handlar om.

Jämförda i den här artikeln4

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen