
GPT-6 vs Gemini 3.1 Pro: de Pro-tier van Google heeft sinds februari geen nieuw model uitgebracht
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 67 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Gemini 3.1 Pro has been on Google's price list for seven and a half months and has never left preview. It was announced on 19 February 2026, it is still served under an endpoint named Gemini 3.1 Pro Preview, and as of today there is no general-availability commitment and no shutdown date — the two dates that would tell you where the model sits in its own vendor's plan. GPT-6 Sol, by contrast, shipped on 22 September 2026, and on 7 October 2026 it became the model behind the paid tiers of ChatGPT's global rollout to more than 1.2 billion weekly users.
So the headline comparison is not between two flagship tiers. It is between a shipping product and an open-ended preview, and that difference turns out to be worth more than the benchmark gap does. Put them side by side on Artificial Analysis's Intelligence Index v4.3.2 and Google's seven-month-old preview scores 29.7 against GPT-6 Sol's 47.6 while charging 1.25× more per completed index task — $1.30 against $1.04. Both of those numbers are real, and both need a caveat attached before you spend money on them.
Wat dit de moeite van het lezen waard maakt in plaats van iets om af te doen, is dat de preview wel degelijk dingen wint. Hij verslaat GPT-6 Sol op GPQA Diamond, op τ²-Bench agentic tool use, en op één long-contextmeting — en hij neemt audio en video als invoer, wat GPT-6 Sol niet doet. Een zeven maanden oude preview die nog twee van de vier gevechten wint, is geen model om af te schrijven. Het is een model waarbij de levenscyclus, niet het vermogen, het probleem is.
De cijfers, en het voorbehoud over herzieningen dat daarmee moet meegaan.
Artificial Analysis voert zijn suite opnieuw uit en publiceert scores opnieuw onder de huidige indexrevisie, wat betekent dat hetzelfde model twee verschillende cijfers kan hebben, afhankelijk van wanneer je het leest. Voor Gemini 3.1 Pro is die variantie ongewoon groot: eerdere berichtgeving over dit model meldde 57 op een oudere revisie, terwijl de pagina zoals die er vandaag uitziet 29,7 op v4.3.2 vermeldt. Beide cijfers zijn echt en beide staan op dezelfde website.
Dat is belangrijk omdat alleen cijfers uit dezelfde revisie van elkaar kunnen worden afgetrokken. De 29,7 en de 47,6 zijn het paar dat hier moet worden gebruikt, aangezien beide uit v4.3.2 komen — dezelfde run waarin Claude Opus 5.5 57,6 scoort en GPT-6 Astra 52,7. De uitlezing uit dezelfde run, één regel per dimensie:
• Intelligentie-index, v4.3.2 — GPT-6 Sol 47,6 vs Gemini 3.1 Pro 29,7
• Kosten per voltooide indextaak — Gemini 3.1 Pro $1,30 vs GPT-6 Sol $1,04; het oudere model is 25% duurder per afgerond antwoord
• Invoerprijs — $2,00 per 1 mln bij beide, gelijk op het hoofdniveau
• Uitvoerprijs — GPT-6 Sol $10,00 vs Gemini 3.1 Pro $12,00; Sol is 17% goedkoper
• Clausule voor lange context — GPT-6 Sol herprijst het hele verzoek naar $4,00/$15,00 boven 272.000 invoertokens; Gemini 3.1 Pro gaat naar $4,00/$18,00 boven 200.000
• Contextvenster — GPT-6 Sol 1.050.000 tokens vs Gemini 3.1 Pro 1.048.576, vrijwel gelijk
• Maximale uitvoer — GPT-6 Sol 128.000 tokens vs Gemini 3.1 Pro 65.536; Sol is bijna het dubbele
• Invoermodaliteiten — GPT-6 Sol tekst, afbeelding, bestand vs Gemini 3.1 Pro tekst, afbeelding, audio, video, PDF

Twee regels daarin verdienen een nadere toelichting, omdat ze de voor de hand liggende lezing omkeren. De regel over kosten per taak zegt dat de ogenschijnlijk goedkopere tariefkaart toebehoort aan het model dat per afgeronde opdracht duurder is — het outputtarief van $12 van Gemini 3.1 Pro plus het redeneervolume verrichten meer werk dan het opvallende inputtarief van $2 doet vermoeden. En de stap voor lange context is het waard om aan beide kanten opnieuw te lezen: de tier van Gemini 3.1 Pro begint bij 200.000 tokens, lager dan de 272.000 van GPT-6 Sol, maar herprijst de output naar $18,00, waar Sol naar $15,00 herprijst. Geen van beide is een vlakke tariefkaart, en de crossoverpunten vallen niet samen.
Waar de voorvertoning nog steeds wint
Google's model is not a relic. Pull the evaluations both cards carry:
• GPQA Diamond — Gemini 3.1 Pro 94,1% vs GPT-6 Sol, geen vergelijkbaar cijfer gepubliceerd in deze revisie
• τ²-Bench agentisch gereedschapgebruik — Gemini 3.1 Pro 95,6% vs GPT-6 Sol, niet gepubliceerd op hetzelfde leaderboard
• Recall bij lange context — Gemini 3.1 Pro 82,0% vs GPT-6 Sol 83,7%, een verschil van 1,7 punt
• SciCode — Gemini 3.1 Pro 58,7% vs GPT-6 Sol 57,6%, vrijwel gelijkwaardig
• Terminal-Bench 4.0 — Gemini 3.1 Pro 4,0% vs GPT-6 Sol 43,9%; de enige categorie waarin de preview niet concurrerend is

Een score van 94,1% op GPQA Diamond en een score van 95,6% voor agentisch toolgebruik zijn frontier-cijfers, geen legacy-cijfers, en ze zijn de reden dat de indexkloof van 17,9 punten de praktische afstand overschat. De index is een samengestelde maatstaf over tien evaluaties, en de verliezen van Gemini 3.1 Pro zijn geconcentreerd waar de suite zwaar op software-engineering is gericht — Terminal-Bench 4.0 op 4,0% is een catastrofale uitbijter naast zijn 58,7% SciCode en zijn 73,8% Terminal-Bench 2.1. Een model dat bijna bovenaan scoort op de ene agentische benchmark en bijna onderaan op zijn opvolger, zegt je iets over zijn trainingsdatum, niet over zijn plafond.
Audio- en video-invoer is het andere concrete voordeel, en het is een drempel, geen glijdende schaal. Als je pipeline een vergaderopname of een schermopname als invoer accepteert, kan Gemini 3.1 Pro die verwerken en GPT-6 Sol niet. Geen enkele mate van leiderschap in indexen kan dat vervangen.
Wat "nog in preview" je concreet kost
Previewstatus is geen cosmetisch label, en de kosten zijn van het soort dat pas zichtbaar wordt nadat je op iets hebt voortgebouwd.
A preview endpoint carries no general-availability commitment, which means the vendor has not promised the model will still be there on a schedule you can plan around. It also carries no shutdown date, which sounds like the good version of that — nothing is being retired — but reads the other way too: Google has not published a lifecycle for a model that has been in this state since February while shipping Flash-tier models through the same period. Gemini 3.8 Flash, Gemini 3.5 Flash-Lite, the 3.6 and 3.8 Flash line: the Pro tier stayed where it was, and the successor arrived instead as Gemini 4 Argon, which Google announced on 30 September 2026 in a phased rollout to a named cohort of security partners with no general-availability date attached either.
That is the pattern this comparison is really about. If you build a durable pipeline on Gemini 3.1 Pro Preview, you are building on a model whose own vendor has not said when it will graduate, replace or retire it. GPT-6 Sol's position is the opposite: it is a generally available API product with a published rate card, and since 7 October 2026 it is also the default in the app most of your colleagues use. Vendor-reported and as yet unreproduced, OpenAI says that in ChatGPT GPT-6 composes answers using text, graphics, charts and interactive controls through a capability it calls Intelligent UI, answers that need web search begin 44% sooner than GPT-5.6 Instant, and the Extra High effort level begins responding as fast as GPT-5.6 at Medium. None of that changes an API integration. All of it is why GPT-6 is now the ambient default and the preview is not.
Er is ook een eenvoudige versie van het argument. Je betaalt 25% meer per afgeronde taak, bij een lagere capaciteitsscore, voor een model waarvan de levenscyclus niet is aangegeven. Het tegenargument is reëel — je krijgt GPQA Diamond op 94,1% en audio-invoer — maar het is een specifiek argument voor een specifieke workload, geen algemene reden om het oudere model te verkiezen.
Een preview testen zonder erop te wedden
The mistake to avoid with a model in Gemini 3.1 Pro's position is to treat "should we use it" as a single binary decision. It is not. Both Gemini 3.1 Pro Preview and GPT-6 Sol sit on OrcaRouter's catalogue behind one OpenAI-compatible endpoint and one key, at 0% markup over provider list price — so the preview is something you can put in a real request path, measure against your own workloads, and keep or drop without a second vendor contract or a code change.
Automatische failover is wat dat veilig maakt voor een model met een preview-levenscyclus. Leid de audio- en videotraffic naar Gemini 3.1 Pro, het enige van de twee dat de input aankan; leid de software-engineering- en lang-output-traffic naar GPT-6 Sol; en configureer de fallback zo dat wanneer het preview-endpoint wordt afgeschaft, rate-limited of stilletjes van prijs verandert, het verzoek op een algemeen beschikbaar model terechtkomt in plaats van te mislukken. Dat is de structuur die een zeven maanden oude preview verdient — geen ontwijking, maar een pad dat er niet van afhankelijk is.
Als je verder wilt gaan, stelt de routing-DSL meerdere modellen samen tot één logische aanroep, zodat een verzoek kan worden geprobeerd tegen Gemini 3.1 Pro en GPT-6 Sol en het antwoord wordt geselecteerd op basis van je eigen criteria in plaats van die van één leverancier. Model fusion doet hetzelfde in de andere richting — een panel van modellen dat één vraag beantwoordt — wat een redelijke manier is om erachter te komen waar de specifieke sterke punten van een preview het waard zijn om ervoor te betalen, voordat je er een productiepad aan vastlegt.

De uitspraak, en het cijfer om in de gaten te houden
Voor nieuw werk is GPT-6 Sol de veiligere keuze op vier van de zes dimensies die een deployment bepalen, en het is goedkoper per afgeronde taak, terwijl het bij dezelfde revisie 17,9 indexpunten hoger scoort. Voor workloads die audio- of video-invoer nodig hebben, of waar een GPQA Diamond van 94,1% precies is wat je koopt, wint Gemini 3.1 Pro Preview nog steeds, en het preview-label is een risico om te beheren in plaats van een reden om af te haken.
Het getal om in de gaten te houden is niet de index. Het is de datum in de naam van de endpoint van Gemini 3.1 Pro. Wanneer het achtervoegsel 'preview' verdwijnt — of wanneer Argon algemeen beschikbaar wordt met een echte API-identifier — krijgt deze vergelijking een heel andere vorm, en wordt de kloof van zeven maanden tussen de laatste release van de Pro-tier en vandaag het onderwerp van het artikel.
Vergeleken in dit artikel3
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
