
GPT-6 vs Gemini 3.1 Pro : la gamme Pro de Google n'a pas sorti de nouveau modèle depuis février
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 67 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Gemini 3.1 Pro figure sur la grille tarifaire de Google depuis sept mois et demi et n’est jamais sorti de l’aperçu. Il a été annoncé le 19 février 2026, il est toujours servi via un point de terminaison nommé Gemini 3.1 Pro Preview, et à ce jour, il n’existe aucun engagement de disponibilité générale ni aucune date d’arrêt — les deux dates qui indiqueraient où se situe le modèle dans le plan de son propre fournisseur. GPT-6 Sol, en revanche, est sorti le 22 septembre 2026 et, le 7 octobre 2026, il est devenu le modèle qui sous-tend les offres payantes du déploiement mondial de ChatGPT auprès de plus de 1,2 milliard d’utilisateurs hebdomadaires.
Donc, la comparaison principale n'oppose pas deux niveaux de produits phares. Elle oppose un produit commercialisé à une préversion ouverte, et cette différence s'avère compter davantage que l'écart de benchmark. Si on les place côte à côte dans l'Intelligence Index v4.3.2 d'Artificial Analysis, la préversion de Google vieille de sept mois obtient 29,7 contre 47,6 pour GPT-6 Sol, tout en facturant 1,25 fois plus par tâche d'index complétée — 1,30 $ contre 1,04 $. Ces deux chiffres sont réels, et tous deux doivent être assortis d'une mise en garde avant que vous ne dépensiez de l'argent en vous fondant sur eux.
Ce qui rend ce texte digne d'être lu plutôt que rejeté, c'est que l'aperçu remporte bel et bien des victoires. Il bat GPT-6 Sol sur GPQA Diamond, sur l'utilisation d'outils agentique de τ²-Bench, et sur une mesure de contexte long — et il accepte l'audio et la vidéo en entrée, ce que GPT-6 Sol ne fait pas. Un aperçu vieux de sept mois qui remporte encore deux combats sur quatre n'est pas un modèle à écarter. C'est un modèle dont le problème est le cycle de vie, et non les capacités.
Les chiffres, et la mise en garde concernant les révisions qui doit les accompagner
Artificial Analysis relance sa suite et republie les scores selon la révision actuelle de l’indice, ce qui signifie qu’un même modèle peut porter deux chiffres différents selon le moment où on le consulte. Pour Gemini 3.1 Pro, cet écart est inhabituellement large : des articles antérieurs consacrés à ce modèle faisaient état de 57 sur une révision plus ancienne, tandis que la page telle qu’elle est aujourd’hui indique 29,7 sur v4.3.2. Ces deux chiffres sont authentiques et figurent tous deux sur le même site web.
Cela compte parce que seuls les chiffres issus de la même révision peuvent être soustraits. Le 29,7 et le 47,6 sont la paire à utiliser ici, puisque tous deux proviennent de v4.3.2 — la même exécution qui attribue à Claude Opus 5.5 un score de 57,6 et à GPT-6 Astra un score de 52,7. La lecture issue de la même exécution, une ligne par dimension :
• Indice d'intelligence, v4.3.2 — GPT-6 Sol 47.6 vs Gemini 3.1 Pro 29.7
• Coût par tâche d'index terminée — Gemini 3.1 Pro $1.30 vs GPT-6 Sol $1.04 ; le modèle plus ancien coûte 25 % plus cher par réponse finalisée
• Prix d'entrée — $2.00 par 1M chez les deux, à égalité sur le tarif affiché
• Prix de sortie — GPT-6 Sol $10.00 vs Gemini 3.1 Pro $12.00 ; Sol est 17 % moins cher
• Clause de contexte long — GPT-6 Sol refacture la totalité de la requête à $4.00/$15.00 au-delà de 272,000 jetons d'entrée ; Gemini 3.1 Pro passe à $4.00/$18.00 au-delà de 200,000
• Fenêtre de contexte — GPT-6 Sol 1,050,000 jetons vs Gemini 3.1 Pro 1,048,576, pratiquement à égalité
• Sortie maximale — GPT-6 Sol 128,000 jetons vs Gemini 3.1 Pro 65,536 ; Sol fait presque le double
• Modalités d'entrée — GPT-6 Sol texte, image, fichier vs Gemini 3.1 Pro texte, image, audio, vidéo, PDF

Deux lignes ici méritent d’être développées parce qu’elles inversent la lecture évidente. La ligne du coût par tâche indique que la grille tarifaire qui paraît la moins chère appartient au modèle le plus cher par travail terminé — le tarif de sortie de 12 $ de Gemini 3.1 Pro, ajouté à son volume de raisonnement, accomplit plus de travail que ne le laisse supposer son tarif d’entrée affiché de 2 $. Et l’étape de contexte long vaut la peine d’être relue des deux côtés : le palier de Gemini 3.1 Pro commence à 200 000 tokens, plus bas que celui de GPT-6 Sol à 272 000, mais il refacture la sortie à 18,00 $ là où Sol la refacture à 15,00 $. Aucune des deux n’est une grille tarifaire uniforme, et les points de bascule ne coïncident pas.
Là où l'aperçu l'emporte encore
Le modèle de Google n'est pas une relique. Récupérez les évaluations que portent les deux cartes :
• GPQA Diamond — Gemini 3.1 Pro 94,1 % contre GPT-6 Sol, aucune donnée comparable publiée dans cette révision
• τ²-Bench, utilisation d’outils agentiques — Gemini 3.1 Pro 95,6 % contre GPT-6 Sol, non publié sur le même classement
• rappel en contexte long — Gemini 3.1 Pro 82,0 % contre GPT-6 Sol 83,7 %, un écart de 1,7 point
• SciCode — Gemini 3.1 Pro 58,7 % contre GPT-6 Sol 57,6 %, pratiquement au même niveau
• Terminal-Bench 4.0 — Gemini 3.1 Pro 4,0 % contre GPT-6 Sol 43,9 % ; la seule catégorie où la version préliminaire n’est pas compétitive

Un score de 94,1 % à GPQA Diamond et un score de 95,6 % en utilisation agentique d’outils sont des chiffres de pointe, pas des chiffres hérités, et c’est pourquoi l’écart d’indice de 17,9 points exagère la distance pratique. L’indice est un composite sur dix évaluations, et les pertes de Gemini 3.1 Pro sont concentrées là où la suite est fortement pondérée vers l’ingénierie logicielle — Terminal-Bench 4.0 à 4,0 % est une valeur aberrante catastrophique à côté de son 58,7 % à SciCode et de son 73,8 % à Terminal-Bench 2.1. Un modèle qui obtient un score proche du sommet d’un benchmark agentique et proche du bas de son successeur vous renseigne sur sa date d’entraînement, pas sur son plafond.
L’entrée audio et vidéo est l’autre avantage concret, et il s’agit d’un verrou plutôt que d’un gradient. Si votre pipeline prend en entrée un enregistrement de réunion ou une capture d’écran, Gemini 3.1 Pro peut y être intégré, et GPT-6 Sol non. Aucun leadership sur les index ne remplace cela.
Ce que « toujours en préversion » vous coûte, concrètement
Le statut d’aperçu n’est pas une étiquette cosmétique, et les coûts sont du genre qui n’apparaissent qu’une fois que l’on a construit quelque chose dessus.
Un point de terminaison de préversion n'implique aucun engagement de disponibilité générale, ce qui signifie que le fournisseur n'a pas promis que le modèle serait encore là selon un calendrier sur lequel vous pouvez vous organiser. Il ne comporte pas non plus de date d'arrêt, ce qui ressemble à la bonne version de cette situation — rien n'est retiré — mais se lit aussi dans l'autre sens : Google n'a publié aucun cycle de vie pour un modèle qui se trouve dans cet état depuis février, tout en livrant des modèles de la gamme Flash sur la même période. Gemini 3.8 Flash, Gemini 3.5 Flash-Lite, la gamme 3.6 et 3.8 Flash : l'offre Pro est restée où elle était, et le successeur est arrivé sous la forme de Gemini 4 Argon, que Google a annoncé le 30 septembre 2026 dans le cadre d'un déploiement progressif auprès d'un groupe nommé de partenaires de sécurité, sans qu'aucune date de disponibilité générale n'y soit associée non plus.
C'est le schéma dont cette comparaison traite vraiment. Si vous construisez un pipeline durable sur Gemini 3.1 Pro Preview, vous construisez sur un modèle dont son propre fournisseur n'a pas dit quand il passera en version définitive, sera remplacé ou retiré. La position de GPT-6 Sol est l'inverse : c'est un produit API généralement disponible avec une grille tarifaire publiée, et depuis le 7 octobre 2026, il est aussi la valeur par défaut dans l'application qu'utilisent la plupart de vos collègues. Rapporté par le fournisseur et encore non reproduit, OpenAI affirme que dans ChatGPT, GPT-6 compose des réponses en utilisant du texte, des visuels, des graphiques et des contrôles interactifs grâce à une capacité qu'il appelle Intelligent UI, que les réponses nécessitant une recherche web commencent 44 % plus tôt que GPT-5.6 Instant, et que le niveau d'effort Extra High commence à répondre aussi vite que GPT-5.6 en Medium. Rien de tout cela ne change une intégration API. Tout cela explique pourquoi GPT-6 est désormais la valeur par défaut ambiante, et la preview ne l'est pas.
Il existe aussi une version simple de l’argument. Vous payez 25 % de plus par tâche terminée, avec un score de capacité inférieur, pour un modèle dont le cycle de vie n’est pas déclaré. Le contre-argument est réel — vous obtenez GPQA Diamond à 94,1 % et une entrée audio — mais c’est un argument spécifique pour une charge de travail spécifique, pas une raison générale de préférer le modèle plus ancien.
Tester un aperçu sans parier dessus
L'erreur à éviter avec un modèle dans la position de Gemini 3.1 Pro, c'est de traiter la question « faut-il l'utiliser » comme une décision binaire unique. Ce n'est pas le cas. Gemini 3.1 Pro Preview et GPT-6 Sol figurent tous deux au catalogue d'OrcaRouter derrière un seul point de terminaison compatible OpenAI et une seule clé, à 0 % de marge par rapport au prix catalogue du fournisseur — la preview est donc quelque chose que vous pouvez placer dans un véritable chemin de requête, mesurer par rapport à vos propres charges de travail, et conserver ou abandonner sans second contrat fournisseur ni modification de code.
Le basculement automatique est ce qui rend cela sûr pour un modèle en cycle de vie d'aperçu. Acheminez le trafic audio et vidéo vers Gemini 3.1 Pro, le seul des deux capable de prendre ce type d'entrée ; acheminez le trafic d'ingénierie logicielle et de sorties longues vers GPT-6 Sol ; et configurez le repli pour que, si le point de terminaison d'aperçu est déprécié, soumis à des limites de débit ou discrètement re-tarifé, la requête atterrisse sur un modèle en disponibilité générale au lieu d'échouer. Voilà la structure qu'un aperçu vieux de sept mois mérite — non pas l'évitement, mais un chemin qui ne dépend pas de lui.
Si vous voulez aller plus loin, le DSL de routage compose plusieurs modèles en un seul appel logique : une requête peut ainsi être essayée sur Gemini 3.1 Pro et GPT-6 Sol, et la réponse sélectionnée selon vos propres critères plutôt que ceux d'un seul fournisseur. La fusion de modèles fait la même chose dans l'autre sens — un panel de modèles qui répondent à une même question — ce qui est un moyen raisonnable de déterminer où les atouts spécifiques d'une preview valent la peine d'être payés avant de s'engager sur une voie de production avec elle.

Le verdict, et le chiffre à surveiller
Pour de nouveaux travaux, GPT-6 Sol est le choix le plus sûr sur quatre des six dimensions qui déterminent un déploiement, et il est moins cher par tâche terminée tout en obtenant 17,9 points d'indice de plus à révision égale. Pour les charges de travail qui nécessitent une entrée audio ou vidéo, ou lorsque c'est un score de 94,1 % à GPQA Diamond que vous achetez, Gemini 3.1 Pro Preview l'emporte encore, et le label preview est un risque à gérer plutôt qu'une raison de renoncer.
Le chiffre à surveiller n'est pas l'indice. C'est la date figurant dans le nom du point d'accès de Gemini 3.1 Pro. Lorsque le suffixe « preview » disparaîtra — ou lorsque Argon sera disponible en version générale avec un véritable identifiant d'API —, cette comparaison changera entièrement de forme, et l'écart de sept mois entre la dernière version de la gamme Pro et aujourd'hui deviendra le véritable sujet de l'article.
Comparés dans cet article3
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
