Une carte hero générée pour GPT-6.1 Sol vs Gemini 4 Argon, intitulée « À un demi-point d’écart, et un seul des deux est en vente », avec deux cartes d’information indiquant « GPT-6.1 Sol : Intelligence Index 51,8, 0,72 $ par tâche d’indice, disponible maintenant » et « Gemini 4 Argon : Intelligence Index 52,6, 1,99 $ par tâche d’indice, Fairwind Program uniquement, aucun endpoint », un pied de page indiquant « Chiffres de l’Index et du coût par tâche selon Artificial Analysis, Intelligence Index v4.3.2 ; Gemini 4 Argon est annoncé mais pas encore en disponibilité générale. », et le logo OrcaRouter dans le coin inférieur droit.
Guides & Insights

GPT-6.1 Sol vs Gemini 4 Argon : à un demi-point d'écart, et un seul d'entre eux est à vendre

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Tout ce que vous pouvez comparer entre GPT-6.1 Sol et Gemini 4 Argon est mesurable, et rien de tout cela n'est exploitable, car un seul des deux modèles peut être acheté. Gemini 4 Argon a été annoncé le 30 septembre 2026 dans un billet DeepMind attribué à Koray Kavukcuoglu, à un prix d'introduction annoncé de 2,00 $ par million de jetons d'entrée et de 10,00 $ par million de jetons de sortie, et déployé d'abord auprès d'une cohorte nommée de cyberdéfenseurs via le Fairwind Program. Il n'a pas d'identifiant de modèle, pas de point de terminaison d'API, pas de tarif publié par jeton sur lequel vous pouvez être facturé, et pas de page que vous pouvez atteindre en tant que client. GPT-6.1 Sol est sorti le 29 septembre 2026 à 2,00 $ et 10,00 $ et est disponible dès maintenant. Sur l'Artificial Analysis Intelligence Index, les deux sont séparés de 0,8 point — Argon 52,6, Sol 51,8 — ce qui en fait la paire la plus proche de cette série et, sur le seul indice, une égalité parfaite. Sur le critère qui décide des déploiements réels, l'un de ces modèles n'est pas du tout candidat.

Cette asymétrie n’est pas un détail technique, et ce n’est pas non plus un scoop. C’est le fait qui devrait régir la manière dont la comparaison doit être lue : les chiffres d’Argon décrivent un modèle dans le cadre d’un déploiement contrôlé auprès d’une seule cohorte, et ceux de GPT-6.1 Sol décrivent un produit sur une liste de prix. Les comparer vaut encore la peine — Argon est ce que le fournisseur met actuellement en avant, et ses mesures disent quelque chose de réel sur la position du haut de la gamme Gemini — mais chaque conclusion doit comporter la phrase « si l’on pouvait l’acheter », et aucune d’elles ne comporte la phrase « faut-il changer ».

L'indice n'autorise qu'une seule comparaison, et celle-ci est une quasi-égalité.

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, credited to OpenAI and dated 2026-09-29, showing the model identifier, text, image and file input with text output, a 1,050,000-token context window with a 128K maximum output, and a rate row reading $2.00 input and $10.00 output per million tokens alongside a 4.54-second median time to first token and a 284.2M seven-day traffic figure.

Les deux modèles figurent sur Artificial Analysis, et tous deux comportent un score ainsi qu’une comptabilisation de ce qu’a coûté la production de ce score.

• Intelligence Index, v4.3.2 — Gemini 4 Argon 52,6 contre GPT-6.1 Sol 51,8, un écart de 0,8 point

• Coût par tâche d'indexation — Gemini 4 Argon 1,99 $ contre GPT-6.1 Sol 0,72 $, soit un écart de 2,8× pour ces 0,8 point

• Coût d’exécution de la suite complète — Gemini 4 Argon 2 407 $ vs GPT-6.1 Sol 1 082 $

• Tokens de sortie émis sur cette suite — Gemini 4 Argon 110M vs GPT-6.1 Sol 67M, une différence de verbosité de 1,6×

• Prix de lancement annoncé — 2,00 $ en entrée et 10,00 $ en sortie par million de jetons sur les deux, avec une remise de 95 % sur l'entrée mise en cache sur Argon

• Fenêtre de contexte — GPT-6.1 Sol 1 050 000 jetons ; celle d'Argon n'est pas publiée

La quatrième ligne explique la deuxième. Un écart de coût par tâche de 2,8× sur des tarifs affichés presque identiques vient du fait d’écrire 1,6× plus de tokens à un prix de sortie comparable, plus ce que coûte le volume de raisonnement qui les sous-tend. Argon n’est pas un modèle coûteux d’après sa fiche. C’est un modèle bavard à l’évaluation, et l’addition se règle dans la sortie.

Les configurations diffèrent, et le sens de cette différence avantage le modèle le moins cher. Artificial Analysis positionne Gemini 4 Argon à son réglage d'effort élevé et GPT-6.1 Sol au maximum — Sol est donc mesuré à son réglage le plus coûteux, et Argon à un niveau inférieur à son plafond. L'écart de 0,8 point constitue donc la version généreuse de la comparaison pour Sol : accordez à Argon son réglage maximal et l'écart s'élargira probablement ; accordez à Sol un réglage inférieur et son coût baissera encore. Ni l'un ni l'autre de ces choix ne modifie la ligne de disponibilité, qui est la seule ligne capable de clore une décision de déploiement.

Le simple fait de lire un écart de 0,8 point

Un écart inférieur à un point sur un indice composite de dix évaluations n’est pas un classement. Ce sont deux modèles dans la même tranche.

Ce que l'index ne publie pas pour Argon, c'est le détail des composantes qui rendrait la bande lisible — quelles évaluations il remporte, où il est faible, comment il se comporte sur les sous-scores qui composent le score composite. La page de GPT-6.1 Sol affiche ces lignes ; celle d'Argon n'affiche qu'un score principal et un coût. Une comparaison fondée sur le seul score principal peut dire que les deux sont à égalité, et rien de plus, et elle devrait dire exactement cela plutôt que de fabriquer un vainqueur à partir d'une marge de 0,8 point.

Il y a un point de données externe qui mérite d’être ajouté, et il va dans l’autre sens. Dans une évaluation de codage par un tiers diffusée après l’annonce, Argon s’est classé troisième, derrière GPT-6 Astra et Claude Opus 5.5 — un résultat solide pour un modèle en déploiement contrôlé, et qui est cohérent avec un 52,6 au composite. Il s’agit aussi d’une observation unique issue d’une seule évaluation, publiée dans les premiers jours d’une annonce, ce qui en fait une preuve plutôt qu’un historique de résultats. Étiquetez-le et passez à la suite.

À quoi servent réellement les deux cartes de prix

Le taux indiqué pour Argon mérite davantage d’attention que la ligne d’index, car il comporte deux nombres.

Le tarif d'introduction est de 2,00 $ en entrée et de 10,00 $ en sortie, avec l'entrée mise en cache à 95 % de réduction, ce qui, sur une fiche, placerait Argon à égalité de prix, à prestations comparables, avec GPT-6.1 Sol. La note de bas de page du fournisseur lui-même précise qu'après une période d'introduction qu'il ne définit pas, le tarif passe à 4,00 $ par million de tokens d'entrée et à 20,00 $ par million de tokens de sortie. Ce second couple de tarifs n'est pas hypothétique — c'est le chiffre publié auquel le modèle devrait se stabiliser — et il tombe exactement sur le prix catalogue actuel de la frontière, plutôt qu'en dessous. Une comparaison qui ne cite que le couple d'introduction cite un chiffre promotionnel pour un modèle pas encore généralement disponible, ce qui fait deux degrés de provisoire sur une seule ligne.

La carte de GPT-6.1 Sol est le type d’objet opposé. 2,00 $ et 10,00 $ correspondent au tarif en vigueur, pas à une promotion ; le palier de contexte long à 4,00 $ / 15,00 $ au-delà de 272 000 jetons de prompt est publié et s’applique à une limite définie ; l’entrée mise en cache à 0,10 $ est active aujourd’hui et facturable. Il n’y a rien là-dedans qui exige une note de bas de page à propos d’une période que le fournisseur refuse de définir.

Voilà le fond qui sous-tend la ligne de disponibilité. Non pas qu’Argon soit un modèle inférieur — l’indice dit que les deux sont à égalité — mais que, de ces deux cartes, l’une est un engagement et l’autre une intention.

Le déploiement lui-même est la comparaison.

A screenshot of the Gemini model family page on Google DeepMind's own site, headed 'Our next era of frontier intelligence' with a Gemini 4 Argon card and a Read blog link, captured October 7, 2026. The page carries no model identifier, no endpoint and no per-token price for Argon.

Le programme Fairwind est la partie de l'annonce d'Argon qu'une comparaison technique a tendance à omettre, et c'est la partie qui compte le plus ici.

Le fournisseur met d'abord le modèle entre les mains d'une cohorte nommée de cyberdéfenseurs, avant tout le monde, sans date annoncée pour une ouverture générale, sans liste d'attente pour les développeurs et sans identifiant publié qu'un client pourrait épingler. C'est une manière légitime de publier un modèle de pointe, et ce n'est pas inhabituel pour une capacité de cette classe. Cela signifie aussi que toute affirmation sur le coût, la latence, le débit et la fiabilité d'Argon sur du trafic réel n'est actuellement pas mesurée : il n'y a pas de trafic de production à mesurer. Le propre benchmark du fournisseur existe, et le composite d'Artificial Analysis existe, et entre les deux, il y a l'évaluation d'un seul laboratoire et la suite d'un seul évaluateur. C'est tout le dossier.

Le bilan de GPT-6.1 Sol a huit jours et est mince d'une autre manière : une seule configuration indépendante, aucun corpus de praticiens, et un produit commercialisé dont les modes de défaillance ne sont encore consignés nulle part. Aucun des deux modèles n'est bien étayé. L'un d'eux, toutefois, a une facture.

Alors, à quoi sert cette comparaison ?

Trois usages, et aucun d’entre eux n’est une décision d’achat.

D'abord, la calibration. Si vous suivez la position d'Argon face à GPT-6.1 Sol, 52,6 contre 51,8 avec un écart de coût par tâche de 2,8× est la réponse actuelle, et cela indique que la gamme Gemini 4 est compétitive sur le plan des capacités tout en réglant encore ses conditions commerciales. Surveillez le remplacement du tarif d'introduction par le duo 4,00 $ / 20,00 $, ce qui transformerait un alignement tarifaire en prime tarifaire à capacités inchangées.

Deuxièmement, une position d'attente. Un modèle qui est annoncé, mesuré et non routable constitue le cas le plus évident qui soit en faveur du maintien d'une abstraction entre votre application et le choix de votre modèle. GPT-6.1 Sol est sur OrcaRouter à son propre tarif de 2,00 $ / 10,00 $ avec l'entrée mise en cache à 0,10 $ et sans aucun supplément, de sorte qu'une charge de travail peut être construite dessus dès aujourd'hui au prix catalogue du fournisseur. Si et quand Argon obtient un identifiant et une grille tarifaire, son évaluation devrait relever d'un changement de configuration plutôt que d'une réécriture — et d'ici là, la juste quantité d'ingénierie à consacrer à Argon est celle qui permet que cela reste vrai.

Troisièmement, une liste de surveillance réfutable. N’importe lequel des éléments suivants ferait passer cet article de « ce que l’on sait à ce jour » à un comparatif exploitable pour faire son choix : un identifiant de modèle dans la documentation pour développeurs, une entrée dans son index de fiches de modèle, une annonce de disponibilité générale avec des tarifs par token publiés, ou la publication par Artificial Analysis d’une seconde configuration à un niveau d’effort différent. Tant que l’un de ces éléments ne se concrétise pas, un article affirmant qu’Argon est moins cher, plus rapide ou meilleur que GPT-6.1 Sol en production décrit un modèle que personne en dehors d’une seule cohorte n’a fait tourner.

A generated scoreboard titled 'GPT-6.1 Sol vs Gemini 4 Argon — the scoreboard' showing two columns on six shared rows: Intelligence Index 51.8 against 52.6 on v4.3.2; cost per index task $0.72 against $1.99; suite cost $1,082 against $2,407; output tokens on the suite 67M against 110M; index effort setting max against high; availability purchasable now against a controlled rollout with no endpoint or identifier. A footer reads 'Index and cost figures per Artificial Analysis v4.3.2; GPT-6.1 Sol pricing per OpenAI; Gemini 4 Argon figures describe an announced model that is not yet generally available.'

La conclusion honnête tient en une seule phrase, et elle porte sur la forme de la question plutôt que sur le score. Gemini 4 Argon et GPT-6.1 Sol sont suffisamment proches sur le seul classement indépendant où tous deux figurent pour que l'indice ne puisse pas choisir entre eux ; ce qui tranche entre eux, c'est que l'un est disponible et l'autre est une promesse, et on ne dirige pas du trafic de production vers une promesse. Suivez Argon, adoptez Sol si le prix et les modalités correspondent à votre travail, et gardez l'abstraction suffisamment fine pour que, le jour où Argon deviendra réalité, il s'agisse d'une ligne de configuration plutôt que d'un projet.

Comparés dans cet article2

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement