
GPT-6.1 Sol vs Gemini 4 Argon : à un demi-point d'écart, et un seul d'entre eux est à vendre
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Tout ce que vous pouvez comparer entre GPT-6.1 Sol et Gemini 4 Argon est mesurable, et rien de tout cela n'est exploitable, car un seul des deux modèles peut être acheté. Gemini 4 Argon a été annoncé le 30 septembre 2026 dans un billet DeepMind attribué à Koray Kavukcuoglu, à un prix d'introduction annoncé de 2,00 $ par million de jetons d'entrée et de 10,00 $ par million de jetons de sortie, et déployé d'abord auprès d'une cohorte nommée de cyberdéfenseurs via le Fairwind Program. Il n'a pas d'identifiant de modèle, pas de point de terminaison d'API, pas de tarif publié par jeton sur lequel vous pouvez être facturé, et pas de page que vous pouvez atteindre en tant que client. GPT-6.1 Sol est sorti le 29 septembre 2026 à 2,00 $ et 10,00 $ et est disponible dès maintenant. Sur l'Artificial Analysis Intelligence Index, les deux sont séparés de 0,8 point — Argon 52,6, Sol 51,8 — ce qui en fait la paire la plus proche de cette série et, sur le seul indice, une égalité parfaite. Sur le critère qui décide des déploiements réels, l'un de ces modèles n'est pas du tout candidat.
Cette asymétrie n’est pas un détail technique, et ce n’est pas non plus un scoop. C’est le fait qui devrait régir la manière dont la comparaison doit être lue : les chiffres d’Argon décrivent un modèle dans le cadre d’un déploiement contrôlé auprès d’une seule cohorte, et ceux de GPT-6.1 Sol décrivent un produit sur une liste de prix. Les comparer vaut encore la peine — Argon est ce que le fournisseur met actuellement en avant, et ses mesures disent quelque chose de réel sur la position du haut de la gamme Gemini — mais chaque conclusion doit comporter la phrase « si l’on pouvait l’acheter », et aucune d’elles ne comporte la phrase « faut-il changer ».
L'indice n'autorise qu'une seule comparaison, et celle-ci est une quasi-égalité.

Les deux modèles figurent sur Artificial Analysis, et tous deux comportent un score ainsi qu’une comptabilisation de ce qu’a coûté la production de ce score.
• Intelligence Index, v4.3.2 — Gemini 4 Argon 52,6 contre GPT-6.1 Sol 51,8, un écart de 0,8 point
• Coût par tâche d'indexation — Gemini 4 Argon 1,99 $ contre GPT-6.1 Sol 0,72 $, soit un écart de 2,8× pour ces 0,8 point
• Coût d’exécution de la suite complète — Gemini 4 Argon 2 407 $ vs GPT-6.1 Sol 1 082 $
• Tokens de sortie émis sur cette suite — Gemini 4 Argon 110M vs GPT-6.1 Sol 67M, une différence de verbosité de 1,6×
• Prix de lancement annoncé — 2,00 $ en entrée et 10,00 $ en sortie par million de jetons sur les deux, avec une remise de 95 % sur l'entrée mise en cache sur Argon
• Fenêtre de contexte — GPT-6.1 Sol 1 050 000 jetons ; celle d'Argon n'est pas publiée
La quatrième ligne explique la deuxième. Un écart de coût par tâche de 2,8× sur des tarifs affichés presque identiques vient du fait d’écrire 1,6× plus de tokens à un prix de sortie comparable, plus ce que coûte le volume de raisonnement qui les sous-tend. Argon n’est pas un modèle coûteux d’après sa fiche. C’est un modèle bavard à l’évaluation, et l’addition se règle dans la sortie.
Les configurations diffèrent, et le sens de cette différence avantage le modèle le moins cher. Artificial Analysis positionne Gemini 4 Argon à son réglage d'effort élevé et GPT-6.1 Sol au maximum — Sol est donc mesuré à son réglage le plus coûteux, et Argon à un niveau inférieur à son plafond. L'écart de 0,8 point constitue donc la version généreuse de la comparaison pour Sol : accordez à Argon son réglage maximal et l'écart s'élargira probablement ; accordez à Sol un réglage inférieur et son coût baissera encore. Ni l'un ni l'autre de ces choix ne modifie la ligne de disponibilité, qui est la seule ligne capable de clore une décision de déploiement.
Le simple fait de lire un écart de 0,8 point
Un écart inférieur à un point sur un indice composite de dix évaluations n’est pas un classement. Ce sont deux modèles dans la même tranche.
Ce que l'index ne publie pas pour Argon, c'est le détail des composantes qui rendrait la bande lisible — quelles évaluations il remporte, où il est faible, comment il se comporte sur les sous-scores qui composent le score composite. La page de GPT-6.1 Sol affiche ces lignes ; celle d'Argon n'affiche qu'un score principal et un coût. Une comparaison fondée sur le seul score principal peut dire que les deux sont à égalité, et rien de plus, et elle devrait dire exactement cela plutôt que de fabriquer un vainqueur à partir d'une marge de 0,8 point.
Il y a un point de données externe qui mérite d’être ajouté, et il va dans l’autre sens. Dans une évaluation de codage par un tiers diffusée après l’annonce, Argon s’est classé troisième, derrière GPT-6 Astra et Claude Opus 5.5 — un résultat solide pour un modèle en déploiement contrôlé, et qui est cohérent avec un 52,6 au composite. Il s’agit aussi d’une observation unique issue d’une seule évaluation, publiée dans les premiers jours d’une annonce, ce qui en fait une preuve plutôt qu’un historique de résultats. Étiquetez-le et passez à la suite.
À quoi servent réellement les deux cartes de prix
Le taux indiqué pour Argon mérite davantage d’attention que la ligne d’index, car il comporte deux nombres.
Le tarif d'introduction est de 2,00 $ en entrée et de 10,00 $ en sortie, avec l'entrée mise en cache à 95 % de réduction, ce qui, sur une fiche, placerait Argon à égalité de prix, à prestations comparables, avec GPT-6.1 Sol. La note de bas de page du fournisseur lui-même précise qu'après une période d'introduction qu'il ne définit pas, le tarif passe à 4,00 $ par million de tokens d'entrée et à 20,00 $ par million de tokens de sortie. Ce second couple de tarifs n'est pas hypothétique — c'est le chiffre publié auquel le modèle devrait se stabiliser — et il tombe exactement sur le prix catalogue actuel de la frontière, plutôt qu'en dessous. Une comparaison qui ne cite que le couple d'introduction cite un chiffre promotionnel pour un modèle pas encore généralement disponible, ce qui fait deux degrés de provisoire sur une seule ligne.
La carte de GPT-6.1 Sol est le type d’objet opposé. 2,00 $ et 10,00 $ correspondent au tarif en vigueur, pas à une promotion ; le palier de contexte long à 4,00 $ / 15,00 $ au-delà de 272 000 jetons de prompt est publié et s’applique à une limite définie ; l’entrée mise en cache à 0,10 $ est active aujourd’hui et facturable. Il n’y a rien là-dedans qui exige une note de bas de page à propos d’une période que le fournisseur refuse de définir.
Voilà le fond qui sous-tend la ligne de disponibilité. Non pas qu’Argon soit un modèle inférieur — l’indice dit que les deux sont à égalité — mais que, de ces deux cartes, l’une est un engagement et l’autre une intention.
Le déploiement lui-même est la comparaison.

Le programme Fairwind est la partie de l'annonce d'Argon qu'une comparaison technique a tendance à omettre, et c'est la partie qui compte le plus ici.
Le fournisseur met d'abord le modèle entre les mains d'une cohorte nommée de cyberdéfenseurs, avant tout le monde, sans date annoncée pour une ouverture générale, sans liste d'attente pour les développeurs et sans identifiant publié qu'un client pourrait épingler. C'est une manière légitime de publier un modèle de pointe, et ce n'est pas inhabituel pour une capacité de cette classe. Cela signifie aussi que toute affirmation sur le coût, la latence, le débit et la fiabilité d'Argon sur du trafic réel n'est actuellement pas mesurée : il n'y a pas de trafic de production à mesurer. Le propre benchmark du fournisseur existe, et le composite d'Artificial Analysis existe, et entre les deux, il y a l'évaluation d'un seul laboratoire et la suite d'un seul évaluateur. C'est tout le dossier.
Le bilan de GPT-6.1 Sol a huit jours et est mince d'une autre manière : une seule configuration indépendante, aucun corpus de praticiens, et un produit commercialisé dont les modes de défaillance ne sont encore consignés nulle part. Aucun des deux modèles n'est bien étayé. L'un d'eux, toutefois, a une facture.
Alors, à quoi sert cette comparaison ?
Trois usages, et aucun d’entre eux n’est une décision d’achat.
D'abord, la calibration. Si vous suivez la position d'Argon face à GPT-6.1 Sol, 52,6 contre 51,8 avec un écart de coût par tâche de 2,8× est la réponse actuelle, et cela indique que la gamme Gemini 4 est compétitive sur le plan des capacités tout en réglant encore ses conditions commerciales. Surveillez le remplacement du tarif d'introduction par le duo 4,00 $ / 20,00 $, ce qui transformerait un alignement tarifaire en prime tarifaire à capacités inchangées.
Deuxièmement, une position d'attente. Un modèle qui est annoncé, mesuré et non routable constitue le cas le plus évident qui soit en faveur du maintien d'une abstraction entre votre application et le choix de votre modèle. GPT-6.1 Sol est sur OrcaRouter à son propre tarif de 2,00 $ / 10,00 $ avec l'entrée mise en cache à 0,10 $ et sans aucun supplément, de sorte qu'une charge de travail peut être construite dessus dès aujourd'hui au prix catalogue du fournisseur. Si et quand Argon obtient un identifiant et une grille tarifaire, son évaluation devrait relever d'un changement de configuration plutôt que d'une réécriture — et d'ici là, la juste quantité d'ingénierie à consacrer à Argon est celle qui permet que cela reste vrai.
Troisièmement, une liste de surveillance réfutable. N’importe lequel des éléments suivants ferait passer cet article de « ce que l’on sait à ce jour » à un comparatif exploitable pour faire son choix : un identifiant de modèle dans la documentation pour développeurs, une entrée dans son index de fiches de modèle, une annonce de disponibilité générale avec des tarifs par token publiés, ou la publication par Artificial Analysis d’une seconde configuration à un niveau d’effort différent. Tant que l’un de ces éléments ne se concrétise pas, un article affirmant qu’Argon est moins cher, plus rapide ou meilleur que GPT-6.1 Sol en production décrit un modèle que personne en dehors d’une seule cohorte n’a fait tourner.

La conclusion honnête tient en une seule phrase, et elle porte sur la forme de la question plutôt que sur le score. Gemini 4 Argon et GPT-6.1 Sol sont suffisamment proches sur le seul classement indépendant où tous deux figurent pour que l'indice ne puisse pas choisir entre eux ; ce qui tranche entre eux, c'est que l'un est disponible et l'autre est une promesse, et on ne dirige pas du trafic de production vers une promesse. Suivez Argon, adoptez Sol si le prix et les modalités correspondent à votre travail, et gardez l'abstraction suffisamment fine pour que, le jour où Argon deviendra réalité, il s'agisse d'une ligne de configuration plutôt que d'un projet.
Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
