
Gemini 4 Argon vs GPT-6 Sol : un cinquième du prix, quatre fois la facture
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 219 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Lancez la suite d'indices Artificial Analysis sur Gemini 4 Argon et la facture s'élève à 2 407 $. Lancez la même suite sur GPT-6 Sol et la facture s'élève à 1 546 $. Même indice, mêmes tâches, même semaine. Les deux modèles ont des tarifs catalogue identiques — 2,00 $ par million de tokens d'entrée et 10,00 $ par million de tokens de sortie, Argon en tant que tarif d'introduction annoncé par Google et Sol en tant que tarif standard d'OpenAI — et pourtant le coût final d'un travail identique diffère de 56 %, en faveur du modèle qui obtient cinq points de moins. Cet écart est toute la raison pour laquelle cette comparaison vaut la peine d'être écrite, et il n'a rien à voir avec la grille tarifaire.
Google a annoncé Gemini 4 Argon le 30 septembre 2026, le présentant comme la nouvelle ère de l'intelligence de pointe, au tarif de 2 $ en entrée et 10 $ en sortie, avec l'entrée mise en cache à 95 % de réduction, déployé auprès de cyberdéfenseurs de confiance via le programme Fairwind. GPT-6 Sol est en disponibilité générale depuis le 22 septembre 2026, date à laquelle OpenAI a livré le palier intermédiaire de la gamme GPT-6 à 2 $ en entrée et 10 $ en sortie, avec une remise de 90 % sur le cache. L'un est achetable dès aujourd'hui sur un point de terminaison compatible avec OpenAI, et l'autre n'est achetable par personne en dehors d'une cohorte nommée : c'est là la bifurcation pratique de cet article. Mais l'inversion des coûts évoquée ci-dessus subsiste même si l'on met totalement de côté la question de la disponibilité, et comprendre pourquoi est la partie utile.
L'inversion, dite simplement
Artificial Analysis publie à la fois un Intelligence Index et une comptabilisation de ce qu’il a coûté pour faire fonctionner cet indice. Lus ensemble, ils disent ceci :
• Indice d'intelligence — Gemini 4 Argon 52,6 contre GPT-6 Sol 47,5. Un écart de cinq points, mesuré avec Argon configuré à un niveau élevé d'effort et Sol au max, donc la comparaison est généreuse envers Sol plutôt qu'envers Argon.
• Prix catalogue par million de tokens — identiques. 2,00 $ en entrée / 10,00 $ en sortie pour les deux. Les lectures du cache sont la seule différence : 0,10 $ sur Argon, 0,20 $ sur Sol.
• Coût par tâche d'indexation — Gemini 4 Argon 1,99 $ contre GPT-6 Sol 1,05 $. Argon coûte environ deux fois plus cher par tâche, malgré un coût par token identique.
• Coût d'exécution de la suite complète — 2 407 $ pour Gemini 4 Argon contre 1 546 $ pour GPT-6 Sol.
• Vitesse de sortie mesurée — GPT-6 Sol 77,0 jetons par seconde contre Gemini 4 Argon 48,9, une différence de 1,6× qui se manifeste tant en latence qu'en coût.
Il y a une ligne dans cette liste qui explique toutes les autres, et ce n’est pas le prix. C’est le nombre de tokens. Sur les tâches propres à l’indice, Gemini 4 Argon a généré environ 561 000 tokens de sortie par tâche ; GPT-6 Sol en a généré environ 282 000. Argon réfléchit deux fois plus longtemps pour répondre à la même question, et à un tarif par token identique, c’est exactement deux fois la facture.

Pourquoi les tokens sont le prix
C’est la correction qu’il vaut la peine d’assimiler avant que quiconque ne budgétise une migration, car l’intuition va dans le mauvais sens. Quand un modèle est facturé au même prix que son concurrent et consomme deux fois plus de tokens de sortie pour terminer, le prix par token n’est pas le prix. Le prix, c’est le prix par token multiplié par le nombre de tokens que le modèle décide de dépenser, et ce second facteur est une propriété du modèle, pas de la grille tarifaire.
La marge par tâche varie énormément, ce qui aggrave les choses — vous ne pouvez pas appliquer un multiplicateur uniforme et passer à autre chose :
• Terminal-Bench 4.0 — Argon : 165 330 tokens de sortie par tâche, contre 97 372 pour Sol. Argon coûte ici 6,78 $ par tâche, contre 4,00 $ pour Sol, même si Argon obtient un score de 57,1 % contre 43,9 % pour Sol.
• CritPt — Argon 109 533 jetons contre les 31 848 de Sol. Un ratio de jetons de 3,4× sur une tâche où Sol obtient en réalité un score supérieur, 30,9 % contre 27,1 %.
• GDPval — Argon 74 571 tokens contre les 41 567 de Sol, pour 1,82 $ par tâche contre 1,32 $.
• Omniscience — un ratio de 938 contre 2 662 jetons en faveur d'Argon, à 0,010 $ la tâche contre 0,027 $ pour Sol. La seule famille de tâches où la direction s'inverse.
• Raisonnement à long contexte — Argon : 2 197 jetons contre 954 pour Sol, et la seule tâche de la suite où Sol l’emporte clairement au score, 83,7 % contre 79,7 %.
CritPt est le cas instructif. Un modèle qui brûle trois fois et demie plus de tokens pour produire une réponse légèrement moins bonne à la même question ne relève pas d'une histoire de capacités ; c'est une histoire d'habitudes de dépense. Le raisonnement d'Argon est long, et sur certaines formes de tâches, cette longueur se convertit en score, tandis que sur d'autres, elle se convertit simplement en dollars. Le 52,6 de l'indice et le 47,5 de Sol sont l'agrégat, et les agrégats masquent exactement cela.
D'où viennent réellement les cinq points
Étant donné que l’écart d’indice et l’écart de coût vont dans des directions opposées, il est utile de savoir quelles tâches sont à l’origine de chacun.
• Terminal-Bench 4.0 — Gemini 4 Argon 57,1 % contre GPT-6 Sol 43,9 %. La plus grande victoire unique d’Argon, et la famille de tâches la plus proche du codage agentique à long horizon.
• Omniscience — Gemini 4 Argon 42,4 contre GPT-6 Sol 27,1. Un écart de quinze points sur la couverture factuelle, le plus grand écart proportionnel de la suite.
• AutomationBench-AA — Gemini 4 Argon 77,5 % contre GPT-6 Sol 61,6 %.
• SciCode — Gemini 4 Argon 61,8 % contre GPT-6 Sol 57,6 %.
• Humanity's Last Exam — Gemini 4 Argon 57,1 % contre GPT-6 Sol 47,9 %
• GDPval — Gemini 4 Argon 1 611 contre GPT-6 Sol 1 487.
• ApexAgents / AA-Briefcase — GPT-6 Sol 1 482,78 Elo contre les 1 493,84 d'Argon, un écart de 11 points qui se situe à l'intérieur des intervalles de confiance publiés et devrait être qualifié d'égalité.
• Raisonnement à long contexte — GPT-6 Sol 83,7 % face à Gemini 4 Argon 79,7 %. La seule victoire nette de Sol.
• CritPt — GPT-6 Sol 30,9 % contre Gemini 4 Argon 27,1 %. Sol gagne encore, de justesse.
Donc, le constat n’est pas « Argon est meilleur ». C’est qu’Argon est meilleur sur les deux points que ses supports de lancement ont mis en avant — l’exécution de tâches métier de bout en bout et l’ingénierie logicielle à long horizon — et que Sol est au même niveau, voire en avance, sur l’échelle de raisonnement à consonance académique et sur la capacité à maintenir la cohérence sur un contexte long. Pour un lecteur dont la charge de travail est un pipeline de récupération avec une invite de 400 K jetons, Sol est à la fois le meilleur modèle et le moins cher, ce qui est une position inhabituelle et confortable.
Les différences de spécifications qui survivent à la discussion sur le benchmark
• Sortie maximale — Gemini 4 Argon 1 000 000 de tokens en une seule trajectoire, que Google décrit comme la plus grande du secteur et comme une augmentation par rapport au plafond de 64 K de la génération précédente. GPT-6 Sol 128 000 tokens.
• Fenêtre de contexte — la fiche fournisseur de GPT-6 Sol indique environ 1 050 000 jetons ; celle d’Argon est de 1 000 000. Artificial Analysis a mesuré Sol à 872 000 jetons via son harnais, ce qui est une mesure du harnais et non un chiffre de fiche — considérez la fiche comme la spécification et le chiffre du harnais comme ce que l’évaluateur a réellement exercé.
• Modalités d'entrée — les deux acceptent du texte, des images et des fichiers. Le matériel de lancement d'Argon s'appuie également sur la compréhension de longues vidéos, où Google revendique 91,7 % sur LVBench et la décrit comme l'état de l'art ; il s'agit d'un chiffre rapporté par le fournisseur, et aucun classement indépendant ne le reproduit encore.
• Entrée vidéo — Faible. Artificial Analysis classe Argon avec l’entrée vidéo désactivée et mentionne explicitement la vidéo au lancement, tandis que la fiche de Sol ne répertorie pas du tout la vidéo. Si la vidéo est essentielle dans votre pipeline, aucune des deux fiches ne permet de trancher, et vous devriez tester avant de concevoir votre architecture.
• Effort de raisonnement — Sol expose un effort configurable (de none à max, medium par défaut) au niveau de l'API et a été mesuré à max. Argon a été mesuré à high ; personne n'a publié la même suite de tests à son réglage le plus élevé.
Le plafond de sortie de 1 M de tokens est celui qui pourrait véritablement changer une architecture plutôt qu’un budget. Tout ce que vous découpez actuellement en une douzaine d’appels enchaînés pour rester sous un plafond de 128 K — un ensemble de correctifs multi-fichiers, un rapport d’audit complet, un long document en une seule passe — devient un seul appel, avec moins d’endroits où une boucle d’agent peut perdre son état. La question de savoir si cela vaut le double du coût par tâche dépend entièrement de si vous avez cette charge de travail. Si c’est le cas, cela vaut probablement le coup. Si vos appels consistent à classifier et à renvoyer, c’est de l’argent dépensé pour une réserve que personne n’occupera.
Le réglage d'effort que personne n'a égalé, et pourquoi c'est important
Une mise en garde mérite son propre paragraphe, car elle va à l'encontre de l'interprétation de l'écart de cinq points dans l'indice comme une pure différence de capacités. Artificial Analysis positionne Gemini 4 Argon au réglage élevé d'effort de raisonnement et GPT-6 Sol à max. Ce ne sont pas les mêmes échelons sur les deux échelles, et le sens du décalage est intéressant : Sol a été exécuté à son réglage le plus coûteux et Argon à un réglage intermédiaire.
Deux lectures s'ensuivent et les données ne permettent pas de les départager. Soit Argon à max obtiendrait un score supérieur à 52,6 — mais consommerait aussi plus de 561 000 tokens par tâche et coûterait plus de 1,99 $ — soit il obtiendrait à peu près le même score, ce qui signifierait que le réglage d'effort n'a pas beaucoup d'incidence sur cette suite. Aucune exécution publiée ne permet de trancher. Quiconque cite 52,6 comme le plafond d'Argon cite une configuration, pas un modèle, et cette configuration est celle que son fournisseur a choisi de publier en premier.
La même logique s'applique au 47,5 de Sol, mais dans la direction opposée : max est au sommet de son échelle, donc le chiffre est plus proche d'un plafond que d'un plancher. Une confrontation équitable à effort égal pourrait réduire l'écart, et pourrait aussi inverser la comparaison des coûts, puisque les tokens que max consomme sont les tokens qui coûtent 10 $ par million.
L’embranchement de disponibilité, qui détermine la réponse réelle
Gemini 4 Argon n'est pas disponible de manière générale. L'annonce de Google indique qu'il est déployé auprès d'un ensemble de cyberdéfenseurs de confiance dans le cadre du Fairwind Program, que l'entreprise participe au processus volontaire d'accès aux modèles avant leur publication du gouvernement américain, et que l'accès général pour les développeurs, les entreprises et les consommateurs viendra « dès que possible », en commençant par les clients payants de l'API et les abonnés à Google AI Ultra. Il n'y a ni identifiant de modèle, ni point de terminaison, ni quota, ni date. Il n'est sur aucune API publique, y compris la nôtre — consultez le catalogue et cela renvoie une 404, car il n'y existe pas encore.
GPT-6 Sol est un produit appelable. Sur OrcaRouter, c'est openai/gpt-6-sol, sur le même endpoint compatible OpenAI que les autres plus de 200 modèles du catalogue, au prix catalogue d'OpenAI répercuté avec aucune marge, de sorte que les 2 $/10 $ ci-dessus et le palier de contexte long de 272 000 tokens à 4 $/15 $ correspondent à ce que vous payez réellement, et non à ce qu'annonce une grille tarifaire. Le basculement automatique entre fournisseurs couvre le cas où la route se dégrade en cours d'exécution, et le DSL de routage permet à une seule application d'envoyer son trafic de classification peu coûteux vers un modèle plus petit et son trafic de raisonnement difficile vers Sol sans un second SDK.

Cette dernière configuration est la réponse honnête à cette comparaison pour la plupart des équipes. L’argument de coût en faveur d’Argon est réel, mais conditionné à une charge de travail où le travail d’agent à long horizon domine ; l’argument de coût contre lui est réel sur toutes les autres charges de travail ; et de toute façon, vous ne pouvez pas l’acheter ce mois-ci. La solution économique consiste à construire dès maintenant le banc d’évaluation — vos propres prompts, votre propre notation, à exécuter contre Sol avec quelques réglages d’effort — afin que, lorsque Argon atteindra les clients payants de l’API, vous ayez une réponse mesurée à une question à laquelle tous les autres répondront à partir d’un classement.
Qu'est-ce qui le réglerait
Trois choses, par ordre d'impact sur le verdict. La disponibilité générale d'Argon à un vrai prix, non introductif — le mot « introductif » signifie que les 2 $/10 $ peuvent évoluer, et la séquence de Google elle-même place les clients payants de l'API en premier, donc le premier tarif publié après le lancement est celui à surveiller. Une évaluation Artificial Analysis publiée d'Argon à son réglage d'effort maximal, qui indiquerait si 52,6 est un plafond ou à un cheveu de l'être. Et une reproduction indépendante du chiffre de DeepSWE v1.1 — Google revendique 77,9 % et le qualifie de nouvel état de l'art ; il est déclaré par le fournisseur et non reproduit en dehors de Google à ce jour.
D'ici là, la séparation est nette et légèrement ironique. GPT-6 Sol est le modèle le mieux vérifié, le plus rapide, le moins cher par tâche terminée, et celui que vous pouvez appeler cet après-midi. Gemini 4 Argon est le modèle qui obtient le meilleur score sur le tableau que son fournisseur a choisi de publier, environ deux fois plus cher à utiliser réellement, et pas encore en vente. Choisir entre les deux n'est pas un jugement sur la capacité. C'est un jugement sur laquelle de ces deux phrases décrit votre mois.

Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
