Carte de titre principale affichant « Gemini 4 Argon — à quel échelon de l'échelle Gemini 4 ? », avec une échelle verticale de cinq échelons classés listant Claude Opus 5.5 à 57,6, Gemini 4 Argon à 52,6, GPT-6 Astra à 52,7, Gemini 3.8 Flash à 40,9 et Gemini 3.1 Pro Preview à 29,7, un badge affichant « Pas de Gemini 4 Ultra — la page Ultra redirige vers une formule d'abonnement », et une ligne de pied de page affichant « Chiffres de l'indice selon Artificial Analysis, révision v4.3.2 ; Argon non appelable sur aucune API publique. »
Guides & Insights

L’échelon du Gemini 4 Argon dans l’échelle Gemini 4 — et pourquoi il n’y a pas de G4 Ultra

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

La réponse courte à la question qui est à l’origine de cet article est que Gemini 4 Argon est le modèle le plus haut de gamme de Google, et non son niveau de gamme le plus élevé, parce que le niveau au-dessus n’existe pas encore — et peut-être pas sous la forme que quiconque attend. Google n’a publié qu’un seul modèle Gemini 4, Argon, et la seule page propriétaire sur son propre domaine sous le chemin /models/gemini/ultra/ n’est pas du tout une page de modèle : elle redirige vers les formules d’abonnement à Google AI. Cette redirection est le fait le plus utile de cet article, et elle se vérifie en une seule ligne depuis un terminal. Tout le reste ici porte sur la place qu’occupe réellement Argon dès lors qu’on cesse de lire son prix comme une étiquette de gamme pour commencer à le lire comme un nombre.

Deux choses sont vraies en même temps, et il est facile de les confondre. Argon est le Gemini le plus capable qui existe, et Argon n’est pas un modèle de niveau frontière. Il devance tous les modèles Google commercialisés à ce jour, avec une marge suffisamment large pour que la comparaison n’en soit pas vraiment une, et il se classe sur l’Intelligence Index d’Artificial Analysis à une fraction de point de deux modèles phares concurrents qui accusent eux-mêmes cinq points pleins de retard sur le leader actuel. Google lui a fixé un prix comme s’il se situait un cran en dessous de la frontière, et la mesure indépendante le confirme. Le prix n’est donc pas une décision marketing qui sous-estime le modèle. C’est un constat exact sur le modèle.

Il s'agit d'un article récapitulant ce que nous savons à ce jour. Gemini 4 Argon a été annoncé le 30/09/2026 dans un billet de Google DeepMind attribué à Koray Kavukcuoglu, et il est d'abord déployé auprès d'une cohorte nommée de cyberdéfenseurs via le Fairwind Program de Google — pas auprès des développeurs, ni des entreprises, ni des consommateurs, ni de quiconque possède une carte de crédit. Il n'a pas d'ID de modèle dans l'API Gemini, pas de point de terminaison, et aucun prix publié par token sur lequel vous pouvez être facturé. Les identifiants de modèle, le débit et la fiabilité mesurés sur du trafic réel n'existent pas pour lui, ce qui signifie que la mesure ci-dessous est l'exécution d'un benchmark par un seul laboratoire, et rien de plus. Lorsqu'un chiffre provient de Google, il est étiqueté comme étant celui de Google ; lorsqu'il provient d'Artificial Analysis, il est étiqueté comme étant le leur. Rien ici ne doit être interprété comme une affirmation selon laquelle Argon est un produit achetable.

L'échelle que Google a réellement déployée, relevée dans ses propres pages

La façon la plus rapide de répondre à « où se situe Argon dans la gamme Gemini 4 » est d’arrêter de poser des questions sur la gamme et de commencer à répertorier les modèles pour lesquels Google publie des pages. Une gamme est un concept marketing ; une page est un fait. Voici à quoi correspondent les chemins first-party au 1er octobre 2026.

• deepmind.google/models/gemini/pro/ renvoie 200 et son titre est « Gemini 3.1 Pro — Google DeepMind ». L'emplacement Pro sur le site de Google lui-même est encore un modèle de la génération 3.1.

• deepmind.google/models/gemini/flash/ renvoie 200 et son titre est « Gemini 3.8 Flash — Google DeepMind ». L'emplacement Flash a changé trois fois — 3.5, 3.6, 3.7, 3.8 — tandis que l'emplacement Pro n'a pas changé du tout.

• deepmind.google/models/gemini/argon/ renvoie une erreur 404. Argon ne dispose pas d’un chemin qui lui soit propre. Sa page d’accueil est la page de la famille à l’adresse deepmind.google/models/gemini/, où Google place le modèle qu’il met actuellement en avant.

• deepmind.google/models/gemini/ultra/ renvoie un code 302 et aboutit sur one.google.com/about/google-ai-plans/, la page d’abonnement grand public. Il en va de même pour l’ancien chemin deepmind.google/technologies/gemini/ultra/. Un « Ultra » sur le chemin des modèles de Google est un palier de facturation, et non un point de contrôle.

• deepmind.google/models/gemini/nano/ renvoie une redirection 301 vers la page de la famille Gemini. Il n'existe pas non plus d'emplacement Nano en tant que page de modèle autonome.

• deepmind.google/models/gemini/model-cards/ — l'index que Google tient de toutes les fiches de modèle qu'il a publiées — ne contient aucune entrée pour Argon et aucune entrée comportant « Gemini 4 » dans son nom. Ses lignes Gemini les plus récentes sont 3.8 Flash, 3.8 Audio, 3.7 Flash, 3.6 Flash, 3.5 Flash, 3.5 Flash-Lite et 3.1 Pro. L'index des fiches est le document qui évolue le plus lentement de cet ensemble, donc son silence ne prouve pas qu'Argon n'aura jamais de fiche ; il prouve que la paperasse n'a pas rattrapé l'annonce.

• deepmind.google/models/, l’index des modèles, répertorie « Gemini 4 Argon » comme carte phare avec le slogan « Notre nouvelle ère d’intelligence de pointe », juste au-dessus de « Gemini 3.8 Flash — Idéal pour s’attaquer à des tâches agentiques complexes à grande échelle ». Deux cartes Gemini, à une génération d’écart, dans cet ordre.

Si l'on assemble tout cela, la forme de l'échelle n'est pas ambiguë. La surface publique des modèles de Google comporte actuellement une entrée au barreau Gemini 4, une entrée au barreau Gemini 3.8, un barreau Pro obsolète en retard de trois générations et demie, et rien au-dessus de tout cela. Le mot « Ultra » sur le domaine de Google renvoie à un abonnement. Il n'existe pas de page Gemini 4 Pro, ni de page Gemini 4 Flash, ni de page Gemini 4 Ultra, ni de fiche de modèle Gemini 4. Google a annoncé un modèle, pas une famille.

Existe-t-il un Gemini 4 Ultra ? Les preuves, et ce qui le falsifierait

Cela mérite sa propre section, car c’est la partie de la question la plus susceptible de recevoir une réponse différente dans une semaine, et parce que la réponse honnête a une durée de validité limitée.

Les preuves négatives sont précises plutôt que vagues. Un 302 sur le chemin Ultra vers la page des forfaits d'abonnement n'est pas un signal faible ; c'est une redirection que l'équipe web de Google elle-même a configurée. Plusieurs schémas d'URL blog.google pour un billet sur Gemini 4 Ultra renvoient un 404 — le chemin products, le chemin innovation-and-ai models-and-research, et le simple chemin d'annonce. L'appellation Ultra a ici un précédent, et ce précédent joue contre un Gemini 4 Ultra. L'annonce originale de Gemini par Google présentait Gemini 1.0 « optimisé pour trois tailles différentes : Ultra, Pro et Nano », Gemini Ultra étant décrit comme « notre modèle le plus grand et le plus performant ». Un billet de lancement qui nomme trois tailles, voilà à quoi ressemble l'annonce d'une famille. Le billet d'Argon ne nomme qu'un seul modèle et aucun autre membre de la famille. Google a ensuite retiré le nom de modèle Ultra au profit de niveaux numériques et a déplacé le mot vers le versant abonnement de l'activité, où il désigne désormais l'offre grand public la plus élevée. Une page de modèle qui redirige vers une page de forfaits, voilà à quoi ressemble un nom de modèle retiré lorsque le site marketing a été nettoyé autour de lui.

L’annonce ne contient non plus rien qui promette un grand frère. Le billet de lancement d’Argon décrit Argon comme « notre nouveau modèle de frontière » et décrit le déploiement progressif, le travail sur les garde-fous et les déploiements internes, puis s’arrête. Il ne dit pas « premier de la famille Gemini 4 », il ne donne pas d’aperçu d’un Pro ou d’un Ultra, et il ne nomme aucun successeur. La propre présentation de Google traite Argon comme l’essentiel, et non comme le petit.

Ce qui falsifierait la conclusion est facile à énoncer et mérite d’être surveillé, car n’importe lequel de ces éléments la ferait basculer en une journée.

• Un 200 sur deepmind.google/models/gemini/ultra/ qui affiche une page de modèle plutôt que la page des offres, ou un nouveau chemin enfant sous models/gemini/ apparaissant aux côtés de pro et flash.

• Une ligne Gemini 4 Ultra apparaissant dans l'index des fiches de modèle, qui est la manière dont Google confirme historiquement l'existence d'un modèle en tant qu'artefact documenté.

• Un deuxième ID de modèle dans l'API Gemini, dans l'espace de noms gemini-4-*. Argon n'en a actuellement aucun, donc un ID Pro ou Ultra serait la première preuve que la famille est réelle.

• Une entrée dans la liste de modèles d’Artificial Analysis, ou un tableau de benchmarks sur la page de la famille avec une quatrième colonne. Ces deux sources suivent les sorties de Google d’assez près pour être en avance.

• Un billet d'annonce Google I/O, Cloud Next ou DeepMind employant le mot « family » à propos de Gemini 4. Le billet d'Argon ne le fait pas.

Jusqu’à ce qu’au moins l’un de ces événements se produise, un article qui affirme qu’un Gemini 4 Ultra arrive est une prédiction déguisée en reportage. Traitez-le comme tel, y compris lorsqu’il vient de nous.

A two-column comparison scoreboard titled "Gemini 4 Argon vs Gemini 3.8 Flash — the scoreboard", with the left column showing Gemini 4 Argon at AA Intelligence Index 52.6, 1M context window, $2 input per million tokens, $10 output per million tokens, $1.99 cost per Index task and 142,374 output tokens per Index task, and the right column showing Gemini 3.8 Flash at AA Intelligence Index 40.9, 1M context window, $0.75 input, $3.75 output, $1.24 cost per Index task and 154,230 output tokens per Index task, with a footer reading "Both columns' Index, price, context, cost-per-task and token-use figures per Artificial Analysis, v4.3.2 revision."

Lire l’échelle de prix comme une déclaration de palier

Le prix est la seule partie de tout cela que Google a publiée délibérément, avec une note de bas de page, et c’est l’énoncé le plus clair de l’intention en matière de paliers dans tout le lancement. Le prix d’introduction d’Argon est de 2 $ par million de tokens d’entrée et de 10 $ par million de tokens de sortie, avec l’entrée mise en cache à -95 %, et la note de bas de page n° 1 de Google elle-même indique qu’après une période d’introduction que Google n’a pas pu définir, « le prix de 4 $ par 1 M de tokens d’entrée et de 20 $ par 1 M de tokens de sortie s’appliquera ».

Comparez ces deux paires au reste du plateau et la revendication de niveau s'écrit d'elle-même.

• $4 / $20 est le prix catalogue de Claude Opus 5.5. Le tarif post-introduction de Google pour Argon s’aligne exactement sur la grille tarifaire du leader actuel à la frontière, pour un modèle qui obtient cinq points de moins que lui.

• $2 / $10 correspond au palier promotionnel qu’occupent à la fois GPT-6 Sol et Claude Sonnet 5.5. Le tarif d’introduction d’Argon est le même $2 / $10, ce qui place le prix de lancement d’Argon dans le même palier qu’un Sol de milieu de gamme plutôt que dans le palier de pointe.

• $10 / $50, c’est là que se situent à la fois Claude Fable 5.1 et GPT-6 Astra. Argon est à un cinquième du prix d’entrée de Fable 5.1 et à un cinquième de son prix de sortie, et son score est à 0,8 point de celui-ci.

• 0,75 $ / 3,75 $, c’est Gemini 3.8 Flash. Argon est à 2,7× ce prix en entrée et 2,7× en sortie — une nette progression, pas une falaise.

Ainsi, Google a tarifé Argon comme un modèle qui se situe sous les 10 $/50 $ et au-dessus des 0,75 $/3,75 $, avec un point de stabilisation à terme à 4 $/20 $. Rien dans cette échelle tarifaire ne dit « frontière ». Elle dit « haut de la gamme intermédiaire, avec un chiffre phare qui finira par s’établir au même tarif que celui pratiqué aujourd’hui par le leader, pour moins de capacités. » C’est un choix commercial défendable. Ce n’est pas la tarification d’un modèle positionné deux crans au-dessus de tout ce qui existe.

Un point structurel à retenir : le palier tarifaire d’Argon est un véritable palier, défini dans une note de bas de page et sans date. Les familles Sonnet 5.5 et GPT-6 font quelque chose de similaire avec des paliers de contexte long, et Sol passe à 4 $/15 $ au-delà de 272 K. Le palier d’Argon porte sur le temps, pas sur la longueur du contexte — le même tarif de 2 $/10 $ s’applique sur toute la fenêtre de 1 M, et seul le calendrier fait varier le tarif. C’est une configuration inhabituelle, et elle fait de toute comparaison de coûts avec Argon un exercice à deux colonnes : quelle période, et quelle utilisation.

Où se situe Argon face à ses concurrents, sur les chiffres qui existent

Artificial Analysis a réalisé une mesure de Gemini 4 Argon suffisamment rapidement pour qu'il s'agisse de la seule lecture indépendante disponible. Sur la révision en vigueur au 1er octobre — v4.3.2 — Argon obtient un score de 52,56 sur l'Intelligence Index, configuré avec un effort de raisonnement élevé. Les modèles qui l'entourent ne constituent pas un échantillon aléatoire du domaine.

• Claude Opus 5.5 se situe à 57,62, mesuré à effort maximal avec repli. Cela fait cinq points et des poussières au-dessus d'Argon, et c'est actuellement le sommet du classement.

• Claude Fable 5.1 se situe à 53,35, mesuré à effort maximal avec repli. Argon est à 0,79 derrière lui.

• GPT-6 Astra se situe à 52,67, mesuré au maximum. Argon est 0,11 derrière lui.

• Claude Sonnet 5.5 se situe à 55,98, également au maximum avec le fallback. C’est un modèle de milieu de gamme qui devance Argon de 3,4 points, et c’est le chiffre qui devrait inquiéter quiconque cherche à affirmer que « Gemini 4 Argon est le deuxième meilleur modèle du monde ».

• GPT-6 Sol se situe à 47,63, mesuré au maximum, sur une fenêtre de contexte de 872 K. Argon est 4,9 devant lui.

• Gemini 3.8 Flash se situe à 40,93 avec un effort élevé. Argon le devance de 11,6.

• Gemini 3.1 Pro Preview se situe à 29,72. Argon le devance de 22,8, ce qui est le constat le plus clair de l’ampleur du retard pris par la gamme Pro que Google déploie sur sa propre recherche.

Trois choses ressortent de cette liste. Premièrement, Argon est au niveau des deux challengers, Fable 5.1 et Astra, et clairement derrière deux modèles Anthropic — Opus 5.5 et, plus gênant, Sonnet 5.5. Deuxièmement, l’écart entre Argon et le meilleur modèle livré de Google lui-même est, de loin, le plus grand saut générationnel de la gamme actuelle. Troisièmement, la formulation du signal selon laquelle « la frontière est au moins à deux échelons d’avance » est juste sur le fond mais légèrement à côté en termes de géométrie : il y a un échelon de modèle clairement devant Argon (Opus 5.5 à 57,6) et un second modèle dans un échelon moins cher qui est aussi devant lui (Sonnet 5.5 à 56,0), ce qui est un problème plus aigu que d’être deux barreaux en dessous d’une échelle sur laquelle Argon se trouve en réalité.

Le cadrage par comparaison des prix dans la question d’origine — « les prix suggèrent qu’il s’agit de leur équivalent de Sol/Sonnet » — s’avère à peu près juste concernant le prix de lancement, et faux concernant le prix final. Argon démarre au tarif de Sol et de Sonnet 5.5 et s’établit à celui d’Opus 5.5. Il est facturé comme un modèle de milieu de gamme qui entend devenir un modèle au prix de la frontière, sans pour autant se mesurer à l’un ou à l’autre.

Le coût par tâche est le domaine où Argon est le plus fort et où l'histoire des niveaux gagne une seconde dimension. Sur la tâche Index, Argon coûte 1,99 $ et émet 142 374 jetons de sortie. Opus 5.5 coûte 5,98 $ et émet 338 099. Sonnet 5.5 coûte 7,62 $ pour 599 849. Fable 5.1 coûte 7,63 $ pour 187 455. Astra coûte 3,26 $ pour 68 691. Gemini 3.8 Flash coûte 1,24 $ pour 154 230. Argon est le moyen le moins cher d'obtenir un score proche de la frontière, et il est moins cher que le modèle Flash qui le dépasse en score de moins d'un dollar par tâche.

Les réglages d’effort sont l’astérisque qui accompagne tout ce qui précède, et le domaine ne les rapporte pas uniformément. Argon est mesuré à high ; Opus 5.5, Fable 5.1 et Sonnet 5.5 à max avec fallback ; Astra et Sol à max. Une exécution à effort high et une exécution à effort max ne constituent pas la même mesure, et l’échelle d’effort propre à Anthropic déplace un modèle de plusieurs points entre les réglages. Si Argon, mesuré à effort max, obtient un score sensiblement supérieur à 52,6, l’argument du palier change. Personne n’a encore publié cette exécution.

Ce que le tableau de Google lui-même affirme, et en quoi il diffère de l’indépendant.

La page de la famille Gemini présente un tableau de performances rédigé par Google, avec quatre colonnes — Gemini 4 Argon, GPT-6 Astra, Claude Fable 5.1, Claude Opus 5.5 — et dix-neuf lignes de benchmarks. Il s’agit de l’ensemble de revendications le plus détaillé que Google ait publié pour ce modèle, et il est entièrement déclaré par le fournisseur. Le confronter à l’Index indépendant est instructif, précisément parce que les deux ne s’accordent pas sur la physionomie du secteur.

• Sur le tableau de Google, Argon remporte treize des dix-neuf lignes, soit seul, soit ex æquo à la première place, y compris Vals Index Knowledge work à 68,9, AutomationBench à 51,3, Harvey’s Legal Agent à 19,6, DeepSWE v1.1 à 77,9, LABBench 2 à 88,8, GraphWalks à 99,7 pour la bande ≤128K et à 84,2 pour la bande 256K–1M, Agent’s Last Exam à 39,5, LVBench à 91,7 et Chartography à 71,6.

• Claude Opus 5.5 remporte les lignes qui relèvent de l’ingénierie de longue haleine : FrontierSWE v2 à 62,3 contre 55,0 pour Argon, Terminal-bench 4.0 à 66,4 contre 57,4, Terminal-Bench Science 0.1 à 63,3 contre 57,6, et PostTrainBench à 49,3 contre 45,3.

• GPT-6 Astra obtient 68,1 à Terminal-Bench Science 0.1 et 72,6 sur le sous-ensemble hors ligne d’OSWorld-2.0, et égale Argon sur CWE-bench v1 avec 68,0. Claude Fable 5.1 perd sur toutes les lignes, sauf une égalité partagée sur Vibe Code Bench.

• Sur l’Index indépendant, le classement place Opus 5.5 en premier, puis Sonnet 5.5, puis Fable 5.1, puis Argon et Astra pratiquement à égalité. Le tableau de Google ne comporte aucune colonne Sonnet 5.5, ce qui en constitue l’omission la plus lourde de conséquences : les quatre colonnes du tableau sont choisies, et le modèle qui devance Argon sur l’Index à un prix inférieur n’en fait pas partie.

Rien de tout cela ne rend le tableau de Google malhonnête. Les tableaux de benchmarks des fournisseurs sont sélectionnés, et non échantillonnés, et il en va de même pour ceux de tous les laboratoires. Cela en fait une affirmation plutôt qu’une mesure, et cela signifie que la question des niveaux ne peut pas être tranchée à partir de ce tableau. Le seul endroit où le tableau est véritablement déterminant pour cet article, c’est le négatif : dix-neuf lignes, quatre colonnes, et aucune cinquième colonne pour un Ultra.

A screenshot of Google DeepMind's Gemini 4 Argon page scrolled to its Performance section, showing the Performance heading and the line “Frontier performance in complex workflows” above the vendor-reported benchmark table, whose four model columns are Gemini 4 Argon, GPT-6 Astra, Claude Fable 5.1 and Claude Opus 5.5, with rows running from Vals Index and AutomationBench down through FrontierSWE v2 and Terminal-bench 4.0 to GraphWalks and Agent's Last Exam.

La seule chose à propos d’Argon qui n’est pas du tout une question de palier

Chaque argument relatif au palier ci-dessus part du principe qu’Argon est un modèle que vous pourrez à terme appeler. Il vaut la peine de distinguer cela de la question du positionnement, car les deux appellent des réponses différentes et une seule concerne la capacité.

La limite de jetons de sortie d’Argon est de 1 million de jetons, contre 64 K auparavant, et Google l’affirme directement. Il s’agit d’un plafond de sortie, pas d’une fenêtre de contexte. La distinction compte parce que les deux sont constamment confondus dans la couverture de ce lancement, et parce qu’une limite de sortie de 1 M représente une affirmation d’ingénierie différente d’une fenêtre de contexte de 1 M — la première concerne la durée d’exécution d’une seule trajectoire, la seconde la quantité que l’on peut fournir au modèle en une fois. Google a été explicite au sujet de la limite de sortie et silencieux au sujet de la fenêtre de contexte. Artificial Analysis enregistre également 1 000 000 de jetons pour le contexte d’Argon, mais il s’agit du champ de ce traqueur et non d’une déclaration de Google ; considérez donc ces deux chiffres comme provenant de sources distinctes, même s’ils se lisent de la même manière.

Ce qui n’est pas disponible, sans ambiguïté aucune, c’est l’accès. Argon n’est pas en disponibilité générale, il ne figure dans l’API Gemini sous aucun identifiant, et il ne figure dans aucun catalogue tiers. Il est disponible pour les cyberdéfenseurs ayant fait l’objet d’une vérification via le Fairwind Program, ainsi que pour les ingénieurs de Google eux-mêmes, et l’étape suivante que Google désigne — « à commencer par les clients payants de l’API et les abonnés à Google AI Ultra » — n’a aucune date associée. Vous ne pouvez pas mesurer ses performances sur votre propre charge de travail. Chaque chiffre de cet article est donc la mesure, par quelqu’un d’autre, d’un modèle que vous ne pouvez pas utiliser.

Qu’est-ce qui ferait monter Argon d’un échelon ?

Un jugement de niveau est un instantané, et il y a environ cinq choses qui modifieraient celui-ci, à peu près par ordre d’importance.

• Une exécution à effort maximal mesurée indépendamment. Argon est actuellement une mesure à effort élevé à 52,56. Les propres échelles d’effort d’Anthropic déplacent un modèle de plusieurs points selon les réglages, et si le modèle de Google se comporte de façon similaire au maximum, la position réelle d’Argon face à Fable 5.1 et Astra est meilleure que ne le dit cet article. C’est le changement le plus probable.

• Une deuxième source de mesure. Un seul tracker équivaut à une seule mesure. Un deuxième laboratoire indépendant qui noterait Argon sur son propre harnais de test apporterait davantage à l'affirmation de niveau que n'importe quelle ligne de benchmark supplémentaire de Google.

• Un Gemini 4 Pro. Si Google ouvre l’échelon Pro de la génération 4 en dessous d’Argon, la gamme devient une famille avec une forme, la position d’Argon cesse d’être « la seule » et commence à être « le plus haut des trois », et chaque argument de cet article sur une famille manquante doit être réécrit. À surveiller, et plus proche que la question Ultra.

• Un prix qui ne monte pas par paliers. Si la période d’introduction n’expire tout simplement jamais — Google n’a pas défini quand elle se termine — le prix de croisière effectif d’Argon est de 2 $/10 $ plutôt que de 4 $/20 $, et son avantage en coût par tâche par rapport à Opus 5.5 passe d’environ 3× à environ 6×. Il s’agit d’un événement commercial, et non d’un événement de capacités, mais cela change ce à quoi ressemble une décision d’approvisionnement.

• Une fiche de modèle, une fiche système ou une page de méthodologie d’évaluation pour Argon. Le tableau des performances renvoie à une page de méthodologie sur le domaine de Google ; une fiche de modèle complète consignerait la fenêtre de contexte, la configuration de déploiement et l’enveloppe de sécurité, et serait le premier artefact permettant à quelqu’un d’extérieur à la cohorte Fairwind de vérifier les chiffres de Google plutôt que de les lire.

Inversement, ce qui ferait le plus probablement baisser Argon n’est pas du tout un benchmark. C’est l’article de Bloomberg du 30 septembre, qui citait des employés de Google ayant accès au modèle, selon lesquels il réussit moins bien sur des tâches réelles que ne le suggèrent ses scores. Cette affirmation n’a été vérifiée par personne en dehors de Google et ce n’est pas une mesure, mais c’est le genre d’affirmation qu’un second benchmark indépendant confirmerait ou invaliderait. En attendant, elle figure au dossier comme une allégation attribuée à un média nommé et à des sources anonymes, et elle a sa place dans la discussion sur les niveaux, car un modèle dont l’écart entre benchmark et terrain est contesté ne peut pas être promu sur les seuls benchmarks.

Ce que cela signifie si vous choisissez un modèle ce mois-ci

Si l'on fait abstraction de l'argument de positionnement, la réalité pratique est assez simple pour être résumée en un paragraphe. Gemini 4 Argon est le meilleur Gemini que Google ait construit, et il ne vous est pas accessible, donc les modèles Google entre lesquels vous pouvez réellement choisir aujourd'hui sont ceux qui sont sortis : Gemini 3.8 Flash, qui mesure 40,93 sur l'Index à 0,75 $/3,75 $, et Gemini 3.1 Pro Preview, qui mesure 29,72 à 2 $/12 $. Si vous avez besoin d'un Gemini tout de suite, c'est le vrai choix, et Argon n'en fait pas partie.

Si vous choisissez parmi différents fournisseurs plutôt qu’au sein de Google, rien dans l’annonce d’Argon ne modifie la décision d’aujourd’hui. En tête de l’Index se trouve Claude Opus 5.5 à 57,62, avec Claude Sonnet 5.5 à 55,98 juste derrière, à un cinquième du tarif en entrée et de moitié en sortie. Gemini 4 Argon, à 52,56, n’a aucune route vers votre application ; ce n’est donc pas un candidat, aussi bon que le score finisse par être.

A screenshot of Google's own Google AI plans page, showing the three consumer Google AI plans side by side — Google AI Plus at $4.99/mo with 400 GB storage, Google AI Pro at $19.99/mo with 5 TB storage, and Google AI Ultra from $99.99/mo starting at 20 TB of storage — each with a “View plan benefits” link, illustrating that “Ultra” on Google's domain names a subscription plan rather than a Gemini model.

OrcaRouter est une API unique en façade de plus de 200 modèles, avec les prix catalogue des fournisseurs répercutés sans aucune marge et un basculement automatique entre fournisseurs, ce qui signifie que la décision de changer de modèle n'exige aucune reconfiguration : l'id dans le corps de la requête est à lui seul tout le changement. Les modèles Google présents aujourd'hui dans notre catalogue sont ceux que Google a réellement commercialisés — google/gemini-3.8-flash, google/gemini-3.6-flash, google/gemini-3.5-flash et google/gemini-3.1-pro-preview. Gemini 4 Argon n'en fait pas partie et n'en fera pas partie tant qu'il n'aura pas d'identifiant de modèle public et de grille tarifaire publiée ; personne ne devrait donc lire une quelconque affirmation de routage dans ce qui précède. Quand Google mettra Argon sur une API avec un ID, cela deviendra une question de routage. D'ici là, la version honnête de la réponse d'OrcaRouter est que cela ne s'applique pas encore, et ce que le catalogue apporte d'utile pour cette décision précise, c'est de vous permettre de comparer les tarifs des modèles réellement appelables côte à côte sans ouvrir quatre comptes pour le savoir.

En résumé

Gemini 4 Argon est le produit phare de Google, et non son modèle de frontière. Il obtient 52,56 sur l’indice v4.3.2 d’Artificial Analysis à effort élevé — à égalité avec Claude Fable 5.1 et GPT-6 Astra, cinq points derrière Claude Opus 5.5, et derrière Claude Sonnet 5.5, un modèle moins cher d’un laboratoire concurrent. Google l’a affiché à 2 $/10 $ en tarif d’introduction, puis à 4 $/20 $, ce qui aligne exactement son tarif final sur celui de Claude Opus 5.5 pour une capacité mesurablement inférieure. Son avance de 11,6 points sur Gemini 3.8 Flash est l’écart générationnel le plus large au sein de la propre gamme de Google, et c’est la preuve la plus solide que la génération Gemini 4 constitue une véritable progression plutôt qu’un simple changement de badge.

Sur la question qui a déclenché tout cela : il n’existe pas de Gemini 4 Ultra. Le chemin Ultra de Google sur son propre domaine redirige vers une page de forfaits d’abonnement, l’index des fiches de modèles ne comporte aucune entrée Gemini 4 du tout, chaque motif d’URL d’annonce pour un article Gemini 4 Ultra renvoie une 404, et l’article de lancement annonce un modèle sans promettre une famille. C’est une véritable découverte, et il s’agit de preuves de première main plutôt que d’une déduction, mais c’est aussi un fait à la demi-vie courte — un seul 200 sur un chemin le renverse, et l’échelon Pro de la génération Gemini 4 est celui qui a le plus de chances d’apparaître en premier.

Deux mises en garde à retenir de cet article. Chaque chiffre d’Argon ici est la mesure par quelqu’un d’autre d’un modèle que personne en dehors d’une cohorte vérifiée de cyberdéfenseurs ne peut appeler, et le tableau à dix-neuf lignes de Google lui-même est une affirmation plutôt qu’une mesure — utile pour ce qu’il est, et non un substitut à l’Index indépendant. Et le verdict équitable sur la question des niveaux est provisoire : Argon est mesuré à effort élevé, pas maximal, et une exécution à effort maximal est la façon la moins coûteuse possible pour que cet article ait tort.

Comparés dans cet article4

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement