Carte de titre principale indiquant « Gemini 4 Argon — ce à quoi le nom est attaché », avec une seule carte mise en évidence pour Gemini 4 Argon et, en dessous, une liste des artefacts qui existent pour lui — billet d'annonce, page de la famille, tableau de benchmark du fournisseur, méthodologie des évaluations — à côté d'une liste barrée des artefacts qui n'existent pas, indiquant pas d'ID de modèle, pas de point de terminaison d'API, pas de fiche de modèle, pas de fenêtre de contexte publiée, pas de date de disponibilité générale, et une ligne de pied de page indiquant « Chiffres d'index selon Artificial Analysis, révision v4.3.2 ; Argon n'est appelable sur aucune API publique. »
Guides & Insights

Gemini 4 Argon : ce que Google a annoncé, et à quoi le nom est rattaché

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Gemini 4 Argon est le seul Gemini 4 qui existe. Cette phrase paraît anodine jusqu'à ce qu'on en chiffre le coût, et c'est précisément l'objet de cette page. Goog​le a annoncé Gemini 4 Argon le 30 septembre 2026, dans un article DeepMind attribué à Koray Kavukcuoglu ; c'est un véritable nom de modèle sur une véritable page propriétaire, il a été mesuré par Artificial Analysis à un Intelligence Index de 52,56 sur la révision v4.3.2, et il se situe à moins d'un demi-point de GPT-6 Astra à 52,67 et de Claude Fable 5.1 à 53,35 — tout en se trouvant cinq points sous Claude Opus 5.5 à 57,62 et Claude Sonnet 5.5 à 56,00, et à moins d'un point de GPT-6.1 Sol à 51,83. Ce qu'il n'a pas, c'est ce que chacun de ces rivaux possède : un identifiant de modèle que l'on peut mettre dans une requête.

Ainsi, la réponse honnête en une ligne à la question « qu’est-ce que Gemini 4 Argon » est qu’il s’agit d’un modèle que Google a annoncé et évalué via des benchmarks mais n’a pas encore rendu appelable, que ce nom est associé à un déploiement à accès restreint plutôt qu’à un produit, et que « Gemini 4 » à lui seul n’est associé à rien du tout. Les deux moitiés de cette phrase sont vérifiables depuis un terminal, et c’est pourquoi cette page les vérifie plutôt que de les affirmer.

Le nom est réel. Le produit ne l'est pas.

Commencez par ce que renvoie réellement une vérification d’entité. Au 8 octobre 2026, la page de famille de Google à l’adresse deepmind.google/models/gemini/ met en avant Gemini 4 Argon comme carte principale, sous le slogan « Our next era of frontier intelligence », avec un texte de présentation des capacités qui mentionne l’ingénierie logicielle, le travail de connaissance en entreprise dans les secteurs juridique et financier, et la cybersécurité défensive. La publication d’annonce existe au chemin blog.google/innovation-and-ai/models-and-research/gemini-models/. Il y a une page de famille de modèles. Il y a un tableau comparatif de dix-neuf lignes fourni par le vendeur. Il y a un PDF de méthodologie d’évaluations de cinq pages. C’est une trace documentaire substantielle, et c’est plus qu’une simple fuite n’en laisse.

Maintenant, énumérez ce qui lui manque, car la liste de ce qui manque est l’article.

• Un ID de modèle — la liste de modèles de l’API Gemini ne contient aucune occurrence de « argon » ni aucune occurrence de « gemini-4 ». Les identifiants les plus récents reconnus par la documentation de Google sont la famille 3.8.

• Un point de terminaison ou un tarif sur lequel vous pouvez être facturé — les 2 $ en entrée / 10 $ en sortie par million de jetons annoncés correspondent à un tarif d'introduction pour un déploiement qui n'a pas encore atteint les clients payants.

• Une fiche de modèle ou fiche système — l’index des fiches de modèle de DeepMind ne comporte aucune ligne Argon, et le chemin de la fiche de modèle de la famille renvoie une 404.

• Une fenêtre de contexte — Google a publié une limite de sortie d'un million de jetons, alors que le plafond précédent était de 64 K, et n'a pas publié la partie entrée de cette paire. Artificial Analysis relève 1 M pour le modèle qu'il a mesuré.

• Une date de disponibilité générale — l'annonce décrit un déploiement progressif, sans date pour aucune étape au-delà de la première.

• Un nombre de paramètres, que Google n'a publié pour aucun Gemini.

Le déploiement décrit par Google se déroule en trois étapes à la durée non précisée. Premièrement, une cohorte nommée de cyberdéfenseurs via le Fairwind Program. Deuxièmement, les clients payants de l’API et les abonnés à Google AI Ultra. Troisièmement, les développeurs, les entreprises et les consommateurs. Seule la première étape est active, au sens où un lecteur peut le vérifier, et Google n’associe aucune date aux étapes deux et trois. Ce n’est pas une note de bas de page. C’est la différence entre un modèle et un compte à rebours.

A screenshot of Google's Gemini 4 Argon announcement post, showing the headline and the byline for Koray Kavukcuoglu, SVP Google DeepMind and Chief AI Architect, above the intro pricing line of $2 per million input tokens and $10 per million output tokens with cached input at 95 percent off, and the line stating an output limit of 1 million tokens, up from the previous 64K ceiling.

Ce que prétend le tableau de Google lui-même, et qui l’a réellement mesuré.

La page de la famille de Google présente un tableau de benchmarks à quatre colonnes avec Gemini 4 Argon, GPT-6 Astra, Claude Fable 5.1 et Claude Opus 5.5. Il vaut la peine d’être lu, et il vaut la peine d’être lu en gardant la provenance à l’esprit, car Google divulgue cette provenance dans le PDF de méthodologie, et cette divulgation change la portée que le tableau peut avoir.

Les affirmations, présentées comme celles de Google : Argon arrive en tête sur Vals Index avec 68,9 contre les 67,0 d’Opus 5.5 et les 65,8 de Fable 5.1 ; sur AutomationBench avec 51,3 contre 42,5, 31,4 et 41,4 ; sur Vals Finance Agent v2 avec 65,4 ; sur Harvey’s Legal Agent Benchmark avec 19,6 contre 3,8, 6,7 et 5,4 — un écart d’un facteur quatre à cinq ; sur DeepSWE v1.1 avec 77,9 contre 74,2, 67,4 et 74,1 ; sur Vibe Code Bench avec 91,9, une marge de 1,6 point ; sur LABBench 2 avec 88,8 contre 73,1, 68,6 et 85,4 ; sur RiemannBench avec 76,0 ; sur les deux lignes de GraphWalks, 99,7 à ≤128k et 84,2 à 256k–1M ; sur Agent’s Last Exam avec 39,5 ; sur Terminal-Bench Science 0.1 avec 57,6 ; sur Chartography avec 71,6 ; et sur LVBench avec 91,7 comme étant l’état de l’art.

Et il perd, sur la page de Google elle-même : FrontierSWE v2 à 55,0 contre les 65,5 d’Astra et les 62,3 d’Opus 5.5 ; Terminal-bench 4.0 à 57,4 contre les 66,4 d’Opus 5.5 ; PostTrainBench à 45,3 contre les 49,3 d’Opus 5.5 ; et OSWorld-2.0 à 69,2 contre les 72,6 d’Astra. CWE-bench v1 est à égalité à 68,0 avec Astra.

La ligne de provenance importe plus que n'importe quelle ligne individuelle. La méthodologie de Google précise que les résultats sont en pass@1, en une seule tentative, avec les paramètres de réflexion les plus élevés et — point crucial — que les chiffres non-Gemini de ce tableau sont les chiffres auto-déclarés par les fournisseurs eux-mêmes, GPT-6 Astra, Claude Fable 5.1 et Claude Opus 5.5 étant relevés à leur niveau de réflexion maximal lorsque celui-ci est disponible. Un tableau de fournisseur dont les colonnes concurrentes reprennent les communiqués de presse des concurrents est un document utile, mais ce n'est pas une comparaison contrôlée. Chacune de ces lignes est rapportée par Google, et certaines reviennent à ce que Google rapporte ce qu'un autre a rapporté. Traitez donc les écarts, et pas seulement les valeurs, en conséquence.

Un modèle, trois indices, et pourquoi ils sont tous corrects

La position indépendante d’Argon est plus intéressante qu’un chiffre unique, car le chiffre varie selon l’endroit où on le lit, et ce mouvement n’est pas une erreur.

Artificial Analysis mesure Gemini 4 Argon (High) à 52,56 sur la révision v4.3.2 de son Intelligence Index. Le même indice place Claude Opus 5.5 à 57,62, Claude Sonnet 5.5 à 56,00, Claude Fable 5.1 à 53,35, GPT-6 Astra à 52,67, GPT-6.1 Sol à 51,83 et Gemini 3.8 Flash à 40,93. Dans l’ordre affiché du classement, la dizaine de modèles de tête se comprime en environ six points d’indice, et Argon se situe dans cette mêlée plutôt qu’en dessous.

Puis un lecteur voit un deuxième chiffre — 53 — dans l'affichage arrondi du classement, et un troisième s'il le compare à une autre configuration d'un modèle de la même famille, et en conclut que l'une des sources est erronée. Aucune ne l'est. Le 53 arrondi correspond à la même mesure que 52,56. Ce qui diffère d'une configuration à l'autre, c'est l'effort de réflexion : Artificial Analysis mesure chaque modèle à plusieurs niveaux d'effort, et un même modèle à un niveau d'effort supérieur peut afficher plusieurs points d'écart. C'est pourquoi le classement liste Opus 5.5 à quatre reprises distinctes, à 58, 56, 54 et 51. Argon n'apparaît qu'une fois, à effort élevé, car c'est la seule configuration que Google a mise à disposition pour la mesurer. Si Google propose un palier Argon en réflexion maximale, cette ligne évoluera, et la chose honnête à dire à son sujet aujourd'hui, c'est qu'elle n'a pas encore évolué.

Trois autres chiffres indépendants d’Argon valent la peine d’être retenus, tous issus d’Artificial Analysis et tous mesurés sur la (High) configuration. La vitesse de génération est de 60,69 tokens par seconde en médiane. Le temps jusqu’au premier token de réponse est de 2,92 secondes en médiane. Le coût par tâche de l’Intelligence Index — le score de l’index normalisé par rapport aux dépenses en tokens nécessaires pour l’obtenir — est de 1,99 $. C’est ce dernier chiffre qu’il faut retenir, car c’est là que la position d’Argon devient inconfortable : Opus 5.5 obtient cinq points de plus et coûte 5,98 $ par tâche de l’Index, donc Argon est trois fois moins cher par unité de capacité mesurée. Mais GPT-6.1 Sol obtient un demi-point de moins et coûte 0,72 $, soit environ un tiers du chiffre d’Argon. Argon n’est pas le choix au meilleur rapport qualité-prix dans sa propre tranche d’index. Il en occupe le milieu.

Il existe deux autres relevés indépendants qu’un lecteur attentif ne devrait pas confondre l’un avec l’autre. Artificial Analysis consigne la valeur d’Argon pour AutomationBench comme un score partiel de 0,7751 sur une échelle de 0 à 1, tandis que le tableau de Google indique 51,3 sur 100 dans le classement AutomationBench. Ce ne sont pas les mêmes mesures, et les mettre côte à côte est exactement le genre de comparaison qui produit un chiffre inventé. La même prudence s’applique aux regroupements liés au travail de la connaissance dans le tableau du fournisseur : « être en tête sur le travail de la connaissance » est le résumé que Google fait de son propre tableau.

Quelle page « Gemini 4 » recherchez-vous réellement ?

C’est la confusion que ce nom crée, et il vaut la peine de la clarifier en un seul endroit, car le blog a désormais écrit sur cinq choses différentes liées à « Gemini 4 », et ce ne sont pas des variantes d’un même article.

• Si vous voulez la date de sortie et le calendrier de déploiement — quand Argon a été annoncé, en quoi consiste le déploiement progressif, et ce que les classements d’arènes en ont fait — voilà l’article sur la date de sortie, celui qui couvre le calendrier et les relevés de Text Arena et Code Arena.

• Si vous voulez « Gemini 4 Argon est-il un niveau ou un modèle », et si un Gemini 4 Ultra existe — l’article sur le positionnement par niveau, qui déduit l’échelle des propres chemins de Google et explique pourquoi le chemin Ultra aboutit à une page d’abonnement.

• Si vous voulez la question du nom lui-même, l’argument selon lequel, entre « Gemini 4 » et « Gemini 4 Argon », exactement l’un est un modèle et l’autre un préfixe de génération sans identifiant de modèle, sans point de terminaison ni prix — voilà la confrontation directe des deux noms Google.

• Si vous voulez le résultat de troisième place de FrontierSWE v2 et l'observation d'autocritique qui l'accompagnait, c'est l'élément d'évaluation FrontierSWE.

• Si vous voulez Argon face à un rival spécifique sur les chiffres, il y a treize pages de comparaison sur le site couvrant la bande frontière, et elles sont l'endroit idéal pour une lecture à deux modèles.

Ce qu’aucun d’entre eux n’est, et ce que cette page est, c’est le pilier : le seul endroit qui dit ce qu’est l’entité, ce que chaque chiffre qui lui est associé signifie et ne signifie pas, et ce que vous pouvez réellement en faire aujourd’hui. La page connexe « Gemini 4 vs Gemini 4 Argon » développe déjà pleinement l’argumentaire de dénomination, et cette page ne le répétera pas. Tout ce qui suit est nouveau.

A screenshot of the Artificial Analysis page for Gemini 4 Argon, showing the model name and the line reading released September 2026, a proprietary reasoning model with a 1M token context window, and the statement that it is available via API through 1 provider — with the provider count identifiable in artificial analysis's own hosting panel rather than named in this description.

La pression qui ne nous a encore rien dit

Deux des signaux les plus forts de l’histoire d’Argon pointent vers la sortie imminente d’une version développeur, et aucun des deux ne prouve qu’une version développeur est sortie.

La première, c’est que les propres interfaces API de Google ont évolué sans Argon. L’entrée la plus récente du journal des modifications de l’API Gemini est le 6 octobre 2026 — Gemini Nano Banana 2.1 en disponibilité générale, sous l’identifiant gemini-nano-banana-2.1. Autrement dit, dans les huit jours qui ont suivi l’annonce d’Argon, Google a choisi une convention de nommage pour un modèle Gemini en production et livré un identifiant GA pour un autre modèle, et l’espace de noms gemini-4 est encore vide. Un modèle dont le déploiement est réel laisse une trace dans le journal des modifications. Celui-ci n’en a pas laissé.

Le second est le cadrage lié à la sécurité nationale. Google déclare qu’il est « activement engagé dans le processus volontaire du gouvernement américain pour l’accès aux modèles avant leur publication », et la première étape de déploiement est une cohorte nommée de cyberdéfenseurs. Cela est compatible avec une publication échelonnée dans laquelle le public des capacités de pointe obtient le modèle avant l’API publique, et c’est tout aussi compatible avec le fait que le modèle n’est simplement pas prêt pour le trafic général. Rien dans ce cadrage ne permet de savoir lequel. Quiconque affirme le contraire lit dans les feuilles de thé, et Google n’a pas fixé de date pour l’étape de l’API afin de trancher.

Ce que vous pouvez appeler aujourd’hui, et ce que vous ne pouvez pas

C'est la partie de la page qui devient obsolète le plus rapidement, elle porte donc sa date. En date du 8 octobre 2026, l'API du modèle OrcaRouter renvoie HTTP 404 pour google/gemini-4-argon. Il ne figure pas parmi nos routes. google/gemini-4 non plus, ni google/gemini-4-argon-high, ni google/gemini-4-pro — aucun de ces identifiants ne se résout, car aucun d'entre eux n'existe comme modèle appelable où que ce soit.

Qu’y a-t-il sur nos routes aujourd’hui, en provenance du même fournisseur, et combien chacune coûte au tarif catalogue du fournisseur :

• google/gemini-3.8-flash — publié le 2026-09-02, avec une fenêtre de contexte de 1 048 576 jetons et une sortie maximale de 65 536 jetons, à 0,75 $ en entrée et 3,75 $ en sortie par million de jetons. C’est le modèle auquel Argon sera à terme comparé par les personnes qui possèdent une carte de crédit, et c’est ce qui se rapproche le plus d’une charge de travail de type Argon que vous pouvez exécuter cet après-midi.

• google/gemini-3.6-flash — publié le 21/07/2026, à 0,75 $ et 3,75 $.

• google/gemini-3.5-flash — sorti le 23/05/2026, à 1,50 $ et 9,00 $.

• google/gemini-3.5-flash-lite — publié le 2026-07-21, à 0,30 $ et 2,50 $.

• google/gemini-3.1-flash-lite — à 0,25 $ et 1,50 $.

• google/gemini-3.1-pro-preview — sorti le 19 février 2026, à 2,00 $ et 12,00 $. C’est le seul Gemini du créneau Pro que vous pouvez appeler, et il a trois générations et demie de retard sur le dernier-né de la gamme Flash.

Tous ceux-là tournent sur la même clé que les modèles de pointe Claude et OpenAI dans la même plage d’indice — Claude Opus 5.5, Claude Sonnet 5.5, Claude Fable 5.1, GPT-6 Astra et GPT-6.1 Sol sont tous sur les mêmes routes — ce qui signifie que l’élément intéressant de la position d’Argon est testable sans Argon. Si vous voulez savoir ce que donnent environ 52 points d’indice de travail intellectuel pour un cinquième du prix, vous pouvez le mesurer aujourd’hui face à google/gemini-3.8-flash à 40,93, et si vous voulez le haut de la plage, vous pouvez mesurer Claude Opus 5.5 à 57,62 le même jour, dans le même compte, sans second contrat ni modification de code. C’est la forme concrète de tout l’article : une API pour plus de 200 modèles, 0 % de marge sur le prix catalogue du fournisseur répercuté, de sorte qu’une baisse de prix d’un fournisseur vous parvient le jour même où elle est appliquée, et basculement automatique entre fournisseurs pour le jour où un modèle dont vous dépendez cesse de répondre. Nous décrivons cela ici parce que c’est vrai du Gemini 3.8 Flash que vous pouvez appeler, et non parce que cela dit quoi que ce soit sur Argon. Argon n’en fait pas partie.

Si vous voulez Argon lui-même, vos options aujourd’hui sont la cohorte de cyber-défenseurs Fairwind et l’attente. L’API de Google ne le sert pas, et nous non plus, et aucune voie tierce ne peut servir un modèle qui n’a aucun identifiant auquel s’adresser.

Les questions en suspens, et exactement ce qui les résoudrait

Quatre points restent en suspens, et chacun a un déclencheur précis et vérifiable. L’intérêt est de garder cette liste courte — une page comme celle-ci n’est utile que tant qu’elle reste falsifiable.

• Argon obtient-il un identifiant d'API Gemini ? Surveillez la liste des modèles d'API pour tout identifiant dont le préfixe est gemini-4. Dès qu'un apparaît, la question du tarif devient concrète et le tarif de lancement de 2 $ / 10 $ devient un montant sur lequel vous pouvez être facturé plutôt qu'un chiffre dans un article de blog. Surveillez aussi si le tarif de lancement survit vraiment jusqu'à l'étape API, et s'il passe à 4 $ / 20 $ ou à un autre palier.

• La configuration mesurée change-t-elle ? Argon est mesuré à un seul niveau de réflexion et obtient un score de 52,56. Si Google expose une configuration à effort plus élevé, cette ligne change ; les pairs qu’il poursuit sont tous répertoriés avec deux à quatre niveaux d’effort, donc le fait qu’Argon ne soit répertorié qu’une fois relève de la disponibilité, et non du plafond du modèle.

• Les affirmations concernant le juridique et la finance résistent-elles à une exécution indépendante ?Harvey’s Legal Agent Benchmark à 19,6 contre 3,8 chez un concurrent, et Vals Finance Agent v2 à 65,4 en tête du classement, constituent les deux écarts relatifs les plus importants du tableau de Google. Ce sont aussi les deux lignes les plus susceptibles d’être réexécutées par une personne qui ne travaille pas chez Google. Un écart d’un facteur quatre à cinq sur un benchmark de domaine est soit la phrase la plus importante de l’annonce, soit une différence de harnais, et le moyen de le savoir est de guetter une deuxième exécution.

• Existe-t-il un modèle frère ? Le billet d'annonce d'Argon ne nomme aucune famille, ne donne aucun aperçu d'un Pro et aucun aperçu d'un Ultra. Un second gemini-4-* chemin, une seconde colonne ou une entrée de fiche modèle feraient chacun basculer cette interprétation en une journée. L'article sur le positionnement par palier énumère l'ensemble des falsificateurs.

En résumé

Gemini 4 Argon est un véritable modèle de frontière, avec un véritable tableau de benchmarks et un véritable score d’indice de 52,56 attribué par Artificial Analysis — et ce n’est pas un produit, au sens précis où il n’existe pour lui aucun identifiant de modèle, point de terminaison, fiche de modèle, fenêtre de contexte ni date de disponibilité générale, et tant la documentation propre à Google que les services de mesure tiers s’accordent à dire qu’exactement un fournisseur l’héberge. Le « Gemini 4 » dans son nom est un libellé de génération ; l’« Argon » est la partie à laquelle le modèle est rattaché. Si vous choisissez quelque chose sur lequel bâtir ce mois-ci, la décision ne concerne pas Argon : elle concerne Gemini 3.8 Flash que vous pouvez appeler dès aujourd’hui à 0,75 $ / 3,75 $ et les modèles de frontière de la même bande d’indice qui utilisent la même clé. Relisez cette page lorsqu’un gemini-4 apparaît comme identifiant dans la liste de l’API. D’ici là, tout ce qui concerne Argon est une affirmation que Google a faite à propos d’un modèle que personne en dehors de la première cohorte ne peut adresser.

A single-column comparison scoreboard titled "Gemini 4 Argon vs Gemini 3.8 Flash — the scoreboard", with the left column headed Gemini 4 Argon showing rows reading Artificial Analysis Index: 52.6, Context window: 1M (output limit 1M), Price: $2 in / $10 out intro, Cost per Index task: $1.99, Callable via API: No — gated rollout, and Supplier count: 1, and the right column headed Gemini 3.8 Flash showing the same six dimension labels with Artificial Analysis Index: 40.9, Context window: 1,048,576, Price: $0.75 in / $3.75 out, Cost per Index task: $1.24, Callable via API: Yes, and Supplier count: on our routes, with a footer line reading "Argon index, price and cost-per-task figures per Artificial Analysis, v4.3.2 revision; Argon availability verified 2026-10-08."

Comparés dans cet article3

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement