Carte de titre principale libellée Gemini 4 Argon sur FrontierSWE : Il crie Eurêka, puis note ses propres devoirs, avec une puce libellée FrontierSWE v2, moyenne de 55,0 % à 5, une puce libellée Troisième sur dix modèles, et une puce libellée 129 dollars 36 par essai, et une ligne de pied de page libellée chiffres FrontierSWE d'après le classement public de Proximal Labs, 2026-09-30.
Guides & Insights

Gemini 4 Argon sur FrontierSWE : il s'écrie « Eurêka ! », puis note ses propres devoirs

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Gemini 4 Argon a un problème de personnalité, et c'est la chose la plus intéressante que quiconque ait dite à propos du modèle depuis que Go​ogle l'a annoncé le 30 septembre 2026. Sur le benchmark FrontierSWE à horizon ultra-long, le modèle qui a terminé troisième — derrière GPT-6 Astra et Claude Opus 5.5 — a laissé à ses évaluateurs une impression mémorable : son mot préféré est « Eureka ! », et il passe une grande partie de son budget de tâche de vingt heures à être extrêmement dur envers lui-même. Il s'agit là d'une observation proche d'une fuite, à source unique, formulée par un opérateur de benchmark, et non d'une affirmation de fournisseur ni d'une note de version, et il vaut la peine d'être précis sur ce qu'elle vous dit et ne vous dit pas. Aucun des trois modèles ci-dessus n'a de date de disponibilité générale (GA) pour Argon qui lui soit associée ; l'observation porte sur le comportement à l'intérieur d'un harnais d'évaluation, et les chiffres qui l'accompagnent constituent la première mesure indépendante d'Argon sur un benchmark que Go​ogle n'exécute pas lui-même.

Ce qu’est réellement la remarque « Eurêka ! »

La source est un post de @nrehiew_, un ingénieur qui travaille sur l'évaluation de modèles, publié le 2026-09-30, citant l'annonce de Gemini 4 Argon de Sundar Pichai. Le fond est constitué de trois affirmations : Argon est le modèle le plus amusant qu'il ait évalué sur FrontierSWE ; son mot préféré est « Eureka ! » ; et il est extrêmement autocritique. L'auteur du post le décrit comme une grande amélioration par rapport aux Gemini précédents tout en préservant cette personnalité, et le qualifie d'impressionnant.

Lisez cela attentivement, car il est facile de surinterpréter. C’est l’impression d’un évaluateur après avoir observé des traces d’agents, pas un résultat noté, pas une métrique publiée, et pas quelque chose que Proximal Labs — qui construit et exploite FrontierSWE — a signé comme conclusion. Il n’y a pas de colonne « autocritique » dans le classement. Ce qui rend la remarque digne d’être écrite, ce n’est pas qu’elle fasse autorité ; c’est qu’il s’agit de la seule lecture qualitative que quiconque en dehors de Google ait proposée sur Argon, et comme le modèle n’est pas disponible pour le grand public, des traces comme celles-ci sont actuellement le seul moyen de voir la chose se comporter.

Cela débouche aussi sur une vraie question pour quiconque envisage de faire tourner Argon en tant qu'agent. Les exécutions de code à long horizon relèvent surtout d'un problème de gestion de budget : un modèle qui s'interrompt pour se remettre en question, qui évalue son propre travail intermédiaire et qui annonce ses percées est un modèle qui dépense des tokens en processus. Savoir s'il s'agit d'une force ou d'une charge dépend entièrement de la question de savoir si l'autocritique converge ou tourne en boucle. Un seul évaluateur qui dit « impressionnant » est un point de données, pas une réponse.

FrontierSWE v2, et pourquoi la troisième place est la véritable histoire

FrontierSWE n’est pas le genre de benchmark dont on peut tirer un chiffre phare. Il est développé par Proximal Labs et décrit dans leur dépôt comme un benchmark d’agents de codage à horizon ultra-long qui évalue l’implémentation, l’ingénierie de performance et la recherche en ML. La version 2 est sortie en septembre 2026 avec 21 nouvelles tâches en plus de l’ensemble initial, pour un total de 34, et il attend d’un agent qu’il continue à travailler jusqu’à vingt heures. Tout passe par le harnais propre à Proximal, proximus, qui est construit sur mini-swe-agent et ajoute la compaction du contexte, la vision et un outil de soumission explicite. La notation est mean@5 — la moyenne de cinq tentatives par tâche — avec la fourchette d’incertitude rapportée allant de la moyenne des pires exécutions de chaque tâche à la moyenne de ses meilleures exécutions.

Cette méthodologie est essentielle pour lire honnêtement la ligne d’Argon :

• Score — Gemini 4 Argon : moyenne@5 de 55,0 %, ±9,9, contre GPT-6 Astra 65,5 % et Claude Opus 5.5 62,3 %

• Étendue — les exécutions d'Argon s'échelonnent de 44,5 % (pire@5) à 64,3 % (meilleur@5), une plage qui chevauche les 52,0 %–71,5 % d'Opus 5.5 par le haut, mais pas du tout les 55,1 %–73,0 % d'Astra.

• Coût par essai — Argon 129,36 $, Opus 5.5 98,87 $, Astra 1 029,65 $

• Temps d’horloge par essai — Argon 10,6 heures, Opus 5.5 14,2 heures, Astra 12,1 heures

La première chose que l'on remarque, c'est qu'Argon est troisième et qu'il n'est pas proche du deuxième au score. La deuxième chose — celle qui devrait décider si cela vous importe —, c'est que sur ce benchmark Argon est strictement dominé par Claude Opus 5.5. Opus 5.5 a obtenu un score plus élevé (62,3 % contre 55,0 %) et a coûté moins cher par essai (98,87 $ contre 129,36 $). Il n'y a ici aucun axe sur lequel Argon l'emporte. Son seul avantage est le temps : 10,6 heures contre 14,2 pour Opus 5.5, ce qui est réel si vous payez au temps d'horloge et non aux tokens, et sans importance si vous payez selon un budget par essai.

Le propre classement de Proximal comporte une note de bas de page en regard de la ligne d’Argon, que tous ceux qui citent ce chiffre devraient reprendre : « Gemini 4 Argon : le taux de succès du cache est bien plus faible en raison d’un paramètre non-production. » C’est le fait que les évaluateurs signalent qu’ils ont exécuté Argon en dehors de la configuration qu’utiliserait un déploiement en production, ce qui gonfle son coût et, de manière plausible, sa latence. Il s’agit d’une mise en garde portant spécifiquement sur le chiffre de coût, et c’est la raison pour laquelle le montant de 129,36 $ doit être lu comme une borne supérieure plutôt que comme une grille tarifaire.

Le nombre que le propre graphique de Google ne montre pas

C'est ici que le sourcing devient vraiment intéressant, et que la plupart des comptes rendus de ce résultat se tromperont. Le billet d'annonce de Google inclut un graphique de benchmarks avec une ligne FrontierSWE v2. Cette ligne indique GPT-6 Astra 65,5 %, Claude Fable 5.1 56,3 %, Claude Opus 5.5 62,3 %. Gemini 4 Argon n'y figure pas. Le classement en direct de Proximal donne Astra à 65,5 % et Opus 5.5 à 62,3 % — les mêmes chiffres — mais place Claude Fable 5.1 à 56,5 %, et non 56,3 %, et liste Gemini 4 Argon à 55,0 %.

La raison de cette omission n’a rien de mystérieux, et Google le dit lui-même : les notes méthodologiques qui accompagnent sa suite d’évaluation précisent que les résultats FrontierSWE sont rapportés depuis le classement public officiel de Proximal. Google n’a pas calculé ce benchmark lui-même. Google cite le même tiers que nous, et le seul chiffre Argon que ce tiers publie est 55,0 %. Donc, l’interprétation honnête est que le score FrontierSWE d’Argon est une mesure véritablement indépendante — Proximal l’a exécuté, sur son propre harnais, sur ses propres tâches — et qu’il place Argon derrière deux concurrents.

Tout le reste dans le graphique de Google est déclaré par le fournisseur et devrait être étiqueté comme tel dans votre tête : Argon 63,1 % sur Vals Index contre 67,0 % pour Opus 5.5, 41,4 % AutomationBench contre 42,5 % pour Opus 5.5, 89,6 % Vibe Code Bench contre 90,3 % pour Astra comme pour Opus 5.5, 87,5 % LVBench contre 83,7 %, 68,0 % CWE-bench v1 contre 67,0 % pour Opus 5.5. Ce sont les exécutions de Google des évaluations choisies par Google. La ligne FrontierSWE est la seule de ce tableau qu'un lecteur peut vérifier de façon indépendante, ce qui explique précisément pourquoi la troisième place pèse davantage que la tendance à l'égalité ou à la légère victoire qui l'entoure.

Ce qu'Artificial Analysis dit, indépendamment

FrontierSWE est une optique. Artificial Analysis est l'autre, et elle concorde avec la forme du récit. Sur leur Intelligence Index v4.3.2, Gemini 4 Argon, dans sa configuration de raisonnement élevé, obtient 52,56 — mesuré indépendamment sur leur propre matériel, et non rapporté par Google — à un prix catalogue de 2,00 $ par million de jetons d'entrée et de 10,00 $ par million de jetons de sortie, avec une remise de 95 % sur les entrées mises en cache. Leur instrumentation établit le coût d'une seule tâche de l'indice à 1,99 $.

La comparaison qui compte est celle qu’a produite FrontierSWE. Claude Opus 5.5, dans sa configuration haute, obtient un score plus élevé sur l’indice, 53,58, pour un coût par tâche inférieur, 1,82 $. Deux évaluateurs indépendants, utilisant des tâches différentes et des harnais différents, placent Argon derrière Opus 5.5 tant sur la qualité que sur le coût. C’est un signal cohérent plutôt qu’un simple artefact de benchmarking, et c’est la chose la plus forte que l’on puisse actuellement dire sur l’économie de Gemini 4 Argon.

A two-column scoreboard comparing Gemini 4 Argon and Claude Opus 5.5 on six dimensions. Gemini 4 Argon reads: FrontierSWE v2 mean at 5 55.0 percent, FrontierSWE spread 44.5 to 64.3 percent, FrontierSWE cost per trial 129 dollars 36, FrontierSWE wall clock 10.6 hours, AA Intelligence Index 52.6, AA cost per index task 1 dollar 99. Claude Opus 5.5 reads: FrontierSWE v2 mean at 5 62.3 percent, FrontierSWE spread 52.0 to 71.5 percent, FrontierSWE cost per trial 98 dollars 87, FrontierSWE wall clock 14.2 hours, AA Intelligence Index 53.6, AA cost per index task 1 dollar 82. A footer line reads that FrontierSWE v2 figures are per Proximal Labs' public leaderboard as of 2026-09-30 with Argon's cost marked as a non-production cache setting, and that AA figures are per Artificial Analysis Intelligence Index v4.3.2.

Annoncé, non publié — et pourquoi cette formulation n’est pas de la pédanterie

Il n'existe pas d'identifiant de modèle Gemini 4 Argon. L'accès est déployé progressivement via le Fairwind Program auprès de cyberdéfenseurs vérifiés, en parallèle d'une ouverture par étapes aux clients payants de l'API et aux abonnés à Google AI Ultra, sans date de disponibilité générale publiée. La publication de Google est l'annonce d'un modèle et d'un ensemble d'évaluations, pas le lancement d'un endpoint que vous pouvez appeler. Si vous avez lu des articles qui présentaient cela comme une sortie, cette couverture est en avance sur les faits.

Cette distinction a des conséquences pratiques pour quiconque lit le chiffre FrontierSWE. L’évaluation a été réalisée sur un modèle auquel Proximal avait accès dans le cadre d’un certain arrangement ; elle indique ce que le modèle peut faire, pas ce dont vous pouvez disposer. Cela signifie aussi que les chiffres de performance ont une demi-vie plus courte que d’habitude. Un modèle qui n’est pas encore en GA peut encore changer — les paramètres de décodage, les prompts système, les valeurs par défaut d’utilisation des outils et les garde-fous de sécurité sont tous encore en cours de réglage, et la raison invoquée pour laquelle le taux de succès du cache d’Argon était faible est précisément que les évaluateurs n’exécutaient pas une configuration de production. Attendez-vous à ce que les 55,0 % et les 129,36 $ évoluent.

Ce qui changerait ce tableau : un identifiant de modèle publié avec une grille tarifaire, une date de disponibilité générale, une nouvelle exécution de FrontierSWE dans des conditions de production, et un second évaluateur indépendant reproduisant le résultat de la troisième place. Tant qu'au moins les deux premiers de ces éléments n'existent pas, considérez chaque chiffre d'Argon — y compris les bons dans le propre graphique de Google — comme provisoire.

A capture of the Google DeepMind blog post announcing Gemini 4 Argon, dated 2026-09-30, credited to Koray Kavukcuoglu, with a standfirst describing frontier performance in complex workflows, cyber defense and software engineering and a benchmark chart whose FrontierSWE v2 row lists GPT-6 Astra, Claude Fable 5.1 and Claude Opus 5.5 but omits Gemini 4 Argon.

La lecture de la personnalité est la partie qui vieillira le mieux.

Les scores de benchmark d'un modèle pré-GA ont une durée de conservation qui se compte en semaines. L'observation comportementale, elle, n'en a pas. C'est dans le travail agentique à long horizon que le caractère d'un modèle se manifeste réellement, car un budget de vingt heures avec 34 tâches laisse suffisamment de latitude pour que les tendances d'un modèle s'amplifient : comment il se remet d'une approche qui a échoué, s'il s'arrête pour replanifier, s'il sait faire la différence entre un problème difficile et une mauvaise direction. Un évaluateur qui regarde beaucoup de ces traces et décrit un modèle comme autocritique et enclin à s'exclamer quand quelque chose fonctionne décrit un modèle qui extériorise son raisonnement sur sa propre progression. C'est une hypothèse sur la raison pour laquelle les exécutions d'Argon s'étalent de 44,5 % à 64,3 % — une fourchette plus large que celle d'Opus 5.5 — et elle sera testable dès que le modèle sera appelable.

L'autre moitié de la remarque est celle qu'il faut considérer avec scepticisme. « Une nette amélioration par rapport aux précédents Gemini » est une comparaison avec des modèles qui n'ont jamais été évalués sur ce benchmark avec ce harnais, elle ne peut donc absolument pas être vérifiée par rapport au classement. C'est une impression, et elle doit être traitée comme telle, aussi crédible que soit la personne qui l'exprime.

A capture of the FrontierSWE public leaderboard showing ten models ranked by mean at 5. GPT-6 Astra leads at 65.5 percent, Claude Opus 5.5 second at 62.3 percent, Gemini 4 Argon third at 55.0 percent with a spread of 9.9, followed by GLM-5.3, Grok 4.7, Kimi K3, Qwen3.8-Max, DeepSeek V4 Flash Vision Exp, Muse Spark 1.2 and Inkling, with per-trial average cost and time columns and a footnote that Gemini 4 Argon's cache hit rate is much lower due to a non-production setting.

Ce que cela implique pour vous si vous avez réellement besoin d’un agent à long horizon aujourd’hui

Vous ne pouvez pas appeler Gemini 4 Argon, donc la question pratique n'est pas Argon contre quoi que ce soit — elle est de savoir quel modèle vous devriez exécuter pour le travail sur lequel Argon a été évalué. Le propre classement de FrontierSWE répond à cela : GPT-6 Astra domine le tableau avec 65,5 % mais à 1 029,65 $ par essai, soit environ dix fois le coût des deux modèles en dessous, tandis que Claude Opus 5.5 atteint 62,3 % pour 98,87 $. Le choix au meilleur rapport qualité-prix sur ce benchmark est Opus 5.5, et c'est aussi le modèle qui a battu Argon sur Artificial Analysis à un coût par tâche inférieur.

Ces deux modèles, ainsi que la plupart des dix premiers du classement — GLM-5.3, Grok 4.7, Kimi K3, Qwen3.8-Max, DeepSeek V4 Flash Vision Exp et Muse Spark 1.2 parmi eux — sont routables via l'API unique d'OrcaRouter aux côtés de plus de 200 autres — une seule clé, 0 % de majoration, donc le prix catalogue du fournisseur est ce que vous payez et une baisse de prix d'un fournisseur se répercute de notre côté le jour même. Cette dernière propriété vaut plus que d'habitude sur un modèle en pré-GA : si la tarification d'Argon change entre maintenant et la GA, ce que la note de bas de page sur le cache non-production laisse penser, rien dans votre intégration ne change le moment venu. Le basculement automatique est l'autre élément qui convient à ce cas précis — un modèle méconnu dont personne n'a encore cartographié les modes de défaillance est exactement ce que vous ne voulez pas sur un seul chemin de production codé en dur.

Pour être clair sur un point : Gemini 4 Argon ne figure pas dans notre catalogue. Une recherche dans notre API publique de modèles pour google/gemini-4-argon renvoie « modèle introuvable », et personne d’autre ne l’héberge non plus — il est réservé au programme Fairwind de Google, sans aucun ID de modèle publié. Lorsqu’il deviendra appelable, nous le routerons, et les chiffres FrontierSWE ci-dessus sont la raison de guetter ce jour plutôt que de l’attendre. Les modèles qui l’ont battu sont déjà là.

Que regarder

Les signaux qui feraient passer cela d'un « ce que nous savons jusqu'ici » à une décision sont précis. Un identifiant de modèle publié et sa grille tarifaire. Une date de disponibilité générale. Une réexécution de FrontierSWE dans des conditions de production, qui permettrait de déterminer si le coût de 129,36 $ par essai est un tarif réel ou un artefact de la configuration du cache signalée par Proximal. Et, idéalement, un second évaluateur publiant des traces d'Argon afin que l'observation « Eurêka ! » cesse d'être un échantillon unique.

D'ici là, le bilan honnête est limité et vaut la peine d'être conservé : Gemini 4 Argon est annoncé, il est inhabituellement expressif dans les traces d'agents à long horizon selon un évaluateur, et sur le seul benchmark indépendant que nous pouvons vérifier, il a terminé troisième derrière deux modèles — dont l'un l'a battu à la fois sur le score et sur le coût.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement