
Gemini 4 Argon vs Claude Opus 5.5 : le clivage des benchmarks que personne n’attendait
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 223 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Gemini 4 Argon et Claude Opus 5.5 ne sont pas d'accord sur qui est le meilleur, et ce désaccord n'est pas du bruit. Dans l'Intelligence Index d'Artificial Analysis, les deux sont séparés de cinq points en faveur d'Opus 5.5. Dans le Vals Index — le classement d'impact économique pondéré par le PIB — Gemini 4 Argon occupe la première place et Claude Opus 5.5 la troisième, derrière à la fois Argon et Claude Sonnet 5.5. Les deux classements ont mesuré les deux mêmes modèles la même semaine. Voilà tout l'article : lequel choisir dépend de si votre travail ressemble davantage à une question d'examen ou à un mardi dans un cabinet d'avocats, et de si vous disposez ne serait-ce que d'un accès API à Argon, ce que, à ce jour, presque personne n'a.
Google a annoncé Gemini 4 Argon le 30 septembre 2026 dans un article de DeepMind attribué à Koray Kavukcuoglu, vice-président senior pour Google DeepMind et architecte en chef de l’IA. Anthropic a publié Claude Opus 5.5 huit jours plus tôt, le 22 septembre 2026. L’une de ces versions est une version GA que vous pouvez appeler cet après-midi. L’autre est un déploiement progressif auprès d’une cohorte nommée de défenseurs cyber, ainsi que des ingénieurs de Google, avec l’intention déclarée d’atteindre « les clients payants de l’API et les abonnés à Google AI Ultra » dès que les garde-fous seront prêts, sans qu’aucune date n’y soit associée.
La réponse en une ligne, avant le détail
Si vous avez besoin aujourd'hui du meilleur raisonnement général mesuré et que vous en avez besoin sur une clé de production, Claude Opus 5.5 est disponible sur OrcaRouter dès maintenant, et Gemini 4 Argon n'est sur aucune API publique. Si vous développez des agents pour la finance, le juridique, la fiscalité ou le codage qui sont évalués sur leur rendement économique par dollar, les chiffres d'Argon sont meilleurs et son prix représente un cinquième de celui d'Opus 5.5 par tâche sur le seul tableau qui mesure exactement cela. Si vous travaillez dans la défense en cybersécurité pour les infrastructures critiques, Argon a un programme auquel vous pouvez postuler, et la réponse pourrait être oui.
D'où vient réellement chaque nombre
Deux tableaux d'indices, deux méthodologies, et il vaut mieux être précis sur ce qui correspond à quoi, car les deux camps vont se renvoyer des citations sans se répondre pendant des mois.
• Indice d'intelligence Artificial Analysis v4.3 — Claude Opus 5.5 à 57,6 et Gemini 4 Argon à 52,6, tous deux relevés sur Artificial Analysis le 2026-09-30. Il s'agit d'un composite de dix évaluations, délibérément généraliste en termes de tâches, et c'est le classement que la plupart des gens citent comme « le » classement.
• Vals Index, mis à jour le 2026-09-29 — Gemini 4 Argon premier à 68,90 % (±0,97), Claude Sonnet 5.5 deuxième à 67,04 % (±0,92), Claude Opus 5.5 troisième à 66,97 % (±0,89). Vals pondère les tâches de finance, de programmation, juridiques et fiscales selon la part de chaque secteur dans le PIB américain, de sorte qu’un modèle médiocre en casse-têtes mais excellent en révision de contrats et en travail sur tableur obtient ici un bon score.
Un écart de cinq points sur AA est réel et il n’est pas négligeable. Un écart de deux points sur Vals est lui aussi réel, et avec les intervalles de confiance affichés sur le classement, les 68,90 ±0,97 d’Argon face aux 66,97 ±0,89 d’Opus 5.5 représentent une séparation d’environ 1,5 erreur type — mieux qu’un pile ou face, sans être écrasant. Aucun des deux classements n’a tort. Ils mesurent des tâches différentes.

Une mise en garde sur la configuration, et elle va à l'encontre d'une lecture de l'écart AA comme une pure comparaison de modèles. Artificial Analysis positionne Gemini 4 Argon sur son réglage élevé d'effort et Claude Opus 5.5 sur « Adaptive Reasoning, Max Effort, Default Fallback ». Il ne s'agit pas du même point sur les deux échelles d'effort, donc le chiffre phare de 57,6 contre 52,6 n'est pas une comparaison à périmètre égal à budgets de raisonnement appariés. C'est le chiffre que les deux pages publient, et c'est le chiffre à citer si l'on veut être équitable envers Anthropic, mais ce n'est pas une expérience contrôlée.
Le coût par tâche, c’est là où l’écart devient inconfortable.
Artificial Analysis publie également un décompte de ce qu'il a coûté de faire tourner sa suite d'indices, et ici, les deux modèles ne sont pas proches.
• Coût par tâche d'indexation — Gemini 4 Argon 1,99 $ contre Claude Opus 5,5 5,98 $.
• Coût d'exécution de l'ensemble de la suite d'index — Gemini 4 Argon 2 407 $ contre Claude Opus 5.5 8 708 $.
• Prix catalogue par million de tokens — Gemini 4 Argon : 2 $ en entrée / 10 $ en sortie (tarif d'introduction annoncé par Google, avec l'entrée mise en cache à -95 %, soit 0,10 $) contre Claude Opus 5.5 : 4 $ en entrée / 20 $ en sortie.
• Débit — Gemini 4 Argon 48,9 jetons de sortie par seconde, premier jeton après 2,79 secondes ; Claude Opus 5.5 92,2 jetons de sortie par seconde, mais une latence du premier jeton de 702 secondes sur le même banc d'essai, ce qui est la taxe de la réflexion étendue qui s'affiche au grand jour.
• Coût par exécution de Vals — Gemini 4 Argon 15,68 $ contre Claude Opus 5.5 32,14 $ sur le même ensemble de tâches pondéré par le PIB.
Il y a un accroc qu'il vaut mieux signaler que de le minimiser : le classement de Vals indique les tarifs d'Argon à 4 $ en entrée / 20 $ en sortie, tandis que l'annonce de Google indique 2 $ en entrée / 10 $ en sortie pour la période d'introduction. L'interprétation la plus probable est que Vals affiche un tarif catalogue standard et que Google en affiche un promotionnel, mais il s'agit d'une déduction, et non d'une déclaration publiée par l'une ou l'autre des parties. Si votre budget dépend de ce chiffre, demandez à Google.
Ce qu'Argon affirme et ce qui a été vérifié

La publication de Google regorge de chiffres, et chacun d'eux est déclaré par le fournisseur. Aucun n'a été reproduit indépendamment, pour autant que je puisse en trouver, et les classements indépendants ci-dessus mesurent des choses différentes de celles que Google a choisi de mettre en avant. Ce qui suit est présenté comme les propres affirmations de Google :
• DeepSWE v1.1 — 77,9 %, présenté comme un nouvel état de l'art en ingénierie logicielle à long horizon en conditions réelles.
• Compréhension de vidéos longues LVBench — 91,7 %, décrit comme l'état de l'art.
• AutomationBench (le benchmark de Zapier pour les tâches métier de bout en bout) — classé n° 1 à 51,3 %.
• Remédiation des vulnérabilités de CWE-bench v1 — à égalité en première position à 68 %, en s’appuyant sur le résultat de Gemini 3.8 Flash Cyber au classement v0.
• Gray Swan Indirect Prompt Injection — décrit comme en tête, sans chiffre publié dans le post.
• Vals Finance Agent v2 et Harvey's Legal Agent Benchmark — décrits comme leaders, de même sans chiffre imprimé dans l'annonce.
Les deux familles d’affirmations qui bénéficient réellement d’un soutien indépendant sont celles auxquelles il faut le plus se fier : Vals confirme la position dans l’indice avec un chiffre et un intervalle, et Artificial Analysis confirme un indice de 52,6 et le prix. Les anecdotes de productivité interne — une amélioration de 40 % par rapport à une référence publiée sur une sous-routine quantique, plus de 300 TiB de mémoire libérés dans l’ensemble du parc de Google par les agents Argon — sont des résultats internes à l’entreprise sans test externe, et doivent être interprétées comme telles.
Ce qu'est Opus 5.5, si vous vivez sous un rocher
Claude Opus 5.5 est le modèle phare d'Anthropic : un contexte de 1 M de tokens, une sortie maximale de 128 K, une entrée multimodale texte, image et fichier, la réflexion étendue, l'utilisation d'outils et les sorties structurées. Il a succédé à Claude Opus 5 le 22 septembre 2026 et le point marquant de son lancement était sans doute la baisse de prix — le tarif a été revu à la baisse plutôt qu'à la hausse, à 4 $/20 $, les lectures en cache étant à 0,20 $. Il est aujourd'hui routable sur OrcaRouter exactement à ce tarif, le prix catalogue du fournisseur étant répercuté avec aucune marge, et tout changement de tarif d'un fournisseur arrive de notre côté le jour même où il arrive du leur.
Sur les scores par tâche que les deux modèles obtiennent, le tableau est un véritable chassé-croisé plutôt qu’une victoire écrasante :
• Terminal-Bench 4.0 — Claude Opus 5.5 59,6 % contre Gemini 4 Argon 57,1 %.
• SciCode — Claude Opus 5.5 66,9 % contre Gemini 4 Argon 61,8 %.
• Humanity's Last Exam — Claude Opus 5.5 61,4 % contre Gemini 4 Argon 57,1 %.
• Raisonnement sur de longs contextes — Claude Opus 5.5 84,7 % contre Gemini 4 Argon 79,7 %.
• CritPt — Claude Opus 5.5 31,7 % contre Gemini 4 Argon 27,1 %.
• Omniscience — Claude Opus 5.5 46,4 contre Gemini 4 Argon 42,4.
• GDPval — Claude Opus 5.5 1 846 contre Gemini 4 Argon 1 611.
• AutomationBench-AA — Gemini 4 Argon 77,5 % contre Claude Opus 5.5 69,5 %. C’est le seul score de tâche en confrontation directe où Argon l’emporte nettement, et c’est aussi la famille de tâches la plus proche de ce que récompense le Vals Index.
Le schéma est donc cohérent : Opus 5.5 est en tête sur l’échelle de raisonnement à connotation académique, et Argon est en tête sur l’exécution de tâches de bout en bout. Ce n’est plus une contradiction entre les deux classements. C’est la même conclusion formulée deux fois.
La capacité que personne ne compare
Le plafond de sortie de Gemini 4 Argon est de 1 000 000 de tokens sur une seule trajectoire, contre 64K pour la génération précédente. Claude Opus 5.5 plafonne sa sortie à 128K. Les deux disposent d'une fenêtre de contexte de 1M de tokens, mais le contexte et la sortie sont deux budgets différents, et il s'agit du plus grand bond sur une seule spécification de l'annonce.
Que cela importe dépend entièrement de ce que vous exécutez. Un plafond de sortie de 128K est généreux pour le chat, la revue de code, l’extraction structurée et les étapes d’agent. C’est un mur infranchissable pour générer tout un ensemble de correctifs de migration, un rapport d’audit complet ou un document de forme longue en une seule passe — les flux de travail que Google a choisis pour illustrer le lancement. Si votre pipeline enchaîne vingt appels pour rester sous un plafond, le plafond d’Argon vous fera économiser de la latence et du code d’orchestration. Si ce n’est pas le cas, vous payez pour une marge que vous n’utiliserez pas.
La disponibilité est la variable décisive, pas la qualité.
C'est la partie de la comparaison à laquelle aucun point de référence n'est attaché et qui compte plus que toutes les autres.
Gemini 4 Argon n'est pas en disponibilité générale. La publication de Google indique qu'il est en cours de déploiement auprès de cyberdéfenseurs de confiance dans le cadre du Fairwind Program, que l'entreprise participe au processus volontaire d'accès aux modèles avant leur publication du gouvernement américain, et qu'un accès plus large pour les développeurs, les entreprises et les consommateurs interviendra « dès que possible », en commençant par les clients payants de l'API et les abonnés à Google AI Ultra. Il n'existe aucun identifiant de modèle, aucun point de terminaison, aucun quota publié et aucune date. Il ne figure pas dans notre catalogue et ne figure pas non plus dans l'API publique de qui que ce soit d'autre, donc une page de tarification pour Argon n'existe pas encore.
Claude Opus 5.5 est disponible dès aujourd'hui. Sur OrcaRouter, il s'agit de anthropic/claude-opus-5.5, accessible via le même point de terminaison compatible OpenAI que les plus de 200 autres modèles du catalogue, avec un basculement automatique entre fournisseurs lorsqu'une route se dégrade, et un DSL de routage pour les cas où vous souhaitez envoyer une partie du trafic vers Opus 5.5 et le reste ailleurs avec la même clé. Aucun second contrat, aucun second SDK.

La recommandation pratique pour le mois à venir est peu glamour : construisez sur Opus 5.5, conservez le nom de votre modèle dans une valeur de configuration plutôt que dans une chaîne littérale, et placez un modèle peu coûteux derrière votre chemin de nouvelle tentative afin qu’un pic de latence sur une exécution de premier token de 702 secondes n’entraîne pas la chute de votre produit avec lui. Ce dernier point n’est pas théorique — la latence du premier token d’Opus 5.5 sur le harnais d’AA est de onze minutes, et que ce soit un artefact du harnais ou que le modèle réfléchisse réellement plus longtemps que tout ce qui l’a précédé, votre budget de timeout doit être défini par le chiffre, pas par le marketing.
Qu'est-ce qui changerait ce verdict
Trois choses, par ordre de probabilité. La disponibilité générale d’Argon avec un prix publié, ce qui rendrait l’argument de coût immédiatement exploitable et permettrait de tester si $2/$10 survit au contact du trafic réel. Une exécution indépendante et reproductible de DeepSWE v1.1 et CWE-bench v1 en dehors de Google, qui soit confirmerait les affirmations du fournisseur, soit les démentirait. Ou une configuration d’Artificial Analysis d’Argon à son réglage d’effort maximal, qui trancherait si l’écart de cinq points d’indice est une différence de capacité ou un artefact de réglages d’effort.
Jusqu'à ce que l'un de ces deux éléments se concrétise, le constat honnête est qu'Opus 5.5 est le modèle le mieux vérifié et qu'Argon est l'allégation la mieux tarifée. Quant à savoir lequel de ces deux vous pouvez réellement utiliser aujourd'hui, il n'y a pas photo.
Claude Opus 5.5 est disponible sur OrcaRouter au tarif catalogue du fournisseur, sans marge, aux côtés du reste du catalogue — si vous voulez l'évaluer sur votre propre charge de travail plutôt que sur un classement, anthropic/claude-opus-5.5 est l'identifiant à appeler, et remplacer plus tard par un autre modèle ne demande qu'une modification d'une ligne sur la même clé.
Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
