Une carte-titre pour la comparaison Gemini 3.7 Flash contre Grok 4.6, montrant une étiquette de prix à 50 % de réduction avec un éclair du côté de Gemini 3.7 Flash, face à un bouclier avec une coche du côté de Grok 4.6.
Guides & Insights

Gemini 3.7 Flash vs Grok 4.6 : la guerre des prix de Google vs l'agent d'auto-vérification de SpaceXAI

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Trois semaines après que Gemini 3.6 Flash a largement fait un flop, Go​ogle a réduit de moitié le prix et lancé Gemini 3.7 Flash — une décision que la plupart des médias ont interprétée comme une attaque directe contre Grok 4.6, le vaisseau amiral optimisé pour les agents que SpaceXAI avait lancé la veille à 2 $ et 6 $. Le timing est toute l’histoire : deux modèles proches de la frontière, à un jour d’écart, tous deux visant le même acheteur — une équipe qui veut du codage agentique sans payer les prix de frontière — et tarifés selon des philosophies opposées. Go​ogle achète la réaction du marché avec une promotion de cinq mois. SpaceXAI vend la confiance par tâche à un prix catalogue fixe.

Grok 4.6, publié le 12 août 2026, est le raffinement par SpaceXAI de son modèle de fondation Grok 4.5 à 1,5 billion de paramètres, conçu pour des agents de longue durée qui vérifient eux-mêmes l'achèvement de leurs sous-tâches, avec une fenêtre de contexte de 500K, une entrée texte et image, et un tarif de 2 $/6 $ qui double au-delà de 200 000 jetons d'entrée. Gemini 3.7 Flash, publié le 13 août 2026, est le raffinement algorithmique par Google de Gemini 3.6 Flash — 1M de contexte, entrée multimodale incluant vidéo et audio, et un tarif promotionnel de 0,75 $/3,75 $ qui double pour atteindre 1,50 $/7,50 $ le 1er janvier 2027. Sur l'indice indépendant Artificial Analysis Intelligence, Grok 4.6 se situe à 61, un net progrès par rapport aux premières mesures d'environ 56 pour Gemini 3.7 Flash.

La guerre des prix, une ligne par dimension

Prix par 1M de tokens en entrée — Gemini 3.7 Flash 0,75 $ (lancement) contre 2,00 $ pour Grok 4.6. Google est moins cher de plus de 60 %.

Prix par 1M de sortie — Gemini 3.7 Flash $3.75 (intro) contre Grok 4.6 $6.00.

Après le 1er janvier 2027Gemini double pour atteindre $1.50/$7.50, tandis que Grok reste inchangé à $2/$6.

Fenêtre de contexte — Gemini 3.7 Flash 1M vs Grok 4.6 500K.

Facturation des entrées longues — Gemini facture un tarif fixe sur l'ensemble de sa fenêtre ; Grok double à 4 $/12 $ pour une entrée de 200K ou plus.

Tokens de réflexion — Gemini les facture comme sortie ; le coût de Grok est inclus dans un montant mesuré indépendamment d'environ 0,84 $ par tâche.

En résumé : Gemini 3.7 Flash est moins cher sur chaque ligne de la grille tarifaire aujourd'hui, et la majeure partie de cet avantage disparaît le 1er janvier. Grok 4.6 coûtera le même prix en août qu'en mars.

A comparison scoreboard for Gemini 3.7 Flash and Grok 4.6: Gemini at AA Index ~56, $0.75/$3.75 intro pricing, 1M context, Google-reported GDPVal-AA v2 of 1,525 and per-task cost not yet measured, versus Grok 4.6 at AA Index 61, $2/$6, 500K context, GDPVal-AA v2 of 1,753 and about $0.84 per task per Artificial Analysis, both proprietary.

Où l'argent de Gemini 3.7 Flash est allé

Les propres chiffres de Go​ogle font état de bonds importants pour Gemini 3.7 Flash par rapport à 3.6 Flash : 65,3 % sur DeepSWE v1.1 (contre 49,0 %), 43,6 % sur FrontierCode 1.1 Main (contre 34,4 %), 85,8 % sur Terminal-bench 2.1 (contre 78,0 %), et un Elo WebDev Arena de 1588 (contre 1538). Ce sont des chiffres publiés par le fournisseur, non reproduits de manière indépendante — le genre de mesure qui évalue une trajectoire, pas un verdict comparatif entre fournisseurs. Mais c'est justement la trajectoire qui compte : les correctifs sont arrivés trois semaines après un lancement que les testeurs avaient largement enterré, ce qui montre que Go​ogle considère le niveau Flash comme le champ de bataille, et non le produit phare.

L'autre chose que fait la promotion de Google, c'est de comprimer la fenêtre d'achat. À $0.75/$3.75, le modèle est assez bon marché pour être testé en volume ; à $1.50/$7.50, il reste compétitif mais n'est plus une arme de guerre des prix. Toute équipe de production qui l'adopte pendant la fenêtre d'introduction devrait réévaluer son économie en décembre, et non supposer que le chiffre évoluera avec elle.

Où est passé l'argent de Grok 4.6

Le discours de Grok 4.6 est différent : non pas des jetons moins chers, mais moins de jetons gaspillés. Il a été entraîné à s’auto-vérifier — à contrôler qu’une sous-tâche est réellement terminée avant de passer à la suite — et une mesure indépendante confirme cet effet : Artificial Analysis évalue son coût à environ 0,84 $ par tâche, avec un GDPVal-AA v2 de 1 753 et un indice d’intelligence de 61. Ce sont des chiffres tiers, et ce sont les données les plus solides de cette confrontation, car elles capturent ce que le prix par jeton ne montre pas : un modèle qui nécessite moins d’étapes pour accomplir une tâche revient moins cher par tâche terminée, même à un prix par jeton plus élevé.

Le compromis réside là où le modèle le moins cher a de la marge. Le contexte de 500K de Grok 4.6 représente la moitié du 1M de Gemini 3.7 Flash, et son tarif de 2 $/6 $ double au-delà de 200K d'entrée — c'est donc précisément pour les charges de travail à contexte long et à volume d'entrée élevé que le prix catalogue de Grok 4.6 cesse d'être compétitif par rapport au tarif promotionnel de Gemini.

L'économie par tâche

Au prix de lancement, le taux mixte de Gemini 3.7 Flash avec une répartition 80/20 entrée/sortie est d'environ 1,35 $ par million de tokens ; celui de Grok 4.6 à la même répartition est de 2,80 $ par million avant sa pénalité pour les entrées longues. Sur le papier, le modèle de Google semble être le grand gagnant en volume. La complication : les tokens de réflexion de Gemini sont facturés en sortie, ses performances de benchmark remontent à une semaine, et son efficacité par tâche n'a pas encore été mesurée de manière indépendante — tandis que celle de Grok 4.6 l'a été. Des tokens bon marché accompagnés de tours inutiles peuvent coûter plus cher que des tokens onéreux qui aboutissent, et c'est une confrontation où un camp dispose de données sur cette question et l'autre non.

Parier sur le nouveau modèle sans parier sur le pipeline.

Grok 4.6 est sur OrcaRouter au prix catalogue de 2 $/6 $ de SpaceXAI avec une marge de 0 %, y compris le palier 2x au-dessus de 200K, que la page du modèle récupère en direct depuis la couche de routage. Gemini 3.7 Flash a un jour et est sur la propre API de Go​ogle ; son prédécesseur Gemini 3.6 Flash est sur OrcaRouter au prix catalogue de Go​ogle.

The OrcaRouter model page for grok/grok-4.6, showing the New and Featured badges, the $2.00 per million input and $6.00 per million output pricing, a 500K-token context window, and the released August 12, 2026 label.The OrcaRouter model page for google/gemini-3.6-flash, showing the $1.50 per million input and $7.50 per million output pricing and the 1M-token context window.

Si la question que cette comparaison pose réellement est « devrais-je parier ma pipeline d'agents sur le nouveau modèle bon marché », la couche de routage est la couverture : une règle de basculement qui fait tourner l'agent sur Grok 4.6 aujourd'hui et bascule sur Gemini 3.7 Flash le jour de sa sortie, ou un panneau de fusion où les deux répondent et un juge les départage — le genre de configuration pour laquelle le DSL de routage existe, et qui n'exige pas de choisir un camp avant d'avoir les preuves en main.

La lecture honnête

Si vous voulez le token le moins cher aujourd'hui et que vous faites confiance au délai de trois semaines, Gemini 3.7 Flash est le pari agressif — la guerre des prix est réelle, les gains de benchmark sont documentés, et la fenêtre de lancement est une vraie remise. Si vous voulez un modèle dont l'efficacité d'agent est mesurée indépendamment, dont le prix ne bouge pas en janvier, et dont la boucle d'auto-vérification est conçue pour les tâches de longue durée, Grok 4.6 est le choix conservateur, et les données AA lui donnent un avantage sur le coût par tâche terminée. D'un côté, une promotion avec compte à rebours ; de l'autre, un prix avec un historique. Les deux sont défendables — c'est ce qui en fait une vraie comparaison plutôt qu'une simple formalité.

Comparés dans cet article2

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube