
Gemini 3.7 Flash vs Grok 4.6 : la guerre des prix de Google vs l'agent d'auto-vérification de SpaceXAI
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0259Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0258Intelligence72Code
- anthropicNOUVEAUAnthropic: Claude Fable 5.12026-09-0166Intelligence82Code
- AlibabaNOUVEAUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.3 Flash2026-08-2658Intelligence72Code
- DeepSeekNOUVEAUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1860Intelligence75Code
- obsidianQwen3.8 27B2026-08-1552Intelligence68Code
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
Trois semaines après que Gemini 3.6 Flash a largement fait un flop, Google a réduit de moitié le prix et lancé Gemini 3.7 Flash — une décision que la plupart des médias ont interprétée comme une attaque directe contre Grok 4.6, le vaisseau amiral optimisé pour les agents que SpaceXAI avait lancé la veille à 2 $ et 6 $. Le timing est toute l’histoire : deux modèles proches de la frontière, à un jour d’écart, tous deux visant le même acheteur — une équipe qui veut du codage agentique sans payer les prix de frontière — et tarifés selon des philosophies opposées. Google achète la réaction du marché avec une promotion de cinq mois. SpaceXAI vend la confiance par tâche à un prix catalogue fixe.
Grok 4.6, publié le 12 août 2026, est le raffinement par SpaceXAI de son modèle de fondation Grok 4.5 à 1,5 billion de paramètres, conçu pour des agents de longue durée qui vérifient eux-mêmes l'achèvement de leurs sous-tâches, avec une fenêtre de contexte de 500K, une entrée texte et image, et un tarif de 2 $/6 $ qui double au-delà de 200 000 jetons d'entrée. Gemini 3.7 Flash, publié le 13 août 2026, est le raffinement algorithmique par Google de Gemini 3.6 Flash — 1M de contexte, entrée multimodale incluant vidéo et audio, et un tarif promotionnel de 0,75 $/3,75 $ qui double pour atteindre 1,50 $/7,50 $ le 1er janvier 2027. Sur l'indice indépendant Artificial Analysis Intelligence, Grok 4.6 se situe à 61, un net progrès par rapport aux premières mesures d'environ 56 pour Gemini 3.7 Flash.
La guerre des prix, une ligne par dimension
• Prix par 1M de tokens en entrée — Gemini 3.7 Flash 0,75 $ (lancement) contre 2,00 $ pour Grok 4.6. Google est moins cher de plus de 60 %.
• Prix par 1M de sortie — Gemini 3.7 Flash $3.75 (intro) contre Grok 4.6 $6.00.
• Après le 1er janvier 2027 — Gemini double pour atteindre $1.50/$7.50, tandis que Grok reste inchangé à $2/$6.
• Fenêtre de contexte — Gemini 3.7 Flash 1M vs Grok 4.6 500K.
• Facturation des entrées longues — Gemini facture un tarif fixe sur l'ensemble de sa fenêtre ; Grok double à 4 $/12 $ pour une entrée de 200K ou plus.
• Tokens de réflexion — Gemini les facture comme sortie ; le coût de Grok est inclus dans un montant mesuré indépendamment d'environ 0,84 $ par tâche.
En résumé : Gemini 3.7 Flash est moins cher sur chaque ligne de la grille tarifaire aujourd'hui, et la majeure partie de cet avantage disparaît le 1er janvier. Grok 4.6 coûtera le même prix en août qu'en mars.

Où l'argent de Gemini 3.7 Flash est allé
Les propres chiffres de Google font état de bonds importants pour Gemini 3.7 Flash par rapport à 3.6 Flash : 65,3 % sur DeepSWE v1.1 (contre 49,0 %), 43,6 % sur FrontierCode 1.1 Main (contre 34,4 %), 85,8 % sur Terminal-bench 2.1 (contre 78,0 %), et un Elo WebDev Arena de 1588 (contre 1538). Ce sont des chiffres publiés par le fournisseur, non reproduits de manière indépendante — le genre de mesure qui évalue une trajectoire, pas un verdict comparatif entre fournisseurs. Mais c'est justement la trajectoire qui compte : les correctifs sont arrivés trois semaines après un lancement que les testeurs avaient largement enterré, ce qui montre que Google considère le niveau Flash comme le champ de bataille, et non le produit phare.
L'autre chose que fait la promotion de Google, c'est de comprimer la fenêtre d'achat. À $0.75/$3.75, le modèle est assez bon marché pour être testé en volume ; à $1.50/$7.50, il reste compétitif mais n'est plus une arme de guerre des prix. Toute équipe de production qui l'adopte pendant la fenêtre d'introduction devrait réévaluer son économie en décembre, et non supposer que le chiffre évoluera avec elle.
Où est passé l'argent de Grok 4.6
Le discours de Grok 4.6 est différent : non pas des jetons moins chers, mais moins de jetons gaspillés. Il a été entraîné à s’auto-vérifier — à contrôler qu’une sous-tâche est réellement terminée avant de passer à la suite — et une mesure indépendante confirme cet effet : Artificial Analysis évalue son coût à environ 0,84 $ par tâche, avec un GDPVal-AA v2 de 1 753 et un indice d’intelligence de 61. Ce sont des chiffres tiers, et ce sont les données les plus solides de cette confrontation, car elles capturent ce que le prix par jeton ne montre pas : un modèle qui nécessite moins d’étapes pour accomplir une tâche revient moins cher par tâche terminée, même à un prix par jeton plus élevé.
Le compromis réside là où le modèle le moins cher a de la marge. Le contexte de 500K de Grok 4.6 représente la moitié du 1M de Gemini 3.7 Flash, et son tarif de 2 $/6 $ double au-delà de 200K d'entrée — c'est donc précisément pour les charges de travail à contexte long et à volume d'entrée élevé que le prix catalogue de Grok 4.6 cesse d'être compétitif par rapport au tarif promotionnel de Gemini.
L'économie par tâche
Au prix de lancement, le taux mixte de Gemini 3.7 Flash avec une répartition 80/20 entrée/sortie est d'environ 1,35 $ par million de tokens ; celui de Grok 4.6 à la même répartition est de 2,80 $ par million avant sa pénalité pour les entrées longues. Sur le papier, le modèle de Google semble être le grand gagnant en volume. La complication : les tokens de réflexion de Gemini sont facturés en sortie, ses performances de benchmark remontent à une semaine, et son efficacité par tâche n'a pas encore été mesurée de manière indépendante — tandis que celle de Grok 4.6 l'a été. Des tokens bon marché accompagnés de tours inutiles peuvent coûter plus cher que des tokens onéreux qui aboutissent, et c'est une confrontation où un camp dispose de données sur cette question et l'autre non.
Parier sur le nouveau modèle sans parier sur le pipeline.
Grok 4.6 est sur OrcaRouter au prix catalogue de 2 $/6 $ de SpaceXAI avec une marge de 0 %, y compris le palier 2x au-dessus de 200K, que la page du modèle récupère en direct depuis la couche de routage. Gemini 3.7 Flash a un jour et est sur la propre API de Google ; son prédécesseur Gemini 3.6 Flash est sur OrcaRouter au prix catalogue de Google.


Si la question que cette comparaison pose réellement est « devrais-je parier ma pipeline d'agents sur le nouveau modèle bon marché », la couche de routage est la couverture : une règle de basculement qui fait tourner l'agent sur Grok 4.6 aujourd'hui et bascule sur Gemini 3.7 Flash le jour de sa sortie, ou un panneau de fusion où les deux répondent et un juge les départage — le genre de configuration pour laquelle le DSL de routage existe, et qui n'exige pas de choisir un camp avant d'avoir les preuves en main.
La lecture honnête
Si vous voulez le token le moins cher aujourd'hui et que vous faites confiance au délai de trois semaines, Gemini 3.7 Flash est le pari agressif — la guerre des prix est réelle, les gains de benchmark sont documentés, et la fenêtre de lancement est une vraie remise. Si vous voulez un modèle dont l'efficacité d'agent est mesurée indépendamment, dont le prix ne bouge pas en janvier, et dont la boucle d'auto-vérification est conçue pour les tâches de longue durée, Grok 4.6 est le choix conservateur, et les données AA lui donnent un avantage sur le coût par tâche terminée. D'un côté, une promotion avec compte à rebours ; de l'autre, un prix avec un historique. Les deux sont défendables — c'est ce qui en fait une vraie comparaison plutôt qu'une simple formalité.
Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
