
Grok 4.5 vs GPT-6 Astra : six fois le prix affiché, trois fois la facture
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Mettez Grok 4.5 et GPT-6 Astra côte à côte sur leurs grilles tarifaires, et l'écart paraît absurde : 2,00 $ contre 10,00 $ par million de jetons en entrée, 6,00 $ contre 50,00 $ par million en sortie. Faites passer ces deux mêmes modèles dans l'Intelligence Index d'Artificial Analysis, et l'écart se réduit à quelque chose dont une équipe peut réellement débattre — 1,04 $ par tâche accomplie contre 3,26 $. Le multiple affiché est de 5x en entrée et de 8,3x en sortie. Le multiple de la facture, mesuré sur des décomptes réels de jetons, est d'un peu plus de 3x. Et la dimension où ces deux modèles diffèrent le plus n'est ni l'une ni l'autre. C'est le temps d'attente du premier jeton, où la mesure indépendante est de 10,94 secondes contre 342,30.
Voilà tout le duel en un paragraphe, et c’est pourquoi cette page n’est pas un couronnement dans un sens ou dans l’autre. GPT-6 Astra est le modèle le plus intelligent, avec un écart net et reproductible. Grok 4.5 est le moins cher, avec un écart réel mais nettement plus faible que ne le suggère sa grille tarifaire. Tout le reste — vitesse, efficacité des tokens, contexte, benchmarks de codage — soit se partage, soit s’équilibre, soit s’avère mesuré sur deux règles de mesure différentes.
Ni l’un ni l’autre n’est un nouveau modèle.
Il faut le dire clairement, car beaucoup de pages comparatives donnent l'impression que les deux sont arrivés la semaine dernière.
xAI a lancé Grok 4.5 le 8 juillet 2026. Il est construit sur le socle V9 de 1,5 billion de paramètres et co-entraîné avec Cursor sur des données de sessions de développeurs plutôt que sur du code statique seul, d'où vient sa réputation en codage agentique. Il dispose d'une fenêtre de contexte de 500 000 tokens. Sa propre liste de modèles du fournisseur le référence encore aujourd'hui, aux côtés de deux successeurs — xAI a depuis lancé Grok 4.6 et Grok 4.7 — donc considérez Grok 4.5 comme le palier à 2 $/6 $ de la gamme Grok plutôt que comme son sommet.
OpenAI a annoncé GPT-6 Astra le 3 septembre 2026, avec un déploiement progressif au cours des jours suivants, et il reste le modèle phare d’OpenAI : une fenêtre de contexte de 1 M de tokens (le catalogue d’OrcaRouter indique 1 050 000 en entrée et 128 000 en sortie maximale), une date limite de connaissances au 30 avril 2026, et un positionnement résolument sur le travail agentique à long horizon — utilisation de l’ordinateur, recherche, tâches scientifiques et de cybersécurité. De l’aveu d’OpenAI lui-même, il s’agit du premier modèle à franchir son seuil de cybersécurité « Critical », ce qui explique aussi pourquoi l’accès des entreprises est désactivé par défaut jusqu’à ce qu’un administrateur l’active.
Les deux sont en disponibilité générale sur les API de leurs fournisseurs. Aucun des deux n’est en cours de lancement. La seule chose qui a bougé cette semaine, c’est la famille autour de l’un d’eux, et cela intervient à la fin de cet article parce que cela change la recommandation plutôt que la comparaison.
Les grilles tarifaires, y compris le palier que personne ne cite
• Entrée, contexte court — Grok 4.5 2,00 $ par 1 M vs GPT-6 Astra 10,00 $ par 1 M
• Sortie, contexte court — Grok 4.5 6,00 $ par million vs GPT-6 Astra 50,00 $ par million
• Entrée mise en cache — Grok 4.5 0,30 $ par million contre GPT-6 Astra 1,00 $ par million
• Entrée à contexte long — Grok 4.5 4,00 $ par 1 M vs GPT-6 Astra 20,00 $ par 1 M
• Sortie à contexte long — Grok 4.5 12,00 $ par million contre GPT-6 Astra 75,00 $ par million
• Fenêtre de contexte — Grok 4.5 500 000 jetons vs GPT-6 Astra 1 000 000 jetons
La clause qui compte est celle que presque aucune page de comparaison n’affiche. Sur Grok 4.5, dès que le prompt d’une requête atteint 200 000 tokens, toute la requête est refacturée au palier supérieur — la documentation de xAI précise explicitement qu’elle est « facturée au tarif supérieur pour tous les tokens de la requête », et non uniquement pour les tokens au-delà du seuil. Ainsi, la fenêtre de 500 000 tokens est bien réelle, mais environ ses 60 % supérieurs sont facturés au double. La page tarifaire d’OpenAI pour Astra présente la même structure à deux colonnes court/long sans indiquer où se situe son point de bascule ; considérez donc la colonne contexte long comme celle qui s’applique dès que vous travaillez à grande échelle, et vérifiez le seuil par rapport à votre propre facture.

Deux multiplicateurs au niveau du service se superposent aux chiffres d’Astra : Batch et Flex s’appliquent à la moitié du tarif standard, et le mode Fast s’applique au double — 20,00 $ en entrée et 100,00 $ en sortie en contexte court. Grok 4.5 n’a pas de niveau batch sur la fiche de xAI ; ses leviers sont la remise sur le cache et le traitement prioritaire à 2x.
Notre propre position sur tout cela est délibérément ennuyeuse : OrcaRouter répercute le prix catalogue du fournisseur avec 0 % de marge, donc les deux grilles tarifaires ci-dessus sont à jour de notre côté le jour même où l’un ou l’autre fournisseur les modifie, et les tokens mis en cache sont facturés au tarif de cache du fournisseur plutôt qu’au prix plein. Il n’y a pas de second chiffre à rapprocher.
Ce que coûte réellement une charge de travail
Les prix affichés sont un mauvais repère ici, car les deux modèles ne consomment pas le même nombre de tokens pour accomplir la même tâche. Prenons une tâche d’agent de codage avec un contexte de dépôt de 120 000 tokens et une réponse de 25 000 tokens. Sur Grok 4.5, cela représente 0,24 $ en entrée et 0,15 $ en sortie, donc 0,39 $. Sur GPT-6 Astra, c’est 1,20 $ et 1,25 $, donc 2,45 $. Un écart de 6,3x.
Poussez maintenant le prompt au-delà du seuil de contexte long : 300 000 tokens en entrée, 20 000 en sortie. Grok 4.5 facture 1,20 $ plus 0,24 $, soit 1,44 $. GPT-6 Astra facture 6,00 $ plus 1,50 $, soit 7,50 $. L'écart se réduit à 5,2x, car les deux fournisseurs doublent le tarif d'entrée et le multiple de sortie d'Astra se resserre dans le haut de gamme.
Aucun de ces deux chiffres n'est ce que mesure Artificial Analysis, et c'est leur chiffre qui est le plus utile. En exécutant l'Intelligence Index complet, le coût moyen par tâche terminée est de 1,04 $ pour Grok 4.5 en effort élevé et de 3,26 $ pour GPT-6 Astra en effort maximal. Si le rapport tombe à 3,1x alors que le prix des entrées varie d'un facteur 5, c'est en raison de l'efficacité en tokens : sur l'ensemble de l'indice, Grok 4.5 a généré 77 M de tokens de sortie et Astra en a généré 60 M. Astra est le modèle le plus concis, il comble donc une partie de l'écart qu'il a creusé sur le prix. Si vous avez cité « cinq fois moins cher » dans un document budgétaire, c'est 3x qui apparaîtra sur la facture.
La vitesse est à égalité. La latence ne l'est pas.
Voici la constatation qui nous a surpris, et elle va à l'encontre de l'intuition selon laquelle le modèle bon marché est le plus rapide.
Artificial Analysis mesure Grok 4.5 à 55 jetons de sortie par seconde et GPT-6 Astra à 58. Cela représente une différence de 5 % sur la même révision d’indice, et le propre résumé d’AA décrit les deux comme plus lents que la moyenne — la médiane de comparaison est de 74 jetons par seconde. Si le débit est votre critère de sélection, ces deux modèles ne se distinguent pas. Dites-le clairement plutôt que de fabriquer un gagnant : sur le seul chiffre de vitesse mesuré de la même manière pour les deux, ils sont à égalité.
La latence les sépare violemment. AA situe le temps jusqu'au premier token de réponse de Grok 4.5 à 10,94 secondes, avec 20,01 secondes de bout en bout ; GPT-6 Astra à 342,30 secondes, avec 350,91 secondes de bout en bout. Cela représente un facteur d'environ 31, et sur une requête synchrone, c'est la différence entre une roue de chargement et une pause café.
Deux mises en garde honnêtes avant que quiconque ne prévoie un budget sur cette base. Premièrement, ce sont des chiffres incluant le raisonnement — le « temps jusqu'au premier token de réponse » d'AA compte délibérément le temps de réflexion du modèle —, ils décrivent donc une tâche difficile, pas un tour de conversation. Deuxièmement, ils ne sont pas à effort égal : l'entrée publiée d'Astra est en effort maximal, celle de Grok 4.5 en effort élevé, et un réglage d'effort est exactement le curseur qui fait varier ce nombre. La propre fiche d'OrcaRouter pour GPT-6 Astra indique un temps jusqu'au premier token p50 de 8,31 secondes et un p95 de 10,00 secondes sur le trafic réel, ce qui constitue un point de mesure tout à fait différent — le premier token sur de vrais appels de production, et non le premier token de réponse sur une tâche de benchmark. Les deux ne sont pas comparables et ne devraient pas être mis dans la même phrase à titre de comparaison.

Benchmarks de codage : vérifiez la version avant de la citer
Cherchez cette confrontation et vous trouverez les 83,3 % de Grok 4.5 sur Terminal-Bench 2.1 face aux 57,9 % de GPT-6 Astra sur Terminal-Bench 4.0. Ce sont des benchmarks différents qui portent le même nom. Ils ne peuvent pas être comparés, et les pages de comparaison qui les empilent ne vous apprennent rien.
La plupart des chiffres de codage publiés par les deux fournisseurs ont ce problème. Le tableau d’xAI pour Grok 4.5 indique SWE-bench Pro 64,7 %, Terminal-Bench 2.1 83,3 %, DeepSWE 1.0 62,0 % et DeepSWE 1.1 53 %. Le tableau d’OpenAI pour Astra indique Terminal-Bench 4.0 57,9 %, OSWorld 2.0 72,6 %, FrontierMath Tier 4 97,6 % et ARC-AGI-3 99,9 %. Tous rapportés par les fournisseurs, et presque aucun d’entre eux ne se recoupent.
Il existe un seul endroit où les deux se rencontrent véritablement sur le même harnais : DeepSWE v1.1 de Datacurve, qui fait passer chaque modèle par le même échafaudage mini-swe-agent sur 113 tâches originales et exemptes de contamination. Là, GPT-6 Astra obtient 74,1 % pour environ 6,52 $ par tâche, tandis que Grok 4.5 atteint 53 %. C'est le résultat unique le plus net de cette page, et il favorise Astra de manière décisive. Une réserve supplémentaire propre à Grok 4.5 : le chiffre CursorBench d'xAI a été exclu de la comparaison publique après qu'une base de code antérieure s'est avérée avoir fuité dans l'entraînement, de sorte que tout chiffre CursorBench pour ce modèle doit être considéré comme inutilisable.
Comportement agentique et appel d'outils
Les deux empruntent des voies différentes vers la même destination, et la différence est d'ordre architectural plutôt qu'une question de score.
Les fonctionnalités de GPT-6 Astra destinées aux développeurs partent du principe que vous construisez un orchestrateur. Il prend en charge l'appel d'outils asynchrone, de sorte qu'attendre un outil n'empêche pas le modèle de poursuivre d'autres tâches ; le pilotage en cours de tâche via WebSockets, de sorte qu'une exécution en cours peut être réorientée sans avoir à la redémarrer ; et un effort de raisonnement ajustable en cours de conversation. Dans Codex, il ajoute un mécanisme de préservation du contexte qui conserve des notes d'une fenêtre de contexte à l'autre, tandis que le contexte antérieur reste consultable. La fiche système d'OpenAI elle-même indiquerait que le modèle est plus difficile à surveiller que son prédécesseur, ce qui est une raison de considérer les journaux d'appels d'outils et l'état du système — et non la narration du modèle — comme vos éléments de preuve d'audit.
Le positionnement agentique de Grok 4.5 repose moins sur de nouvelles primitives que sur l’endroit où il a été entraîné. Le co-entraînement avec Cursor sur de vraies sessions d’édition et de débogage multi-fichiers est ce que xAI met en avant pour expliquer son efficacité en tokens sur les tâches logicielles, et c’est pourquoi le modèle apparaît par défaut dans les interfaces de codage plutôt que comme un modèle phare généraliste. L’appel de fonctions, la sortie structurée, le streaming et la mise en cache des prompts sont tous pris en charge ; l’appel d’outils suit le format compatible OpenAI, ce qui explique que l’intégrer dans un client existant se résume à un changement d’URL de base.
Il n'existe pas de benchmark agentique indépendant commun où les deux figurent à effort égal, donc nous n'allons pas inventer un vainqueur ici. Ce que l'on peut dire, c'est que la surface d'appel d'outils d'Astra est la plus expressive des deux pour le travail à long horizon, et que l'économie de tokens par tâche de Grok 4.5 est la plus attrayante pour le travail à fort volume.
Choisissez Grok 4.5 si
• Vous exécutez un travail à grand volume ou à haute fréquence, où le coût par tâche domine la décision, et un score de 39 sur l'AA Intelligence Index dépasse votre seuil de qualité.
Vos prompts se situent sous les 200 000 tokens. C'est là que l'avantage tarifaire de Grok 4.5 est le plus large et que la nouvelle tarification liée au contexte long ne se déclenche jamais.
• Vous voulez une remise de cache qui travaille vraiment. À 0,30 $ par million de jetons d’entrée mis en cache, contre 1,00 $ chez Astra, les charges de travail à préfixe répété — longs prompts système, contexte de dépôt partagé — deviennent vite bon marché.
• Vous avez besoin d'une latence du premier jeton inférieure à une minute sur les tâches difficiles et ne pouvez pas vous permettre une attente de plusieurs minutes.
Choisissez GPT-6 Astra si
• La tâche est le produit, et la facture est une erreur d’arrondi à côté d’une mauvaise réponse. Quatorze points d’indice à cette extrémité de la courbe représentent une véritable différence de capacité, pas un argument marketing.
• Vous travaillez réellement au-delà de 500 000 tokens. La fenêtre d'Astra est environ deux fois celle de Grok 4.5, et c'est le seul des deux à l'atteindre sans clause de réajustement tarifaire.
• Vous avez besoin de l'utilisation de l'ordinateur, de la recherche approfondie ou de la posture en matière de cybersécurité — y compris les contrôles désactivés par défaut pour les entreprises qui accompagnent le seuil Critical d'OpenAI.
• Vous écrivez du code d'orchestrateur qui souhaite des appels d'outils asynchrones et un pilotage en cours d'exécution plutôt qu'un simple appel requête-réponse.
Ce qui a bougé cette semaine, et pourquoi cela change la recommandation
Le 22 septembre 2026, OpenAI a lancé GPT-6 Sol et GPT-6 Luna à 2,00 $/10,00 $ et 0,10 $/0,50 $ par million de jetons, qualifiant ces tarifs de permanents plutôt que promotionnels. Sol est le modèle de milieu de gamme pour le codage et l’analyse, à environ un cinquième du prix des jetons d’entrée d’Astra.
Cela compte pour cette décision précise. Si la raison pour laquelle vous compariez Grok 4.5 à GPT-6 Astra était le prix, la comparaison honnête du côté d’OpenAI n’est plus Astra — Astra est le modèle phare, et Sol occupe désormais le segment dans lequel Grok 4.5 est réellement en concurrence. Grok 4.5 reste moins cher que Sol en sortie (6,00 $ contre 10,00 $) et l’égale en entrée (2,00 $ chacun), donc il n’est pas déclassé ; mais une comparaison écrite avant cette semaine comparait un modèle économique à un modèle phare et présentait le résultat comme une question de prix.
Il en va de même du côté de xAI : la propre liste de modèles de xAI comporte grok-4.6 et grok-4.7 aux côtés de grok-4.5, de sorte que Grok 4.5 est une option au sein d’une famille plutôt que la frontière actuelle.

C’est là le véritable argument en faveur du routage plutôt que de la sélection. La pile à deux modèles qui ne cesse d’apparaître dans les articles de praticiens — envoyer le gros du volume au modèle bon marché, escalader la partie difficile vers le modèle coûteux — est une décision de routage, et c’est une décision que vous pouvez exprimer sous forme de configuration plutôt que de réécriture. OrcaRouter place les deux modèles derrière une seule API et une seule clé, avec le prix catalogue du fournisseur répercuté à 0 % de marge, un basculement automatique entre fournisseurs, et un DSL de routage qui vous permet d’envoyer le travail en dessous d’un seuil vers grok/grok-4.5 et d’escalader vers openai/gpt-6-astra lorsqu’une tâche échoue ou franchit un seuil de taille. Vous pouvez essayer le chemin coûteux sur une petite fraction du trafic sans y risquer un pipeline de production.
La version courte
GPT-6 Astra est le meilleur modèle. Ce n’est pas serré, et cette page ne vaudrait rien si elle prétendait le contraire — 53 contre 39 sur la même révision de l’index, 74,1 % contre 53 % sur l’unique benchmark de codage que les deux ont passé.
Grok 4.5 est le modèle le moins cher, mais de 3,1x par tâche accomplie plutôt que de 5x à 8,3x comme le laisse entendre sa grille tarifaire, parce qu’Astra dépense moins de tokens pour y parvenir. Et sur le seul chiffre de vitesse mesuré de manière identique pour les deux, ils sont à égalité.
La décision n’est pas de savoir quel modèle gagne. C’est de savoir si un écart de 14 points sur l’indice vaut environ le triple de la facture pour votre charge de travail spécifique — et si la réponse est la même pour chaque requête que vous envoyez.
Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
