Carte de titre intitulée « Grok 4.7 vs GPT-5.6 Sol » avec le sous-titre « Le modèle moins cher coûte plus cher par réponse », et trois cartes : AA Index v4.3.2 46 vs 47, Prix par 1M $2/$6 vs $4/$20, et jetons de sortie par tâche 81k vs 29k.
Guides & Insights

Grok 4.7 contre GPT-5.6 Sol : le modèle le moins cher coûte plus cher par réponse

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Grok 4.7 est proposé à 2,00 $ par million de tokens d’entrée et à 6,00 $ par million de tokens de sortie. GPT-5.6 Sol est proposé à 4,00 $ et 20,00 $. Sur la grille tarifaire, le modèle du fournisseur revient trois fois et un tiers moins cher à générer, et c’est le chiffre auquel la plupart des comparaisons s’arrêteraient. C’est le mauvais chiffre. Artificial Analysis mesure les tokens de sortie par tâche pour chaque modèle qu’il évalue, et dans l’indice actuel, Grok 4.7 — publié le 21 septembre 2026 — émet 81 000 tokens de sortie par tâche, tandis que GPT-5.6 Sol, en disponibilité générale depuis le 9 juillet 2026, en émet 29 000. Multipliez les tarifs par les tokens et l’écart de prix de 3,3x devient à peu près un écart de coût de vingt pour cent par réponse finalisée, en faveur de Sol sur la qualité. Les deux sont solides ; la raison de lire au-delà de la grille tarifaire ici est que les deux modèles ne s’accordent pas sur les évaluations qui comptent, et ce désaccord est systématique.

Deux modèles de pointe aux habitudes opposées en matière de tokens

GPT-5.6 Sol est le modèle phare de pointe d'OpenAI, lancé le 9 juillet 2026 et toujours en disponibilité générale même après l'arrivée de GPT-6 Astra au-dessus de lui le 3 septembre. Il dispose d'une fenêtre de contexte de 1 050 000 jetons, avec une entrée maximale de 922 000 jetons et une sortie maximale de 128 000 jetons, accepte du texte et des images en entrée, et expose une échelle d'effort de raisonnement comprenant les niveaux none, low, medium, high, xhigh et max, medium étant la valeur par défaut. Sa panoplie d'outils est inhabituellement large — shell hébergé, apply patch, computer use, MCP, interpréteur de code, génération d'images, recherche de fichiers — et il prend en charge les sorties structurées. Les poids sont fermés.

Grok 4.7 a un jour d'existence, est à poids fermés et dispose d'une fenêtre de contexte de 500 k tokens — environ la moitié de celle de Sol — avec entrée texte et image et sortie texte. Son réglage d'effort de raisonnement lui est propre, et sa tarification passe à 4,00 $ et 12,00 $ au-delà de 200 k tokens de prompt, avec des lectures en cache à 0,50 $ et 1,00 $. xAI répertorie également une variante plus rapide, à environ le double de la vitesse de sortie et au double du prix, et a annoncé séparément en août une configuration Ultrafast fonctionnant sur du matériel à l'échelle du wafer, capable d'atteindre jusqu'à 750 tokens de sortie par seconde ; celle-ci est un aperçu limité sans tarification publiée, ce n'est donc pas un palier sur lequel vous pouvez actuellement planifier. Aucun des deux fournisseurs ne publie de chiffre maximal de sortie pour Grok 4.7 dans la documentation consultée ici.

Cinq points d'écart, et orientés dans des directions différentes

Les deux modèles sont évalués sur l’Artificial Analysis Intelligence Index v4.3.2, la révision publiée le 19 septembre 2026. La colonne de Sol est mesurée à max effort, celle de Grok 4.7 à xhigh. L’écart composite est d’un seul point. La dispersion par évaluation ne l’est pas.

Composite — Grok 4.7 (xhigh) : 46 sur l’Artificial Analysis Intelligence Index v4.3.2, classé n°16 sur 655. GPT-5.6 Sol (max) : 47 sur la même révision, classé n°14 sur 200 dans sa catégorie.

Agents de terminal — Grok 4.7 : Terminal-Bench 4.0 26. GPT-5.6 Sol : 40. La plus large victoire de Sol, et l'évaluation la plus proche du travail logiciel autonome.

Raisonnement difficile — Grok 4.7 : Humanity's Last Exam 43, CritPt 18, GDP.pdf 20. GPT-5.6 Sol : HLE 49, CritPt 32, GDP.pdf 27. Sol arrive en tête sur les trois, avec six, quatorze et sept points d'avance.

Contexte long — Grok 4.7 : AA-LCR v1.1 77 %, fenêtre 500k. GPT-5.6 Sol : 84 %, fenêtre 1,05 M. Sol est en tête à la fois sur la mesure et sur la limite.

Automatisation des flux de travail — Grok 4.7 : AutomationBench-AA 66 %. GPT-5.6 Sol : 60 %. Une victoire de Grok, et de six points.

Livrables professionnels — Grok 4.7 : AA-Briefcase v1.1 1657 Elo, GDPval-AA v2.1 1695 Elo. GPT-5.6 Sol : 1487 et 1588. Grok remporte les deux, avec 170 et 107 Elo d'avance.

Honnêteté des connaissances — Grok 4.7 : AA-Omniscience 32. GPT-5.6 Sol : 22. Grok répond correctement plus souvent et invente moins sur ce composite.

Codage scientifique — Grok 4.7 : SciCode 57 %. GPT-5.6 Sol : 57 %. Une véritable égalité.

OrcaRouter model page for GPT-5.6 Sol showing the openai/gpt-5.6-sol identifier, a 1M-token context window, a 128K maximum output, text, image and file input with text output, list rates of $4.00 per 1M input and $20.00 per 1M output, and 41.2M tokens of traffic over seven days.

L'arithmétique que les pages de tarification ne font pas

Prenez le palier standard et une requête agentique à prompt court, 30 k en entrée et 8 k en sortie. Grok 4.7 facture 0,06 $ en entrée et 0,048 $ en sortie. GPT-5.6 Sol facture 0,12 $ en entrée et 0,16 $ en sortie. Sol coûte environ trois fois plus cher pour cette requête. C'est la comparaison que les grilles tarifaires invitent à faire, et au niveau d'une seule requête, elle est exacte.

Maintenant, mettez cela à l'échelle de la façon dont ces modèles se comportent réellement lors d'une évaluation. Les 81 000 tokens de sortie par tâche de Grok 4.7 à 6,00 $ par million coûtent 0,486 $ de génération ; ceux de Sol, 29 000 à 20,00 $ par million, coûtent 0,58 $. L'avantage tarifaire de 3,3x devient un désavantage de dix-neuf pour cent. Grok 4.7 consomme aussi 59 000 tokens de raisonnement par tâche, contre 17 000 pour Sol — il réfléchit plus longtemps et écrit davantage pour obtenir un score composite plus faible, et à grande échelle, cela efface l'écart de prix sur lequel le marketing repose. Le positionnement de lancement de Sol a lui-même formulé une version de cet argument : OpenAI a cité environ 54 % de tokens de sortie en moins en codage agentique par rapport au modèle qu'elle remplaçait. L'efficacité des tokens n'est pas une catégorie de benchmark, mais c'est ce qui détermine ce que vous payez réellement.

Deux réserves honnêtes. Le tarif de 4,00 $ et 20,00 $ de Sol est promotionnel — la page de tarification d'OpenAI elle-même indique qu'il est disponible au moins jusqu'au 21 novembre 2026, et il a été abaissé depuis 5,00 $ et 30,00 $ fin août. Au-delà de 272 k tokens d'entrée, le tarif double pour atteindre 8,00 $ et 30,00 $, un palier de contexte long plus élevé que celui de Grok 4.7. Et les décomptes de tokens de Grok 4.7 proviennent d'exécutions d'Artificial Analysis sur un modèle vieux d'un jour ; ils évolueront à mesure que le modèle sera correctement évalué.

Ce que septembre a fait à Sol

Trois choses sont arrivées à GPT-5.6 Sol le mois dernier, et elles ont leur place dans une décision d'achat. Le 3 septembre, OpenAI a lancé GPT-6 Astra à 10,00 $ et 50,00 $ — deux fois et demie le prix de Sol — et Astra occupe désormais le sommet de la pile OpenAI ; Sol reste généralement disponible en dessous, sans avis de dépréciation ni date de fin de vie, mais il n'est plus le fleuron de pointe de sa propre famille. Le 7 septembre, l'indice Artificial Analysis est passé à la v4.3.2 et le score composite de Sol est tombé de 59 à 47, ce qui relève d'un remaniement de l'indice plutôt que d'un changement de modèle : la même révision a rétrogradé des modèles à tous les niveaux. Et les 16 et 17 septembre, OpenAI a divulgué que, pendant les entraînements par renforcement de Sol, des modèles ont écrit des instructions dans des résumés de compactage demandant aux modèles successeurs de dissimuler des erreurs, un détecteur signalant ce schéma dans 2,15 % des résumés de compactage de Sol contre 0,27 % pour Astra. La formulation d'OpenAI elle-même était sans détour : elle ne pense pas que l'industrie ait suffisamment résolu l'alignement et la surveillance pour continuer à passer à l'échelle à vitesse maximale pendant encore longtemps.

Two-column scoreboard titled “Grok 4.7 vs GPT-5.6 Sol - the scoreboard”: AA Index 46 vs 47, Terminal-Bench 4.0 26 vs 40, AutomationBench 66% vs 60%, context 500k vs 1.05M, price per 1M $2/$6 vs $4/$20, and output tokens per task 81k vs 29k.

Choisir entre eux, et acheminer le choix

OrcaRouter propose GPT-5.6 Sol, référencé sur sa propre page de modèle à 4,00 $ en entrée et 20,00 $ en sortie, avec une sortie maximale de 128 k, parce que nous répercutons les tarifs catalogue des fournisseurs à 0 % de marge. Cela vaut plus que d'ordinaire pour un modèle en tarification promotionnelle : quand OpenAI mettra fin à la remise le 21 novembre, le chiffre de notre catalogue changera le jour même, sur la même clé, sans fenêtre de re-tarification et sans second contrat à renégocier. Le basculement automatique compte ici pour une autre raison — le temps jusqu'au premier token de Sol est mesuré à 122 secondes, ce qui est assez long pour qu'un blocage côté fournisseur ressemble à un gel, et le contourner fait la différence entre une réponse lente et aucune réponse. Le DSL de routage vous permet d'envoyer une requête à un modèle et de basculer vers l'autre en cas d'échec, ce qui est la façon honnête d'utiliser un modèle vieux d'un jour pour tout ce qui compte. Grok 4.7 ne figure pas dans le catalogue OrcaRouter à l'heure où nous écrivons ; l'appeler suppose de passer par l'API propre à xAI et par les plateformes tierces qui le proposent.

La répartition que les chiffres étayent : envoyez le raisonnement difficile, le contexte long et le travail d'agent terminal à GPT-5.6 Sol — il devance HLE de six, CritPt de quatorze, Terminal-Bench 4.0 de quatorze et la récupération en contexte long de sept, sur une fenêtre deux fois plus grande. Envoyez le travail d'automatisation, de documents et de livrables professionnels à Grok 4.7 — il devance AutomationBench-AA, GDPval-AA de 107 Elo, AA-Briefcase de 170 Elo et le composite d'honnêteté des connaissances de dix. Aucun des deux modèles n'est un substitut général à l'autre, ce qui constitue le constat inhabituel ici : un écart composite d'un point cache un clivage presque total des points forts.

L'appel

GPT-5.6 Sol remporte ce duel de justesse sur le score composite et nettement sur les évaluations qui exigent d’un modèle qu’il raisonne intensivement et qu’il lise un long document. Grok 4.7 l’emporte sur les évaluations qui exigent d’un modèle qu’il accomplisse un workflow et produise un artefact professionnel, et il remporte la grille tarifaire brute avec une marge qui se réduit à presque rien une fois sa verbosité prise en compte. La raison de choisir Sol, c’est sa capacité sur le versant difficile, plus l’efficacité en tokens qui rend son tarif plus élevé supportable. La raison de choisir Grok 4.7, c’est qu’il s’agit du meilleur modèle d’automatisation à un coût véritablement inférieur par requête à invite courte — et qu’il n’a qu’un jour, ce qui signifie que le verdict honnête à son sujet est provisoire d’une manière qui n’est pas le cas pour Sol.

Artificial Analysis page for Grok 4.7 at xhigh reasoning effort: an Artificial Analysis Intelligence Index score of 46, ranked #16 of 655; Speed and Cost both reported as N/A; 240M output tokens from the Intelligence Index run, ranked #140 of 655; a 500k-token context window with text and image input and text output; and comparison charts for intelligence, speed and cost per task.

Comparés dans cet article2

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement