Une carte de titre principale générée pour un article intitulé « Grok 4.7 vs Qwen 3.8 Max — un pile ou face sur le papier », avec le sous-titre « Prix identique, un point d'indice d'écart, formes opposées » et des pastilles de statistiques indiquant AA Index 46 vs 45, un prix de 2 $/6 $ pour les deux, et un contexte de 500K vs 984K.
Guides & Insights

Grok 4.7 vs Qwen 3.8 Max : Prix identique, à un point d’écart, formes opposées

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Deux modèles phares fermés, tous deux à 2 $ par million de jetons d'entrée et 6 $ par million de jetons de sortie, tous deux à un point d'écart sur le même benchmark indépendant, sortis à dix-neuf jours d'intervalle. Grok 4.7 est arrivé le 21 septembre 2026 de SpaceXAI ; Qwen 3.8 Max a été publié par le fournisseur le 3 août 2026 et actualisé le 2 septembre 2026. Dans l'actuel Artificial Analysis Intelligence Index, version v4.3.2, Grok 4.7 obtient 46 et Qwen 3.8 Max obtient 45. En matière de prix et de capacité mesurée, ces deux modèles sont le même achat. Sur tout le reste — contexte, modalité, vitesse de service, ouverture et ce que chaque fournisseur a choisi d'optimiser —, ils ne pourraient pas être plus différents, et c'est ce qui rend cette comparaison digne d'être menée plutôt qu'ignorée.

D'abord, la chronologie, car Qwen 3.8 Max a deux dates

Cela perturbe beaucoup de couvertures, il vaut donc mieux clarifier d’entrée de jeu. Qwen 3.8 Max a été lancé le 3 août 2026 comme le modèle le plus grand et le plus performant d’Alibaba, construit à partir de l’architecture vision-langage Qwen 3.5 sur une conception de mélange d’experts clairsemé (sparse mixture-of-experts) annoncée à 2,4 billions de paramètres au total, avec 95 milliards actifs par token. Le 2 septembre 2026, Alibaba a livré une version actualisée — la révision 0902, qui est la version portant les ID de modèle actuels et celle à laquelle Artificial Analysis rattache la date de sa page. Si vous avez vu à la fois une date d’août et une date de septembre pour Qwen 3.8 Max, voici pourquoi : l’une correspond au lancement, l’autre à la révision que la plupart des gens utilisent réellement aujourd’hui.

Grok 4.7 a un historique plus propre et un plus chaotique derrière lui. SpaceXAI l'a publié le 21 septembre 2026 après un lancement qui a été repoussé à plusieurs reprises — Musk avait évoqué des fenêtres fin août, début septembre et mi-septembre avant que le modèle ne soit réellement publié. La sortie elle-même était limitée : un modèle de base plus grand que Grok 4.6, une session d'apprentissage par renforcement plus longue visant des tâches de plusieurs heures, et aucun changement à la grille tarifaire de $2/$6 que Grok 4.6 appliquait depuis le 12 août.

Ce que chaque fournisseur a optimisé

Lisez les deux annonces de lancement comme une paire, et les paris de design sont presque parfaitement opposés.

SpaceXAI optimisé pour l'exécution agentique. Les chiffres rapportés par le fournisseur pour Grok 4.7 se concentrent sur le travail en terminal et sur les dépôts : Terminal-Bench 4.0 à 38,0 % contre 20,3 % pour Grok 4.6, CursorBench 4.0 à 46,3 %, DeepSWE v1.1 à 71,0 % avec un effort de raisonnement élevé, EEBench à 64,0 %. La description de cette version par l'entreprise elle-même désigne l'auto-vérification et la gestion du contexte long dans l'environnement Grok Bot comme les objectifs visés. Grok 4.7 offre une fenêtre de 500 000 jetons, accepte du texte et des images en entrée, renvoie du texte et expose un effort de raisonnement allant de low à xhigh. C'est un modèle conçu pour mener les tâches à terme.

Alibaba a optimisé pour la portée. Qwen 3.8 Max dispose d'une fenêtre de contexte d'environ 984 000 tokens — en pratique un million — et ses points forts publiés relèvent de l'étendue plutôt que de la profondeur sur un seul axe : un score de 86,6 à Terminal Bench 2.1, SWE-bench Pro à 67,7, PaperBench à 93,0, GPQA Diamond à 92,6, MMMU-Pro à 82,3, OSWorld-Verified à 86,1. Il accepte en entrée du texte, des images et de la vidéo et renvoie du texte, prend en charge des niveaux d'effort de raisonnement avec xhigh par défaut, et son point faible publié est Humanity's Last Exam à 43,6. C'est un modèle conçu pour gérer tout ce que vous lui confiez.

Chaque chiffre de ce paragraphe est déclaré par le fournisseur. Aucun des deux ensembles n'a été reproduit de manière indépendante, et les deux ensembles ne sont de toute façon pas directement comparables — Terminal-Bench 2.1 et Terminal-Bench 4.0 sont des benchmarks différents, donc le score de 86,6 de Qwen et celui de 38,0 de Grok ne doivent jamais être mis côte à côte.

• Composite indépendant — Grok 4.7 46 sur AA Intelligence Index v4.3.2 contre Qwen 3.8 Max 45 sur la même version. Une égalité statistique.

• Prix par million de tokens — 2,00 $ en entrée / 6,00 $ en sortie pour les deux. La remise de cache de Qwen est indiquée à 88 %, ce qui donne un tarif mixte de 1,18 $ par million ; les conditions de cache de Grok 4.7 ne sont pas publiées sur la même base.

• Fenêtre de contexte — Grok 4.7 : 500 000 tokens contre environ 984 000 pour Qwen 3.8 Max. Qwen l'emporte de près du double, et c'est la plus grande différence de spécifications entre les deux.

• Modalités d'entrée — Grok 4.7 texte et image vs Qwen 3.8 Max texte, image et vidéo.

• Poids — tous deux propriétaires. Aucun des deux modèles ne peut être téléchargé, ce qui élimine totalement de cette comparaison l’argument habituel des poids ouverts.

• Paramètres — Grok 4.7 non divulgués sur aucune fiche technique de SpaceXAI (le chiffre d'environ 2,1 T est une affirmation de Musk), contre Qwen 3.8 Max annoncé à 2,4 T au total avec 95 B actifs, qu'Alibaba n'a pas confirmé non plus sur une fiche de spécifications.

• Vitesse de service — Qwen 3.8 Max à 38,8 tokens de sortie par seconde, avec 3,08 secondes jusqu’au premier token, selon Artificial Analysis ; Grok 4.7 présenté par SpaceXAI comme environ deux fois plus rapide que des modèles comparables, selon le fournisseur, sans chiffre de débit indépendant publié à ce jour.

A generated two-column comparison scoreboard for Grok 4.7 and Qwen 3.8 Max with six rows: AA Intelligence Index 46 vs 45, price $2.00/$6.00 on both, context 500K vs 984K tokens, modalities text and image vs text, image and video, weights proprietary on both, and speed vendor-claimed twice as fast vs 38.8 tokens per second measured, with a footer noting index scores are per Artificial Analysis v4.3.2 and all benchmark figures are vendor-reported.

La différence de contexte est la véritable décision

Lorsque le prix et les capacités sont identiques, la décision repose sur tout ce qui diffère par ailleurs, et ici, c’est le contexte. Doubler la fenêtre de 500 000 à environ 984 000 tokens n’est pas un simple détail de fiche technique — c’est la différence entre découper un dépôt en morceaux et le garder d’un seul tenant.

La fenêtre plus longue de Qwen 3.8 Max s'accompagne d'une mise en garde documentée qui compte pour les acheteurs : la version à poids ouverts qu'Alibaba a annoncée pour la semaine du 10 août 2026 était uniquement textuelle et n'incluait pas le contexte complet d'un million de tokens. Cela n'affecte pas l'endpoint hébergé dont traite cette comparaison, mais il est bon de le savoir si vous planifiiez vos projets en fonction de la version ouverte.

Il y a une deuxième considération du côté de Grok. La gamme Grok a historiquement appliqué un seuil tarifaire à 200 000 jetons d’entrée, où une requête franchissant le seuil voit l’intégralité de la requête refacturée au double du tarif — 4 $ en entrée et 12 $ en sortie. Avec une fenêtre de 500 000 jetons, ce seuil se situe bien à l’intérieur de la plage de fonctionnement du modèle. Avant d’acheminer des tâches à contexte long vers Grok 4.7, vérifiez la grille tarifaire actuelle du modèle déployé, car c’est dans l’interaction entre une grande fenêtre et un seuil de refacturation que les factures liées au contexte long dérapent.

Ce que coûte un mois de travail sur chacun

Étant donné que les tarifs affichés sont identiques, la comparaison des coûts doit être établie à partir du comportement des tokens plutôt qu'à partir de la grille tarifaire, et c'est là que les deux modèles divergent d'une manière mesurable.

Artificial Analysis a mesuré Grok 4.7 générant 240 millions de tokens de sortie lors de l’exécution de son Intelligence Index, contre une médiane de 92 millions parmi les modèles du classement — c’est un raisonneur verbeux. Qwen 3.8 Max a généré 190 millions de tokens de sortie sur le même indice, avec un coût total d’évaluation de 4 934,79 $ et une vitesse mesurée de 38,8 tokens par seconde. Tous deux se situent bien au-dessus de la médiane de verbosité, et Grok 4.7 est le plus verbeux des deux.

Ainsi, à un prix identique de 6 $ par million de tokens en sortie, le modèle qui émet plus de tokens par tâche coûte plus cher par tâche. Les chiffres de verbosité publiés suggèrent que Grok 4.7 consommera plus de tokens en sortie pour un travail d’indexation équivalent, ce qui signifie que l’égalité sur le prix se traduit en réalité par un léger avantage pour Qwen 3.8 Max sur le coût par tâche — compensé par l’avantage de vitesse revendiqué de Grok 4.7, qui raccourcit le temps réel d’horloge et donc le coût humain de l’attente pendant l’exécution d’un agent. Aucun de ces effets compensatoires n’est visible sur une grille tarifaire, et il vaut la peine de mesurer les deux sur votre propre trafic plutôt que de les supposer.

La seule asymétrie qui ne fait pas débat est la mise en cache. Qwen 3.8 Max annonce une remise de 88 % sur le cache et un tarif mixte de 1,18 $ pour une répartition 7:2:1 entre succès de cache, entrées et sorties. Pour les charges de travail dotées d’un grand préfixe stable — un prompt système, un en-tête de base de code, un ensemble de documents —, c’est dans cette remise que résident les véritables économies, et il vaut la peine de vérifier comment les conditions de cache de Grok 4.7 se comparent avant de vous engager sur du volume.

Screenshot of the Artificial Analysis model page for Qwen3.8 Max showing an Intelligence Index of 45 on index version v4.3.2, a context window of approximately 984k tokens, text and image input, listed pricing of $2.00 input and $6.00 output per million tokens, and an output speed of 38.8 tokens per second.

Choisir, quand les chiffres refusent de choisir à votre place.

Un 46 et un 45 sur le même indice, au même prix, constituent l’égalité la plus proche d’une véritable égalité que ce blog soit susceptible de publier. Cela signifie que la décision devrait être prise sur les axes où les deux modèles diffèrent réellement, et il y en a quatre.

Choisissez Grok 4.7 si votre travail relève du codage agentique et de l'exécution en terminal, si la vitesse en temps réel sur les longues exécutions compte plus que la marge de contexte disponible, et si vous voulez un réglage du raisonnement par requête pour garder le trafic facile peu coûteux. Choisissez Qwen 3.8 Max si vous traitez régulièrement des entrées de plus d'un demi-million de tokens, si l'entrée vidéo figure dans votre feuille de route, si vous voulez la remise de 88 % sur le cache pour les charges de travail à préfixe lourd, ou si vous voulez un modèle dont le fournisseur publie une large matrice d'évaluation plutôt qu'une matrice concentrée sur un seul domaine.

Si la réponse honnête est « un peu des deux », c'est la réponse normale, et c'est le cas pour lequel cette paire est conçue. Qwen 3.8 Max est disponible sur OrcaRouter au prix catalogue d'Alibaba, et OrcaRouter répercute les tarifs catalogue des fournisseurs avec 0 % de marge, donc les 2 $/6 $ ci-dessus correspondent à ce que vous payez réellement, et un changement de tarif fournisseur est appliqué ici le jour même plutôt qu'au renouvellement. Une seule clé API couvre Qwen 3.8 Max ainsi que plus de 200 autres modèles, ce qui signifie que la décision de contexte devient une règle de routage par requête plutôt qu'un engagement de plateforme : envoyez les entrées surdimensionnées vers la fenêtre de 984 k et gardez tout le reste sur le point de terminaison le plus rapide et le moins cher pour cette tâche, avec basculement automatique si un fournisseur se dégrade. Lorsqu'une tâche a réellement besoin des deux formes — une lecture à long contexte suivie d'une passe d'exécution agentique — le DSL de routage compose les modèles en un seul appel au lieu de vous forcer à choisir un camp.

Une précision qui mérite d’être apportée, étant donné qu’aucun des deux modèles n’est ouvert : rien dans cette comparaison ne concerne des poids téléchargeables. Tous deux sont des points de terminaison hébergés, et l’auto-hébergement n’est pas une option pour l’un comme pour l’autre.

Le seul chiffre à retenir

Quarante-six contre quarante-cinq n’est pas une raison de choisir un modèle, et ça ne devrait pas l’être. Ce qui départage cette comparaison, c’est la fenêtre de contexte — 500 000 tokens contre environ 984 000 — et la forme choisie par chaque fournisseur : Grok 4.7 optimisé pour terminer rapidement les tâches agentiques difficiles, Qwen 3.8 Max optimisé pour traiter tout ce que vous lui confiez. Même prix, même capacité mesurée, des tâches différentes. C’est une décision de routage, et c’est le genre de décision qui devrait prendre un après-midi à tester plutôt qu’un trimestre à acquérir.

Screenshot of the OrcaRouter model page for Qwen3.8 Max (model ID qwen/qwen3.8-max), showing Alibaba's list pricing of $2.00 per million input tokens and $6.00 per million output tokens, a 1M token context window, and the vision, tools, JSON and reasoning capability tags.

Comparés dans cet article3

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement