
Mercury 2.5 Preview vs Grok 4.6 : une Preview à 1 107 tokens/s peut-elle détrôner le champion du rapport qualité-prix ?
- AlibabaNOUVEAUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.3 Flash2026-08-2658Intelligence72Code
- DeepSeekNOUVEAUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1860Intelligence75Code
- obsidianQwen3.8 27B2026-08-1552Intelligence68Code
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
Voici la réponse en une phrase : Mercury 2.5 Preview est le modèle de raisonnement crédible le moins cher en production aujourd’hui, à 0,04 $ / 0,15 $ par million de jetons, et Grok 4.6 est le modèle le moins cher à la frontière de l’intelligence, à 2,00 $ / 6,00 $ — la question pratique qui se pose donc entre eux est de savoir si un modèle de diffusion en préversion dont Inception affirme seulement qu’il est « comparable à » GPT-5.6 Luna (Low) et Claude Haiku 4.5 peut accomplir les tâches pour lesquelles vous paieriez sinon l’échelon supérieur de la frontière. Mercury 2.5 Preview, publié le 31 août 2026, génère des jetons en parallèle et revendique 1 107 jetons par seconde sur des GPU standard ; Grok 4.6, le vaisseau amiral de la frontière publié le 12 août 2026, obtient 61 à l’indice d’intelligence Artificial Analysis, à égalité pour la 3e place mondiale, et ce à un prix que la frontière n’avait jamais vu auparavant. Cette collision — la revendication la plus rapide en bas de la courbe des prix rencontrant le meilleur rapport qualité-prix en haut de celle-ci — est le sujet de cet article.
Points clés
Grok 4.6 à 2,00 $ / 6,00 $ avec un indice d’intelligence AA de 61 est le champion de la valeur de la catégorie de pointe ; Mercury 2.5 Preview à 0,04 $ / 0,15 $ est un pari selon lequel une qualité suffisante à 1/50e du prix bat une qualité de pointe dont vous avez rarement besoin.
• Les allégations de vitesse et de qualité de Mercury 2.5 Preview proviennent entièrement d'Inception ; aucun score de benchmark indépendant n'existait dès le premier jour.
• La remise de lancement de 80 % sur Mercury 2.5 Preview expire le 8 septembre 2026, après quoi son prix catalogue est de 0,20 $ / 0,75 $ — toujours 10 fois moins cher que Grok 4.6 à l’entrée, mais une histoire plus modeste.
• Grok 4.6 est aujourd'hui routé sur OrcaRouter au prix catalogue ; Mercury 2.5 Preview n'est pas encore routé et est servi via la propre API d'Inception et plusieurs plateformes tierces.
Le tableau d'affichage

• Intelligence — Mercury 2.5 Preview : aucun indice indépendant ; Inception revendique la parité avec le palier optimisé pour les coûts. Grok 4.6 : AA Intelligence Index 61, à égalité pour la 3e place mondiale (selon Artificial Analysis ; les chiffres du laboratoire lui-même sont auto-déclarés).
• Prix — Mercury 2.5 Preview : 0,04 $ / 0,15 $ par million (80 % de réduction sur 0,20 $ / 0,75 $, jusqu'au 8 septembre 2026). Grok 4.6 : 2,00 $ / 6,00 $ par million, doublant à 4,00 $ / 12,00 $ pour les invites de 200 000 jetons ou plus.
• Vitesse — Mercury 2.5 Preview : 1 107 tokens/s revendiqués, selon le fournisseur. Grok 4.6 : la vitesse n'est pas une spécification phare ; le modèle est conçu pour de longues exécutions agentiques, pas pour des flux rapides.
• Contexte — Mercury 2.5 Preview: 260K. Grok 4.6: 500K.
• Travail agentique — Mercury 2.5 Preview : aucun score public, bien que les appels d'outils parallèles soient pris en charge. Grok 4.6 : APEX-Agents 57.5, DeepSWE v1.1 65.9, CursorBench v3.2 69.9 (rapportés par le fournisseur, en grande partie non reproduits).
• Poids — Mercury 2.5 Preview : fermés, propriétaires. Grok 4.6 : fermés, propriétaires.
Le champion de la valeur et le saut de prix
La position de Grok 4.6 est inhabituelle. Il occupe la troisième place en intelligence sur l’indice Artificial Analysis — à égalité avec GPT-5.6 Sol Max — tout en étant moins cher que tous les modèles situés à moins de dix points de lui, et sa couverture de lancement a mis en avant de longues exécutions agentiques aboutissant à une moyenne d’environ 0,84 $ par tâche lors d’une évaluation réalisée par un fournisseur. C’est la définition d’un champion du rapport qualité-prix : des capacités proches de la frontière technologique, à un prix qui rend les coûts par tâche visibles dans un tableur. Mercury 2.5 Preview ne cherche pas à être cela. Inception le positionne face à des modèles comme GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite et Claude Haiku 4.5 — la gamme optimisée pour les coûts, pas la frontière. Si Inception a raison, Mercury 2.5 Preview est un cran en dessous de Grok 4.6 en termes de capacités et plusieurs crans en dessous en termes de prix, ce qui constitue un produit parfaitement cohérent : un échelon de prix inférieur pour les charges de travail où le niveau frontière n’est qu’un gaspillage.
Ce que le décodage parallèle change réellement
L’architecture est l’élément qui mérite vraiment d’être compris, car elle change la signification de « rapide ». Les modèles autorégressifs émettent un jeton à la fois, si bien que le débit est plafonné par la latence séquentielle ; un LLM à diffusion comme Mercury 2.5 Preview génère un bloc de jetons en parallèle puis l’affine à travers des étapes de débruitage, ce qui découple le débit du nombre de jetons produits. C’est pourquoi Inception peut revendiquer 1 107 jetons/seconde sur des GPU standard — sans accélérateurs spécialisés, sans astuces de regroupement par lots — et pourquoi la véritable promesse produit est un délai avant le premier jeton inférieur à 300 millisecondes pour les charges de travail interactives. Pour un agent vocal, un pipeline de recherche ou un sous-agent de codage qui appelle le modèle à chaque tour, cette différence de latence est le produit : c’est la différence entre une boucle vocale qui semble vivante et une qui marque une pause. Le revers de la médaille, c’est que les modèles de langage à diffusion constituent un domaine de recherche jeune, que le chiffre de 1 107 provient d’Inception, et qu’aucun laboratoire indépendant n’a reproduit la vitesse ni mesuré la dérive de qualité, si elle existe, que la génération parallèle introduit sur les invites longues ou adverses.
Là où Grok 4.6 fait toujours le travail.
Rien dans Mercury 2.5 Preview ne touche aux segments du marché que Grok 4.6 est en train de réellement conquérir. Les gains de Grok par rapport à Grok 4.5 se concentraient sur les benchmarks agentiques et de codage — DeepSWE en hausse de 11,9 points, APEX-Agents en hausse de 10,4, Terminal-Bench en hausse de 10,3 — et sa fenêtre de contexte de 500K existe pour les agents à long horizon qui doivent conserver l'intégralité de la tâche en contexte. Mercury 2.5 Preview propose des appels d'outils parallèles, mais un modèle sans scores agentiques indépendants, avec une limite de sortie de 65 536 jetons et un contexte de 260K n'est pas l'outil pour une exécution d'ingénierie logicielle en 50 étapes. Les deux modèles ne se chevauchent guère en usage : Grok 4.6 est le moteur pour le travail qui doit réellement aboutir ; Mercury 2.5 Preview est le moteur pour le travail qui doit sembler instantané et ne presque rien coûter par appel.
La fenêtre à -80 %
La tarification ici a une date d'expiration, et elle change la décision. Le tarif de 0,04 $ / 0,15 $ de Mercury 2.5 Preview représente une remise de 80 % par rapport au prix catalogue de 0,20 $ / 0,75 $, et Inception a déclaré que la promo court jusqu'au 8 septembre 2026. Le tarif de 2,00 $ / 6,00 $ de Grok 4.6 est un prix catalogue stable avec une structure claire — entrée en cache à 0,50 $, un palier prioritaire à 2×, et un palier pour requêtes longues à 200 000 jetons qui facture la totalité de la requête au tarif supérieur. Si l'on compare les chiffres d'aujourd'hui, Mercury semble 50 fois moins cher en entrée et 40 fois moins cher en sortie ; si la remise expire comme prévu, l'écart réel à long terme est de 10 fois en entrée et de 5 fois en sortie. Aucune des deux présentations n'est malhonnête — ce sont simplement des horizons temporels différents, et un pipeline tarifé sur la remise sans point de réévaluation est un pipeline qui sera surpris le 9 septembre. Le tarif de 2,00 $ / 6,00 $ de Grok 4.6 est exactement ce que vous payez sur OrcaRouter, où le prix catalogue du fournisseur est transmis sans marge (0 % de majoration) — lorsque le fournisseur modifie un chiffre, il est en vigueur sur la même clé le jour même, avec basculement automatique si un chemin de fournisseur limite son débit.
Le verdict en une ligne
Si la tâche doit être menée à bien et que vous voulez une capacité de pointe au meilleur prix de la catégorie, optez pour Grok 4.6 — c'est un champion de la valeur éprouvé, disponible sur OrcaRouter à $2.00 / $6.00 aujourd'hui. Si la tâche est un raisonnement textuel à fort volume et sensible à la latence, où des réponses suffisamment bonnes sont peu coûteuses à vérifier, Mercury 2.5 Preview à $0.04 / $0.15 est une aubaine tarifaire à tester dans la fenêtre de remise — rappelez-vous simplement que chaque affirmation de son côté du tableau émane d'Inception, et que la preuve reste à apporter.


OrcaRouter transmet les prix catalogue des fournisseurs avec 0 % de marge et un basculement automatique, de sorte qu’un changement de prix d’un fournisseur entre en vigueur sur la même clé le jour même.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
