Une carte de titre héroïque pour « Mercury 2.5 vs Mercury 2.5 Preview » avec le sous-titre « Un modèle de diffusion, deux dates de lancement — ce que la mise à niveau de production change réellement ». Trois pastilles sont alignées en dessous : un glyphe à colonnes divisées intitulé « SAME ENGINE », un glyphe éclair intitulé « 1,107 tok/s CLAIM » et un glyphe horloge intitulé « AUG 31 vs SEP 8 ». Le logo OrcaRouter se trouve dans le coin inférieur droit.
Guides & Insights

Mercury 2.5 vs Mercury 2.5 Preview : Un modèle de diffusion, deux dates de lancement

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Voici une comparaison directe dans laquelle les deux concurrents partagent une fiche modèle. Le Mercury 2.5 Preview d'Inception, sorti le 31 août 2026, et le Mercury 2.5, sorti le 8 septembre 2026, sont le même modèle de langage à diffusion à huit jours d'écart : un canal d'aperçu qu'Inception a ouvert aux développeurs, et la version de production « prête pour l'entreprise » lancée une semaine plus tard. Inception n'a divulgué ni un point de contrôle différent, ni une vitesse différente, ni un prix différent pour le Mercury 2.5 — et les chiffres qui ont effectivement bougé entre les deux annonces ressemblent à un nettoyage, pas à un nouveau modèle. Le chiffre du contexte a été corrigé de 256K sur la page d'aperçu à 260K au lancement, et le gain d'intelligence par rapport au Mercury 2 a été reformulé, passant de « plus de 10 points » (documents d'aperçu) à « 40 pour cent » (documents de lancement). Le moteur, la performance de 1 107 tokens par seconde et la grille tarifaire sont identiques. Ce n'est donc pas la classique bataille de fiches techniques, et en gonfler une serait malhonnête. La comparaison qui compte entre ces deux noms porte sur le conditionnement et le calendrier : ce que le lancement de la production a réellement changé, ce que le label « Preview » vous disait vraiment, et quel nom vos appels API devraient utiliser désormais.

Pourquoi un modèle est comparé à lui-même

En général, les fournisseurs présentent un modèle en aperçu puis l’intègrent discrètement dans le nom principal ; la fiche de l’aperçu disparaît et personne n’écrit la comparaison. Inception, au contraire, a fait figurer les deux noms côte à côte pendant une semaine, et l’identité d’aperçu n’est retirée qu’à présent — c’est exactement pour cela que cette comparaison a du contenu. La Preview était le chemin rapide qu’Inception a utilisé pour mettre son pari sur la diffusion devant les développeurs. Elle est apparue le 31 août avec la fiche technique qui est désormais celle de Mercury 2.5 : un LLM à diffusion (dLLM) qui génère et affine des blocs de jetons en parallèle au lieu d’émettre un jeton à la fois ; une cadence revendiquée de 1 107 jetons par seconde sur des GPU standards ; une revendication de moins de 300 ms pour le délai avant le premier jeton ; une fenêtre de contexte de 260 000 jetons avec une sortie de 65 536 jetons ; des niveaux de raisonnement réglables ; une utilisation native d’outils, des appels d’outils parallèles et une sortie structurée. Chacun de ces chiffres est propre à Inception, et aucun laboratoire indépendant n’avait mesuré le modèle lorsque la Preview est sortie.

Le 8 septembre, Inception a lancé Mercury 2.5 comme "le prochain niveau d'intelligence pour les LLM de diffusion" et son modèle de raisonnement le plus rapide en production — prêt pour l'entreprise, destiné aux agents vocaux, aux sous-agents de codage, à la recherche d'entreprise et aux charges de travail de support. Mêmes spécifications, même positionnement, même grille tarifaire. Le lancement a également présenté en avant-première deux produits frères qui clarifient la direction que prend Inception : Mercury Voice, un dLLM réglé pour un premier token en moins de 170 ms pour les agents vocaux, et Mercury Router, qui achemine les invites entre les modèles selon la qualité, la vitesse et le coût. Mercury 2.5 est le produit phare d'une famille conçue pour des charges de travail sensibles à la latence et axées sur les agents, plutôt que pour le niveau de qualité de pointe.

Ce que le lancement du 8 septembre a réellement changé

Comparez les deux noms ligne par ligne et la différence n'est pas le moteur — c'est tout ce qui entoure le moteur :

Statut — Mercury 2.5 Preview : une préversion fermée qui pourrait « changer le comportement ou la disponibilité ». Mercury 2.5 : un modèle de production lancé avec un engagement de niveau entreprise, un canal de vente et une liste de production datée.

Identité — La page des modèles d'Inception répertorie désormais Mercury 2.5, Mercury Voice et Mercury Router, sans aucune trace de Preview, et sa note de bas de page sur le support cite Mercury 1, Mercury 2 et Mercury Edit 2 comme les modèles qui « restent pris en charge pour les clients existants ». Preview n'apparaît dans aucune des deux listes. Du point de vue du fournisseur, le label Preview a été absorbé dans Mercury 2.5.

Point de terminaison — La plateforme de développement d'Inception sert le modèle sous le nom mercury-2.5, et la liste de production mise en ligne le 8 septembre est celle qui dessert le nouveau trafic. Sur le catalogue qui a d'abord référencé le Preview fin août, le nom du Preview ne résout désormais plus vers aucun point de terminaison en service, tandis que la liste Mercury 2.5 ajoutée le 8 septembre répond. Quiconque a codé contre le Preview par son nom doit se réorienter vers Mercury 2.5 et vérifier ce que son fournisseur facture réellement — l'identifiant que vous avez intégré la première semaine est celui qui est retiré.

Prix — liste identique et remise identique. Les deux sont à 0,20 $ par million d’entrées et 0,75 $ par million de sorties, avec les entrées en cache à 0,02 $, et les deux ont été lancés avec environ 80 % de remise : 0,04 $ / 0,15 $, en cache 0,004 $. La remise de la Preview était explicitement limitée dans le temps au 8 septembre ; Mercury 2.5 est sorti avec la même offre à 80 %, et le tarif réduit est ce que sa liste de production affiche encore au moment de la rédaction. C’est là le piège, détaillé ci-dessous.

Intégration — le lancement en production a ajouté une allocation de jetons gratuits pour les nouveaux comptes développeurs — les supports de lancement citent 100 millions de jetons — et a ouvert un parcours de contact entreprise qu'une version d'aperçu n'avait jamais eue.

Preuves — inchangé. Aucun des deux noms ne dispose de benchmark indépendant, et les affirmations du fournisseur sont les mêmes, simplement formulées un peu différemment : un bond d'intelligence « de plus de 10 points » par rapport à Mercury 2 dans les documents de présentation devient une augmentation « de 40 pour cent » dans les documents de lancement, accompagné de la même parité annoncée avec le niveau frontière optimisé pour les coûts (GPT-5.6 Luna en mode effort faible, Gemini 3.5 Flash-Lite, Claude Haiku 4.5) et des mêmes résultats rapportés par le fournisseur : 79 % sur GPQA Diamond et 77 % sur IFBench. Une affirmation reformulée n'est pas une affirmation vérifiée.

A two-column comparison card titled 'Mercury 2.5 Preview vs Mercury 2.5 — what actually changed'. Left column 'Mercury 2.5 Preview, released Aug 31, 2026': Release Aug 31, 2026; Status closed preview; Engine diffusion dLLM, 260K ctx; Serving preview id retired from the catalog; Price $0.20/$0.75 list, 80% off intro; Evidence none independent. Right column 'Mercury 2.5, released Sep 8, 2026': Release Sep 8, 2026; Status production, enterprise-ready; Engine same, no new checkpoint disclosed; Serving mercury-2.5 id live, serving traffic; Price $0.20/$0.75 list, 80% off launch; Evidence none independent. Footer reads 'Same engine under two labels — the delta is lifecycle, not spec. All figures vendor-reported.' The OrcaRouter logo is in the bottom-right corner.

Le piège tarifaire au cœur de l'association

Comme les deux noms portent le même prix catalogue et la même remise teaser de 80 %, il est facile de supposer qu'ils coûtent toujours le même prix. Ce n'est pas forcément le cas. La remise de la Preview s'est arrêtée net le 8 septembre ; celle de lancement de Mercury 2.5 repart sur un nouveau compte à rebours. Pendant une semaine, il était tout à fait possible de payer 0,20 $ / 0,75 $ pour un appel à la Preview tandis que le même moteur répondait à 0,04 $ / 0,15 $ sous son nom de production — ou, plus probablement, d'être sur un identifiant de preview qui avait discrètement cessé de servir pendant que la facture continuait d'arriver. Une remise de lancement qui expire par endpoint est exactement le genre de petites lignes qui transforme une histoire de « même modèle, même prix » en une véritable différence de coût.

Le chiffre à retenir est le prix catalogue, et le conseil à retenir est de budgétiser en conséquence : 0,20 $ / 0,75 $ par million, entrée en cache 0,02 $ — ce qui est bon marché pour un modèle de raisonnement avec un contexte de 260 K, confortablement en dessous du niveau phare, mais pas les 0,04 $ / 0,15 $ annoncés par les bannières de lancement. Traitez le tarif réduit comme un prix d’essai à durée limitée, vérifiez ce que votre fournisseur vous facture pour l’identifiant exact du modèle dans votre code plutôt que pour le nom sur la page marketing, et si vous avez commencé sur Preview, migrez vers Mercury 2.5 avant qu’une expiration ou un point de terminaison retiré ne décide à votre place.

C'est aussi le type de problème qu'une couche de routage sert à éliminer. Un routeur de modèles qui transmet les prix catalogue des fournisseurs à 0% de majoration affiche le prix réellement facturé par un fournisseur, mis à jour le jour même où une remise de lancement s'applique ou expire, et le basculement automatique assure la continuité des appels lorsqu'un point de terminaison vous est retiré. Mercury 2.5 n'est pas sur OrcaRouter au moment où j'écris ces lignes — Inception le dessert via sa propre API et plusieurs plateformes tierces — donc pour l'instant, la page des modèles du fournisseur est la source de vérité concernant le tarif. Dès qu'un fournisseur le répertorie, ces mécanismes de répercussion sont ce que vous obtenez sur une seule clé, et une baisse de prix ou une expiration de remise apparaît de notre côté le jour même de l'annonce.

Le problème de preuve que partagent les deux noms.

Le bilan honnête de cette paire est court, car les deux colonnes représentent le même modèle avec la même absence de preuve. Ni Mercury 2.5 ni Mercury 2.5 Preview ne disposent d'un score d'indice indépendant, d'une exécution reproduite ou d'un placement en arène en date du 9 septembre 2026. Les propres affirmations d'Inception — le saut d'intelligence par rapport à Mercury 2, la parité avec le niveau Haiku 4.5, les 79 % GPQA Diamond, les 1 107 tokens par seconde — ne sont que la parole de l'entreprise, et elles sont identiques pour les deux noms parce que le modèle est identique.

La seule preuve indépendante disponible dans cette gamme indique comment interpréter l’annonce de vitesse. Artificial Analysis a mesuré Mercury 2, le prédécesseur, à 684 tokens par seconde sur l’endpoint de production, lui attribuant un score de 22 sur l’Intelligence Index — véritablement rapide, et la preuve que l’approche par diffusion n’est pas un mirage, mais bien en deçà des quelque 1 000 tokens par seconde qu’Inception annonce pour ce modèle sur le matériel Blackwell. Attendez-vous à un écart similaire entre le chiffre de 1 107 de Mercury 2.5 et ce qu’un endpoint partagé et multi-tenant délivre réellement en conditions réelles. La même prudence vaut pour la qualité : un tout nouveau modèle de diffusion, évalué uniquement par son créateur, ne doit pas être cru sur parole lorsqu’il prétend égaler Claude Haiku 4.5, tant qu’un tiers ne l’a pas testé.

A screenshot of the Artificial Analysis model page for Inception's Mercury 2, the predecessor Mercury 2.5 builds on, showing its Intelligence Index score of 22, its independently measured output speed of 684 tokens per second, its $0.25 input / $0.75 output pricing, and its 128K context window.

Les trackers qui ont commencé à couvrir la sortie reflètent exactement cet état des lieux. Un enregistrement BenchLM pour Mercury 2.5, publié le 8 septembre, n'attribue au modèle ni score public ni classement public ; il reprend les chiffres de 79 % GPQA Diamond et 77 % IFBench d'Inception, explicitement désignés comme rapportés par le fournisseur, et note que la vitesse d'exécution indépendante n'a pas été mesurée. La première entrée de l'index Artificial Analysis, un placement LMArena, ou une exécution GPQA reproduite feront passer Mercury 2.5 d'une simple affirmation à un objet comparable — et cela s'appliquera aux deux noms à la fois, car il n'y a qu'un seul modèle à mesurer.

A screenshot of the BenchLM model record for Mercury 2.5 (captured September 9, 2026), showing 'No public score yet' and 'No public rank', the model noted as released September 8, 2026 with a 260K context window, and the decision note that Inception reports 79% on GPQA Diamond and 77% on IFBench as provider-reported results with independent runtime speed not yet measured.

Quel nom devriez-vous appeler ?

Nouvelle intégration, sans legacy : appelez-la Mercury 2.5 et ignorez la Preview. Le nom de production comporte le même moteur, la même remise pour l’instant, les conditions d’entreprise et la garantie qu’il s’agit de l’identifiant que le fournisseur sert réellement. La Preview ajoute un risque d’instabilité et rien d’autre.

Vous avez déjà intégré la Preview : vérifiez dès aujourd'hui ce que votre fournisseur expose sous ce nom et ce qu'il vous facture pour cela. Repointez votre client vers l'identifiant Mercury 2.5 et confirmez le tarif. Conserver le nom Preview dans le code de production revient désormais à parier qu'un canal d'aperçu explicitement limité dans le temps survivra à son propre retrait.

Trafic d'entreprise ou critique pour la production : Mercury 2.5 via le parcours entreprise d'Inception, et non pas une simple étiquette d'aperçu sans engagement derrière. Les besoins en voix et en routage doivent être orientés respectivement vers Mercury Voice et Mercury Router, qui sont eux-mêmes encore au stade d'aperçu.

Quiconque évalue le palier de diffusion : les deux noms désignent la même cible d'évaluation, donc exécutez votre évaluation contre Mercury 2.5 une seule fois et considérez le résultat comme s'appliquant à la ligne de modèles. Prévoyez un budget au prix catalogue et pondérez les affirmations du fournisseur comme des hypothèses jusqu'à ce qu'un score indépendant soit disponible.

Que regarder

Trois éléments régleront ce duo au cours des prochaines semaines. Premièrement, le premier benchmark indépendant — un classement dans un indice ou une exécution reproduite de GPQA ou AIME — qui testera l'affirmation de parité qui constitue tout le pari commercial. Deuxièmement, la question de savoir si l'identité Preview disparaît entièrement de l'écosystème des modèles, comme la propre page des modèles d'Inception le laisse déjà entendre. Troisièmement, ce qu'il advient de la remise de lancement de 80 % maintenant que la date du 8 septembre à laquelle la Preview était rattachée est passée : une prolongation rend Mercury 2.5 structurellement bon marché, tandis qu'un retour à 0,20 $ / 0,75 $ le rend simplement compétitif. D'ici là, la bonne réponse à « Mercury 2.5 ou Mercury 2.5 Preview ? » est qu'il s'agit d'un seul et même modèle, et que vous devriez appeler celui qui est encore un produit.