Une carte-titre principale pour « Mercury 2.5 Preview vs Gemini 3.1 Pro », avec le sous-titre « Deux aperçus, à six mois d’écart ». Le panneau de gauche, intitulé « Mercury 2.5 Preview », affiche un éclair, une pastille « contexte 256K », une étiquette « texte uniquement » et une pastille « offre de lancement à 0,04 $ » ; le panneau de droite, intitulé « Gemini 3.1 Pro », affiche un ensemble de glyphes multimodaux (image, audio, vidéo), une pastille « contexte 1M », un badge « AA Index 57 au lancement » et une pastille « 2,00 $ / 12,00 $ ». Un fin badge « vs » se trouve entre les deux. Le logo OrcaRouter est incrusté dans le coin inférieur droit.
Guides & Insights

Mercury 2.5 Preview vs Gemini 3.1 Pro : Deux aperçus, six mois d'écart

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Les deux modèles de ce duel portent le mot « preview » dans leur nom, et c'est là que s'arrête la ressemblance. Mercury 2.5 Preview et Gemini 3.1 Pro sont tous deux des modèles de raisonnement que l'on peut appeler via une API aujourd'hui, mais ce sont des previews à des extrémités opposées de leur cycle de vie. Gemini 3.1 Pro, le modèle de raisonnement phare, est en preview depuis le 19 février 2026 — six mois d'évaluations indépendantes, de places dans les classements publics et de trafic de production derrière lui, avec un Artificial Analysis Intelligence Index de 57 au lancement, une entrée multimodale couvrant texte, image, audio et vidéo, un contexte d'un million de jetons, et un prix de 2,00 $ / 12,00 $ par million de jetons. Mercury 2.5 Preview, le LLM à diffusion d'Inception publié le 31 août 2026, a deux jours : un modèle textuel uniquement, avec un contexte de 256 000 jetons, une vitesse revendiquée de 1 107 jetons par seconde, un prix catalogue de 0,20 $ / 0,75 $ (environ 0,04 $ / 0,15 $ avec une remise jusqu'au 8 septembre), et pas un seul benchmark indépendant. Les qualifier tous deux de « previews » masque la véritable question : combien vaut une avance de six mois de preuves face à une manière fondamentalement plus rapide de générer du texte.

Ce qu'est réellement chaque modèle

Gemini 3.1 Pro est un modèle phare de raisonnement généraliste, fermé et multimodal. Il lit le texte, les images, l'audio et la vidéo, gère une fenêtre de contexte d'un million de jetons avec un plafond de sortie de 64 000 jetons, et ajuste dynamiquement sa profondeur de raisonnement — le fournisseur décrit une intensité de raisonnement à quatre niveaux qui évolue avec la complexité de la tâche. Ses chiffres de lancement — ARC-AGI-2 à 77,1 %, GPQA Diamond à 94,3 %, SWE-bench Verified à 80,6 %, Terminal-Bench 2.0 à 68,5 % — sont annoncés par le fournisseur, mais ils s'appuient sur six mois d'examen indépendant, dont une re-mesure par Artificial Analysis sur une échelle d'indice plus stricte, où le modèle atteint environ 46,5. Cette re-mesure est exactement ce que mérite un modèle mature : il a été suffisamment éprouvé pour que l'indice se durcisse autour de lui. Mercury 2.5 Preview est un modèle de diffusion — il génère et affine les jetons en parallèle plutôt qu'un à un — doté d'un raisonnement ajustable, d'appels d'outils parallèles et d'un JSON conforme au schéma, conçu pour les charges de travail où la latence se cumule, qu'Inception désigne ainsi : agents de recherche, pipelines vocaux, sous-agents de codage. Chaque affirmation de qualité qui lui est associée, y compris un bond de plus de 10 points par rapport à Mercury 2, émane du fournisseur lui-même, et aucun tiers ne l'a mesuré.

A screenshot of the Artificial Analysis model page for Inception's Mercury 2, the diffusion model Mercury 2.5 Preview builds on, showing its independently measured output speed of 684 tokens per second, its $0.25 / $0.75 per-1M pricing, its 128K context window, and its Intelligence Index score of 22.

Le contraste de spécification

Prix — Mercury 2.5 Preview : 0,20 $ / 0,75 $ par 1 M en entrée/sortie, ~0,04 $ / 0,15 $ de lancement jusqu’au 8 sept. Gemini 3.1 Pro : 2,00 $ / 12,00 $ par 1 M, passant à 4,00 $ / 18,00 $ au-delà de 200 K d’entrées.

Contexte / sortie — Mercury 2.5 Preview : contexte 256K. Gemini 3.1 Pro : contexte 1M, sortie max 64K.

Entrées — Mercury 2.5 Preview : texte uniquement. Gemini 3.1 Pro : texte, image, audio, vidéo, fichier.

Architecture — Mercury 2.5 Preview : LLM à diffusion, génération parallèle de jetons. Gemini 3.1 Pro : autorégressif, profondeur de raisonnement dynamique.

Vitesse — Mercury 2.5 Preview : 1 107 tokens/sec annoncés. Gemini 3.1 Pro : aucune annonce phare comparable.

Preuves — Mercury 2.5 Preview : données déclarées par le fournisseur uniquement. Gemini 3.1 Pro : AA Index de 57 au lancement (46,5 à la nouvelle échelle), ainsi qu’un long historique d’évaluations indépendantes.

A two-column scoreboard titled 'Mercury 2.5 Preview vs Gemini 3.1 Pro — the scoreboard'. Left column 'Mercury 2.5 Preview': 'Price: $0.20 / $0.75 (intro $0.04 / $0.15)', 'Inputs: text only', 'Context: 256K', 'Speed: 1,107 tok/s (claimed)', 'Independent score: none yet', 'Preview since: Aug 31, 2026'. Right column 'Gemini 3.1 Pro': 'Price: $2.00 / $12.00', 'Inputs: text, image, audio, video', 'Context: 1M', 'Speed: autoregressive', 'Independent score: AA Index 57 at launch', 'Preview since: Feb 19, 2026'. A footer reads 'Gemini index per Artificial Analysis; Mercury figures vendor-reported.' The OrcaRouter logo is composited in the bottom-right corner.

Le fossé de multimodalité est la différence décisive.

Pour la plupart des applications, cette comparaison est réglée avant même que les prix ou les benchmarks n'entrent dans l'équation, car Mercury 2.5 Preview ne peut pas voir. Gemini 3.1 Pro lit les captures d'écran, les diagrammes, l'audio et la vidéo — c'est le modèle que l'on pointe vers un PDF, un graphique, un enregistrement de réunion ou une interface utilisateur lorsqu'on veut une réponse sur quelque chose qui n'est pas déjà du texte. Mercury 2.5 Preview est exclusivement textuel par conception ; un modèle de langage à diffusion qui génère du texte en parallèle ne dispose d'aucun chemin d'entrée pour l'image ou l'audio. Pour une application axée sur les documents, un agent de vision ou tout produit multimodal, Gemini 3.1 Pro est le seul candidat possible, point final. La contrainte du texte seul de Mercury 2.5 Preview n'est pas une mention en petits caractères ; c'est la frontière qui détermine pour quelles charges de travail le modèle est même éligible.

Six mois de tests contre deux jours

Sur la base des preuves, ce n'est pas une compétition, et il est important de dire pourquoi sans détour. Gemini 3.1 Pro a été décortiqué par des laboratoires indépendants pendant six mois ; son score a été établi, re-mesuré et débattu, et c'est à cela que ressemble un modèle « digne de confiance ». Mercury 2.5 Preview ne dispose que d'une seule source d'information — son créateur — et cette source affirme un gain d'intelligence de plus de 10 points par rapport à Mercury 2 et une parité avec le niveau à coût optimisé des modèles de pointe. Ces deux affirmations peuvent être vraies. Aucune n'a été confirmée par quiconque en dehors d'Inception, et le modèle est trop récent pour que cela soit autre chose qu'attendu. L'asymétrie ne tient pas au fait que l'un serait meilleur ; elle tient au fait que l'un est connaissable et que l'autre ne l'est pas encore.

Là où la vitesse de Mercure gagne réellement

Le cas honnête pour Mercury 2.5 Preview est étroit, textuel uniquement, et réel. La génération parallèle de jetons change l’arithmétique de la latence d’une manière qu’aucun modèle autorégressif — y compris Gemini 3.1 Pro — ne peut suivre, car un modèle autorégressif est sériel par construction. Pour un pipeline vocal, l’ironie est que l’entrée et la sortie sont audio, mais que la réflexion entre les deux est textuelle : une couche de raisonnement textuel rapide est exactement ce qui rend un agent vocal réactif. Pour un agent de recherche effectuant des appels d’outils répétés, et pour un sous-agent de codage déclenchant de nombreuses petites complétions par tâche, la latence par appel se cumule en vitesse perçue. Au prix de lancement — 0,04 $ en entrée, 0,15 $ en sortie — Mercury 2.5 Preview est environ 80 fois moins cher que le tarif de sortie standard de Gemini 3.1 Pro, ce qui en fait non seulement un modèle plus rapide, mais aussi une catégorie de coût différente pour le raisonnement textuel à grand volume. La réserve qui doit accompagner chacune de ces phrases : la vitesse est annoncée, la parité de qualité est annoncée, et aucune mesure indépendante n’existe.

Tarification : le premium long-contexte de Gemini face à l'offre teaser de Mercury

La grille tarifaire de Gemini 3.1 Pro comporte un détail à connaître avant de comparer les chiffres affichés : au-delà de 200K tokens d'entrée, le prix passe de $2.00 / $12.00 à $4.00 / $18.00 par million. Sur un modèle à contexte de 1M, ce surcoût pour long contexte n'est pas un cas marginal — c'est le prix à payer pour exploiter réellement la fenêtre qui a fait la renommée du modèle. Mercury 2.5 Preview ne comporte aucun palier de ce type, et son contexte de 256K ne devrait que rarement franchir le seuil du long contexte. Mais le prix bas de Mercury est un prix d'appel valable jusqu'au 8 septembre, tandis que celui de Gemini est un tarif public stable. Pour comparer, confrontez le prix catalogue de Mercury — $0.20 / $0.75 — au tarif standard de Gemini, et non au montant remisé : la remise est l'incitation à tester, pas le tarif à retenir pour planifier.

La décision de routage

Les deux modèles sont routables aujourd’hui, et cela change la façon dont vous devez traiter chacun d’eux. Gemini 3.1 Pro est sur OrcaRouter sous google/gemini-3.1-pro-preview, au prix catalogue du fournisseur, répercuté à 0 % de marge, si bien que les paliers standard et long-contexte coûtent exactement ce que le fournisseur publie, aux côtés de plus de 200 autres modèles sur une seule clé API. Un badge de préversion est précisément le genre de chose à contourner plutôt qu’à miser dessus — le panneau de taux d’erreur de la page du modèle est là pour une raison, et le basculement automatique signifie qu’une réponse de préversion dégradée est routée vers un second fournisseur sans modification de code. Mercury 2.5 Preview n’est pas encore sur OrcaRouter ; Inception le propose via sa propre API et plusieurs plateformes tierces. Un modèle de deux jours que vous ne pouvez pas encore placer derrière un basculement est un candidat de test, pas une dépendance de production. Le jour où un fournisseur le référence, la même répercussion s’applique et la remise de lancement arrive ici le jour même — c’est à ce moment que ce face-à-face devient une règle de routage plutôt qu’une décision.

Le verdict honnête est que ces deux aperçus répondent à des questions différentes. Gemini 3.1 Pro répond à la question « sur quel modèle devrais-je construire mon produit aujourd'hui ? » — il est multimodal, à contexte long, testé indépendamment et stable, à un prix qui reflète tout cela. Mercury 2.5 Preview répond à la question « à quelle vitesse le raisonnement textuel peut-il physiquement aller ? » — et son architecture de vitesse est l'élément le plus intéressant du modèle, en attendant qu'un laboratoire indépendant confirme si la qualité qui l'accompagne est réelle. Si votre charge de travail est multimodale ou à long contexte, le choix est déjà fait. Si elle est purement textuelle, à latence cumulative et sensible au prix, Mercury 2.5 Preview est le pari à surveiller — et le 8 septembre est la date à laquelle il faudra le juger.

A screenshot of the OrcaRouter model page for Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview) showing the model header, the Home > Models > Google breadcrumb, the February 19, 2026 preview start date, and the description of Google's frontier reasoning model.
© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube