Una tarjeta de título principal para 'Mercury 2.5 vs Mercury 2.5 Preview' con el subtítulo 'Un modelo de difusión, dos fechas de lanzamiento — lo que realmente cambia la actualización de producción'. Debajo hay tres chips: un glifo de columnas divididas etiquetado como 'MISMO MOTOR', un glifo de rayo etiquetado como 'AFIRMACIÓN: 1,107 tok/s' y un glifo de reloj etiquetado como 'AGO 31 vs SEP 8'. El logotipo de OrcaRouter está en la esquina inferior derecha.
Guides & Insights

Mercury 2.5 vs Mercury 2.5 Preview: Un modelo de difusión, dos fechas de lanzamiento

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Aquí tienes un cara a cara en el que ambos contendientes comparten una misma ficha técnica. El Mercury 2.5 Preview de Inception, lanzado el 31 de agosto de 2026, y el Mercury 2.5, lanzado el 8 de septiembre de 2026, son el mismo modelo de lenguaje de difusión con ocho días de diferencia: un canal de vista previa que Inception abrió para desarrolladores, y la versión de producción "lista para empresas" que lanzó una semana después. Inception no ha revelado un checkpoint diferente, una velocidad distinta ni un precio diferente para Mercury 2.5 — y las cifras que sí cambiaron entre los dos anuncios parecen una corrección de números, no un modelo nuevo. La cifra de contexto se corrigió de 256K en la página de vista previa a 260K en el lanzamiento, y la mejora de inteligencia frente a Mercury 2 pasó de "más de 10 puntos" (materiales de vista previa) a "40 por ciento" (materiales de lanzamiento). El motor, la afirmación de 1.107 tokens por segundo y la hoja de precios son idénticos. Así que esto no es la típica pelea de especificaciones, y rellenar una de ellas sería deshonesto. La comparación que importa entre estos dos nombres tiene que ver con el empaquetado y el momento: qué cambió realmente el lanzamiento de producción, qué te estaba diciendo realmente la etiqueta de Vista Previa, y qué nombre deberían usar ahora tus llamadas a la API.

¿Por qué se compara un modelo consigo mismo?

Los proveedores suelen previsualizar un modelo y luego integrarlo silenciosamente en el nombre principal; la lista de vista previa desaparece y nadie cubre la comparativa. Inception, en cambio, mantuvo los dos nombres lado a lado durante una semana, y la identidad de vista previa solo ahora se está retirando, que es precisamente por lo que esta comparativa tiene contenido. La Preview fue la vía rápida que Inception utilizó para llevar su apuesta por la difusión ante los desarrolladores. Apareció el 31 de agosto con la ficha técnica que ahora es la de Mercury 2.5: un LLM de difusión (dLLM) que genera y refina bloques de tokens en paralelo en lugar de emitir un token a la vez; una velocidad declarada de 1.107 tokens por segundo en GPU estándar; un tiempo hasta el primer token declarado de menos de 300 ms; una ventana de contexto de 260K tokens con salida de 65.536 tokens; niveles de razonamiento ajustables; uso nativo de herramientas, llamadas a herramientas en paralelo y salida estructurada. Cada una de esas cifras es propia de Inception, y ningún laboratorio independiente había medido el modelo cuando se publicó la Preview.

El 8 de septiembre, Inception lanzó Mercury 2.5 como «el siguiente nivel de inteligencia para los LLM de difusión» y su modelo de razonamiento más rápido en producción: listo para empresas, dirigido a agentes de voz, subagentes de codificación, búsqueda empresarial y cargas de trabajo de soporte. Mismas especificaciones, mismo posicionamiento, misma lista de precios. El lanzamiento también anticipó dos modelos hermanos que aclaran hacia dónde se dirige Inception: Mercury Voice, un dLLM ajustado para lograr un primer token en menos de 170 ms para agentes de voz, y Mercury Router, que enruta los prompts entre modelos según calidad, velocidad y costo. Mercury 2.5 es el buque insignia de una familia construida para cargas de trabajo de agentes sensibles a la latencia, más que para el nivel de calidad de frontera.

Lo que realmente cambió el lanzamiento del 8 de septiembre

Compare los dos nombres línea por línea y el delta no es el motor — es todo lo que envuelve al motor:

Estado — Mercury 2.5 Preview: una vista previa cerrada que podría "cambiar el comportamiento o la disponibilidad". Mercury 2.5: un modelo de producción lanzado con un compromiso de preparación empresarial, un canal de ventas y un listado de producción con fecha.

Identidad — La página de modelos de Inception ahora incluye Mercury 2.5, Mercury Voice y Mercury Router, sin rastro de la Preview, y su nota al pie de soporte menciona Mercury 1, Mercury 2 y Mercury Edit 2 como los modelos que «siguen teniendo soporte para clientes existentes». La Preview no aparece en ninguna de las dos listas. Para el proveedor, la etiqueta Preview ha quedado absorbida por Mercury 2.5.

Endpoint — La plataforma para desarrolladores de Inception expone el modelo como mercury-2.5, y la entrada de producción lanzada el 8 de septiembre es donde se atiende el tráfico nuevo. En el catálogo que presentó el Preview por primera vez a finales de agosto, el nombre Preview ya no resuelve a ningún endpoint de servicio activo, mientras que la entrada de Mercury 2.5, añadida el 8 de septiembre, sí responde. Quien haya programado contra el Preview por nombre debe apuntar de nuevo a Mercury 2.5 y confirmar qué le está cobrando realmente su proveedor: el id que integró durante la primera semana es el que se retira.

Precio — lista idéntica y descuento idéntico. Ambos cuestan $0.20 por millón de entrada y $0.75 por millón de salida, con entrada en caché a $0.02, y ambos se lanzaron con aproximadamente un 80% de descuento: $0.04 / $0.15, caché $0.004. El descuento de la Preview estaba explícitamente limitado al 8 de septiembre; Mercury 2.5 se lanzó con la misma oferta del 80%, y la tarifa con descuento es la que su listado de producción aún muestra al momento de escribir esto. Esa es la trampa, desglosada a continuación.

Onboarding — el lanzamiento de producción añadió una asignación de tokens gratuitos para cuentas de nuevos desarrolladores — los materiales del lanzamiento citan 100 millones de tokens — y abrió una vía de contacto empresarial que una vista previa nunca tuvo.

Evidencia — sin cambios. Ninguno de los dos nombres tiene un benchmark independiente, y las afirmaciones del proveedor son las mismas afirmaciones con una redacción ligeramente diferente: un salto de inteligencia de "más de 10 puntos" sobre Mercury 2 en los materiales de prelanzamiento se convierte en un aumento del "40 por ciento" en los materiales de lanzamiento, junto con la misma paridad declarada con el nivel frontera optimizado en costos (GPT-5.6 Luna en modo de bajo esfuerzo, Gemini 3.5 Flash-Lite, Claude Haiku 4.5) y el mismo 79% reportado por el proveedor en GPQA Diamond y 77% en IFBench. Una afirmación reformulada no es una afirmación verificada.

A two-column comparison card titled 'Mercury 2.5 Preview vs Mercury 2.5 — what actually changed'. Left column 'Mercury 2.5 Preview, released Aug 31, 2026': Release Aug 31, 2026; Status closed preview; Engine diffusion dLLM, 260K ctx; Serving preview id retired from the catalog; Price $0.20/$0.75 list, 80% off intro; Evidence none independent. Right column 'Mercury 2.5, released Sep 8, 2026': Release Sep 8, 2026; Status production, enterprise-ready; Engine same, no new checkpoint disclosed; Serving mercury-2.5 id live, serving traffic; Price $0.20/$0.75 list, 80% off launch; Evidence none independent. Footer reads 'Same engine under two labels — the delta is lifecycle, not spec. All figures vendor-reported.' The OrcaRouter logo is in the bottom-right corner.

La trampa de precios en el corazón del emparejamiento

Debido a que los dos nombres tienen el mismo precio de lista y el mismo teaser del 80%, es fácil suponer que siempre cuestan lo mismo. No tienen por qué. El descuento de Preview se cortó en seco el 8 de septiembre; el descuento de lanzamiento de Mercury 2.5 corre con un cronómetro nuevo. Durante una semana fue totalmente posible estar pagando $0.20 / $0.75 por una llamada a Preview mientras el mismo motor respondía a $0.04 / $0.15 bajo su nombre de producción — o, más probablemente, estar en un id de preview que en silencio había dejado de atender peticiones mientras la factura seguía llegando. Un descuento de lanzamiento que caduca según el endpoint es exactamente la clase de letra pequeña que convierte una historia de "mismo modelo, mismo precio" en una diferencia de costo real.

La cifra duradera es el precio de lista, y el consejo duradero es presupuestar en torno a ella: $0.20 / $0.75 por millón, entrada en caché $0.02 — barato para un modelo de razonamiento con un contexto de 260K, cómodamente por debajo del nivel insignia, pero no los $0.04 / $0.15 que anuncian los banners de lanzamiento. Trata la tarifa con descuento como un precio de prueba con una vida útil, verifica qué te factura tu proveedor por el id exacto del modelo en tu código en lugar de por el nombre en la página de marketing, y si te incorporaste con el Preview, migra a Mercury 2.5 antes de que una caducidad o un endpoint retirado decida por ti.

Esta es también el tipo de problema que una capa de enrutamiento existe para eliminar. Un enrutador de modelos que transmite los precios de lista de los proveedores con un margen de beneficio del 0% muestra el precio que un proveedor realmente factura, actualizado el mismo día en que un descuento de lanzamiento entra en vigor o caduca, y la conmutación automática por error mantiene las llamadas en funcionamiento cuando un endpoint se retira bajo tus pies. Mercury 2.5 no está en OrcaRouter al momento de escribir esto — Inception lo está sirviendo a través de su propia API y de varias plataformas de terceros — así que por ahora la página de modelos del proveedor es la fuente de verdad sobre la tarifa. En el momento en que un proveedor lo incluya, esos mecanismos de transmisión son lo que obtienes con una sola clave, y una bajada de precio o la caducidad de un descuento se refleja en nuestro lado el mismo día en que se anuncia.

El problema de la evidencia que ambos nombres comparten.

El marcador honesto de este emparejamiento es breve, porque las dos columnas son el mismo modelo con la misma ausencia de pruebas. Ni Mercury 2.5 ni Mercury 2.5 Preview tienen una puntuación de índice independiente, una ejecución reproducida o una ubicación en la arena al 9 de septiembre de 2026. Las afirmaciones de la propia Inception — el salto de inteligencia sobre Mercury 2, la paridad con el nivel de Haiku 4.5, el 79% en GPQA Diamond, los 1.107 tokens por segundo — son solo la palabra de la empresa, y son idénticas para ambos nombres porque el modelo es idéntico.

La única evidencia independiente dentro de la familia apunta a cómo interpretar la afirmación sobre la velocidad. Artificial Analysis midió Mercury 2, el predecesor, a 684 tokens por segundo en el endpoint de producción y le asignó 22 puntos en el Intelligence Index — realmente rápido, y prueba de que el enfoque de difusión no es un espejismo, aunque muy por debajo de los aproximadamente 1000 tokens por segundo que Inception anuncia para ese modelo en hardware Blackwell. Cabe esperar una brecha similar entre la cifra de 1107 de Mercury 2.5 y lo que un endpoint compartido con múltiples inquilinos ofrece de verdad bajo carga real. La misma cautela se aplica a la calidad: un modelo de difusión recién salido, medido solo por su creador, no debería tomarse al pie de la letra en cuanto a que iguala a Claude Haiku 4.5 hasta que un tercero lo ejecute.

A screenshot of the Artificial Analysis model page for Inception's Mercury 2, the predecessor Mercury 2.5 builds on, showing its Intelligence Index score of 22, its independently measured output speed of 684 tokens per second, its $0.25 input / $0.75 output pricing, and its 128K context window.

Los rastreadores que han comenzado a cubrir el lanzamiento reflejan exactamente ese estado de la cuestión. Un registro de BenchLM para Mercury 2.5, publicado el 8 de septiembre, no otorga al modelo puntuación pública ni rango público; incluye las cifras del 79% en GPQA Diamond y del 77% en IFBench de Inception, etiquetadas explícitamente como reportadas por el proveedor, y señala que la velocidad de ejecución independiente no ha sido medida. La primera entrada del índice de Artificial Analysis, una ubicación en LMArena o una ejecución reproducida de GPQA convertirá a Mercury 2.5 de una afirmación en un objeto comparable — y se aplicará a ambos nombres a la vez, porque solo hay un modelo que medir.

A screenshot of the BenchLM model record for Mercury 2.5 (captured September 9, 2026), showing 'No public score yet' and 'No public rank', the model noted as released September 8, 2026 with a 260K context window, and the decision note that Inception reports 79% on GPQA Diamond and 77% on IFBench as provider-reported results with independent runtime speed not yet measured.

¿Qué nombre deberías usar?

Nueva integración, sin legado: llama a Mercury 2.5 e ignora la Preview. El nombre de producción lleva el mismo motor, el mismo descuento por ahora, las condiciones empresariales y la garantía de que es el id que el proveedor está sirviendo realmente. La Preview añade riesgo de inestabilidad y nada más.

¿Ya has integrado el Preview? Comprueba hoy qué ofrece tu proveedor bajo ese nombre y cuánto te factura por ello. Vuelve a apuntar tu cliente al id de Mercury 2.5 y confirma la tarifa. Mantener el nombre Preview en el código de producción es ahora apostar a que un canal de vista previa explícitamente acotado en el tiempo sobreviva a su propia retirada.

Tráfico empresarial o crítico de producción:Mercury 2.5 pasa por la vía empresarial de Inception, no por una etiqueta de vista previa sin compromiso real alguno detrás. Las necesidades de voz y de enrutamiento apuntan a Mercury Voice y Mercury Router, respectivamente, que siguen siendo versiones preliminares.

Cualquiera que evalúe el nivel de difusión: ambos nombres son el mismo objetivo de evaluación, así que ejecuta tu evaluación contra Mercury 2.5 una vez y considera el resultado como aplicable a la línea de modelos. Presupuesta al precio de lista y trata las afirmaciones del proveedor como hipótesis hasta que llegue una puntuación independiente.

Qué ver

Tres cosas resolverán este emparejamiento durante las próximas semanas. Primero, el primer benchmark independiente — una posición en un índice o una ejecución reproducida de GPQA o AIME — que pondrá a prueba la afirmación de paridad que es toda la apuesta comercial. Segundo, si la identidad Preview desaparece por completo del ecosistema de modelos, como ya implica la propia página de modelos de Inception. Tercero, qué sucede con el descuento de lanzamiento del 80% ahora que ha pasado la fecha del 8 de septiembre a la que estaba vinculada la Preview: una extensión hace que Mercury 2.5 sea estructuralmente barato, mientras que un retorno a $0.20 / $0.75 lo hace meramente competitivo. Hasta entonces, la respuesta correcta a "¿Mercury 2.5 o Mercury 2.5 Preview?" es que se trata de un solo modelo, y deberías estar llamando al que sigue siendo un producto.