
Mercury 2.5 Preview vs Gemini 3.1 Pro: Dos versiones preliminares, con seis meses de diferencia
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0259Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0258Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0166Inteligencia82Código
- AlibabaNUEVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligencia72Código
- DeepSeekNUEVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
Ambos modelos en este enfrentamiento llevan la palabra "preview" en sus nombres, y ahí es donde terminan las similitudes. Mercury 2.5 Preview y Gemini 3.1 Pro son ambos modelos de razonamiento a los que puedes llamar desde una API hoy, pero son versiones preliminares en extremos opuestos de su vida. Gemini 3.1 Pro, el modelo de razonamiento insignia, ha estado en versión preliminar desde el 19 de febrero de 2026 — seis meses de evaluaciones independientes, posiciones en tablas de clasificación públicas y tráfico de producción a sus espaldas, con un Artificial Analysis Intelligence Index de 57 en su lanzamiento, entrada multimodal para texto, imagen, audio y video, un contexto de 1M de tokens y un precio de $2.00 / $12.00 por millón de tokens. Mercury 2.5 Preview, el LLM de difusión de Inception lanzado el 31 de agosto de 2026, tiene dos días: un modelo solo de texto con contexto de 256K, una velocidad reclamada de 1.107 tokens por segundo, un precio de lista de $0.20 / $0.75 (alrededor de $0.04 / $0.15 con un descuento hasta el 8 de septiembre), y ni un solo benchmark independiente. Llamar a ambos "previews" oculta la pregunta real, que es cuánto vale una ventaja inicial de seis meses de evidencia frente a una forma fundamentalmente más rápida de generar texto.
Lo que cada modelo realmente es
Gemini 3.1 Pro es un modelo insignia de razonamiento cerrado, multimodal y de propósito general. Lee texto, imágenes, audio y vídeo, maneja una ventana de contexto de 1M de tokens con un límite de salida de 64K, y ajusta su profundidad de razonamiento de forma dinámica — el proveedor describe una intensidad de razonamiento de cuatro niveles que escala con la complejidad de la tarea. Sus cifras de lanzamiento — ARC-AGI-2 al 77,1 %, GPQA Diamond al 94,3 %, SWE-bench Verified al 80,6 %, Terminal-Bench 2.0 al 68,5 % — las reporta el proveedor, pero se asientan sobre seis meses de escrutinio independiente, incluida una nueva medición de Artificial Analysis en una escala de índice más estricta en la que el modelo obtiene alrededor de 46,5. Esa nueva medición es exactamente lo que un modelo maduro se gana: lo han probado con la dureza suficiente como para que el índice se vuelva más exigente a su alrededor. Mercury 2.5 Preview es un modelo de difusión — genera y refina tokens en paralelo en lugar de uno a uno — con razonamiento ajustable, llamadas a herramientas en paralelo y JSON alineado con esquemas, diseñado para las cargas de trabajo en las que la latencia se acumula que Inception menciona: agentes de búsqueda, canalizaciones de voz y subagentes de codificación. Toda afirmación de calidad que se le atribuye, incluido un salto de más de 10 puntos sobre Mercury 2, es del propio proveedor, y ningún tercero lo ha medido.

El contraste de especificaciones
• Precio — Mercury 2.5 Preview: $0.20 / $0.75 por 1M de entrada/salida, con precio introductorio de ~$0.04 / $0.15 hasta el 8 de septiembre. Gemini 3.1 Pro: $2.00 / $12.00 por 1M, pasando a $4.00 / $18.00 por encima de 200K de entrada.
• Contexto / salida — Mercury 2.5 Preview: 256K de contexto. Gemini 3.1 Pro: 1M de contexto, 64K de salida máxima.
• Entradas — Mercury 2.5 Preview: solo texto. Gemini 3.1 Pro: texto, imagen, audio, video, archivo.
• Arquitectura — Mercury 2.5 Preview: LLM de difusión, generación paralela de tokens. Gemini 3.1 Pro: autorregresivo, profundidad dinámica de razonamiento.
• Velocidad — Mercury 2.5 Preview: se afirma que alcanza 1.107 tokens/seg. Gemini 3.1 Pro: sin una afirmación destacada comparable.
• Evidencia — Mercury 2.5 Preview: solo reportado por el proveedor. Gemini 3.1 Pro: AA Index 57 en el lanzamiento (46.5 en la escala más nueva) más un extenso registro de evaluaciones independientes.

La brecha de multimodalidad es la diferencia decisiva.
Para la mayoría de las aplicaciones, esta comparación se resuelve antes de que los precios o las evaluaciones comparativas entren en juego, porque Mercury 2.5 Preview no puede ver. Gemini 3.1 Pro lee capturas de pantalla, diagramas, audio y video — es el modelo que apuntas hacia un PDF, un gráfico, una grabación de reunión o una interfaz de usuario cuando quieres una respuesta sobre algo que no sea ya texto. Mercury 2.5 Preview es de solo texto por diseño; un modelo de lenguaje de difusión que genera texto en paralelo no tiene ninguna vía de entrada para imágenes ni audio en absoluto. Para una aplicación con uso intensivo de documentos, un agente de visión o cualquier producto multimodal, Gemini 3.1 Pro es el único candidato aquí, punto final. La restricción de solo texto de Mercury 2.5 Preview no es una salvedad en letra pequeña; es la frontera que decide para qué cargas de trabajo el modelo es siquiera elegible.
Seis meses de pruebas frente a dos días.
En cuanto a evidencia, esto no es una competencia, y es importante decir claramente por qué. Gemini 3.1 Pro ha sido analizado minuciosamente por laboratorios independientes durante seis meses; su puntuación ha sido establecida, re-medida y debatida, que es lo que significa "confiable" para un modelo. Mercury 2.5 Preview tiene una sola fuente de información — su creador — y esa fuente afirma un salto de inteligencia de más de 10 puntos sobre Mercury 2 y paridad con el nivel optimizado en costos de la frontera. Ambas afirmaciones pueden ser ciertas. Ninguna ha sido confirmada por nadie fuera de Inception, y el modelo es demasiado nuevo para que eso sea otra cosa que lo esperado. La asimetría no es que uno sea mejor; es que uno es verificable y el otro aún no lo es.
Dónde la velocidad de Mercurio realmente gana
El argumento honesto a favor de Mercury 2.5 Preview es limitado, solo de texto y real. La generación paralela de tokens cambia el cálculo de la latencia de una manera que ningún modelo autorregresivo — incluido Gemini 3.1 Pro — puede igualar, porque un modelo autorregresivo es serial por construcción. Para un flujo de voz, la ironía es que la entrada y la salida son audio, pero el razonamiento intermedio es texto: una capa rápida de razonamiento de texto es exactamente lo que hace que un agente de voz se perciba como ágil. Para un agente de búsqueda que realiza llamadas repetidas a herramientas, y para un subagente de codificación que lanza muchas completaciones pequeñas por tarea, la latencia por llamada se acumula en velocidad percibida. Al precio introductorio — $0.04 de entrada, $0.15 de salida — Mercury 2.5 Preview es aproximadamente 80 veces más barato que la tarifa estándar de salida de Gemini 3.1 Pro, lo que lo convierte no solo en más rápido, sino en una clase de costo diferente para el razonamiento de texto de alto volumen. La salvedad que debe acompañar a cada una de esas frases: la velocidad es una afirmación, la paridad de calidad es una afirmación, y no existe ninguna medición independiente.
Precios: el premium de contexto largo de Gemini frente al teaser de Mercury
La tarjeta de tarifas de Gemini 3.1 Pro tiene un detalle que conviene conocer antes de comparar las cifras principales: las solicitudes que superan los 200K tokens de entrada saltan de $2.00 / $12.00 a $4.00 / $18.00 por millón. En un modelo con contexto de 1M, ese recargo por contexto largo no es un caso límite: es el precio de usar realmente la ventana por la que el modelo es famoso. Mercury 2.5 Preview no tiene ese escalón, y es poco probable que su contexto de 256K llegue a menudo a la zona de contexto largo. Pero el bajo precio de Mercury es un señuelo con vencimiento el 8 de septiembre, mientras que el de Gemini es una tarifa publicada estable. Al comparar, compara el precio de lista de Mercury de $0.20 / $0.75 con el nivel estándar de Gemini, no con la cifra con descuento: el descuento es el incentivo para probar, no el precio en torno al cual planificar.
La decisión de enrutamiento
Ambos modelos se pueden enrutar hoy, y eso cambia cómo debes tratar a cada uno de ellos. Gemini 3.1 Pro está en OrcaRouter como google/gemini-3.1-pro-preview, al precio de lista del proveedor trasladado con un margen de beneficio del 0%, por lo que los niveles estándar y de contexto largo cuestan exactamente lo que publica el proveedor, junto con otros 200+ modelos con una sola clave de API. Una insignia de vista previa es, precisamente, el tipo de cosa que se debe evitar a la hora de enrutar, no en la que apostar — el panel de tasa de errores de la página del modelo está ahí por una razón, y la conmutación automática por error significa que una respuesta de vista previa degradada se enruta a un segundo proveedor sin cambiar el código. Mercury 2.5 Preview aún no está en OrcaRouter; Inception lo sirve a través de su propia API y de varias plataformas de terceros. Un modelo de dos días de antigüedad que todavía no puedes colocar tras una conmutación por error es un candidato de prueba, no una dependencia de producción. El día en que un proveedor lo liste, se aplica el mismo traspaso de precio y el descuento de lanzamiento llega aquí ese mismo día — que es cuando esta disyuntiva se convierte en una regla de enrutamiento en lugar de una decisión.
El veredicto honesto es que estas dos versiones preliminares responden a preguntas distintas. Gemini 3.1 Pro responde a «¿en qué modelo debería basar mi producto hoy?»: es multimodal, de contexto largo, probado de forma independiente y estable, a un precio que refleja todo eso. Mercury 2.5 Preview responde a «¿qué tan rápido puede llegar físicamente el razonamiento de texto?» — y su arquitectura de velocidad es lo más interesante del modelo, a la espera de que un laboratorio independiente confirme si la calidad que la acompaña es real. Si tu carga de trabajo es multimodal o de contexto largo, la elección ya está hecha. Si es solo texto, con latencia que se acumula y sensible al precio, Mercury 2.5 Preview es la apuesta a seguir — y el 8 de septiembre es la fecha de referencia para medirla.

