
Mercury 2.5 Preview vs Grok 4.6: ¿Puede una vista previa de 1,107 tokens por segundo superar al campeón de valor?
- AlibabaNUEVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligencia72Código
- DeepSeekNUEVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
Esta es la respuesta en una frase: Mercury 2.5 Preview es el modelo de razonamiento creíble más barato en producción hoy en día, a $0,04 / $0,15 por millón de tokens, y Grok 4.6 es el modelo más barato en la frontera de la inteligencia a $2,00 / $6,00 — así que la pregunta práctica entre ambos es si un modelo de difusión preliminar que Inception solo afirma que es «comparable a» GPT-5.6 Luna (Low) y Claude Haiku 4.5 puede hacer los trabajos por los que, de otro modo, pagarías el nivel de frontera. Mercury 2.5 Preview, lanzado el 31 de agosto de 2026, genera tokens en paralelo y afirma 1.107 tokens por segundo en GPUs estándar; Grok 4.6, el modelo insignia de frontera lanzado el 12 de agosto de 2026, obtiene una puntuación de 61 en el Artificial Analysis Intelligence Index, empatado en el puesto #3 mundial, y lo hace a un precio que la frontera jamás había visto. Esa colisión — la afirmación más rápida en la base de la curva de precios encontrándose con el mejor valor en la cima — es de lo que trata este artículo.
Conclusiones clave
• Grok 4.6 a $2.00 / $6.00 con un AA Intelligence Index de 61 es el campeón en valor del nivel de frontera; Mercury 2.5 Preview a $0.04 / $0.15 es una apuesta a que una calidad suficientemente buena a 1/50 del precio supera a la calidad de frontera que rara vez necesitas.
Las afirmaciones de velocidad y calidad de Mercury 2.5 Preview son enteramente de Inception; no existían puntuaciones de benchmark independientes desde el primer día.
• El 80 % de descuento de lanzamiento en Mercury 2.5 Preview expira el 8 de septiembre de 2026; después, su precio de lista es de $0.20 / $0.75 — sigue siendo 10 veces más barato que Grok 4.6 en entrada, pero una historia menor.
• Grok 4.6 se enruta hoy en OrcaRouter al precio de lista; Mercury 2.5 Preview aún no está enrutado y se sirve a través de la propia API de Inception y de varias plataformas de terceros.
El marcador

• Inteligencia — Mercury 2.5 Preview: sin índice independiente; Inception afirma paridad con el nivel optimizado en costos. Grok 4.6: AA Intelligence Index 61, empatado en el #3 a nivel mundial (según Artificial Analysis; las cifras del propio laboratorio son reportadas por el proveedor).
• Precio — Mercury 2.5 Preview: $0.04 / $0.15 por 1M (80% de descuento sobre $0.20 / $0.75, hasta el 8 de septiembre de 2026). Grok 4.6: $2.00 / $6.00 por 1M, duplicándose a $4.00 / $12.00 para prompts de 200K tokens o más.
• Velocidad — Mercury 2.5 Preview: 1,107 tokens/seg afirmados, según el proveedor. Grok 4.6: la velocidad no es una especificación destacada; el modelo está diseñado para ejecuciones agénticas largas, no para streams rápidos.
• Contexto — Mercury 2.5 Preview: 260K. Grok 4.6: 500K.
• Trabajo agéntico — Mercury 2.5 Preview: sin puntuaciones públicas, aunque se admiten llamadas paralelas a herramientas. Grok 4.6: APEX-Agents 57.5, DeepSWE v1.1 65.9, CursorBench v3.2 69.9 (reportado por el proveedor, en gran parte no reproducido).
• Pesos — Mercury 2.5 Preview: cerrado, propietario. Grok 4.6: cerrado, propietario.
El campeón del valor y el salto de precio
La posición de Grok 4.6 es inusual. Iguala el puesto #3 de inteligencia en el índice de Artificial Analysis — empatado con GPT-5.6 Sol Max — siendo más barato que cualquier modelo dentro de diez puntos de él, y su cobertura de lanzamiento enfatizó ejecuciones agénticas largas que terminaron con un promedio de aproximadamente $0.84 por tarea en una evaluación administrada por un proveedor. Esa es la definición de un campeón de valor: capacidad cercana a la frontera a un precio que hace visibles los costos por tarea en una hoja de cálculo. Mercury 2.5 Preview no intenta ser eso. Inception lo posiciona contra modelos como GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite y Claude Haiku 4.5 — el nivel optimizado en costos, no la frontera. Si Inception tiene razón, Mercury 2.5 Preview está un nivel por debajo de Grok 4.6 en capacidad y varios niveles por debajo en precio, lo cual es un producto perfectamente coherente: un salto de precio para cargas de trabajo donde el nivel fronterizo es un desperdicio.
Lo que la decodificación paralela realmente cambia
La arquitectura es la parte que merece la pena entender, porque cambia lo que significa "rápido". Los modelos autorregresivos emiten un token por paso, por lo que el rendimiento está limitado por la latencia secuencial; un LLM de difusión como Mercury 2.5 Preview genera un bloque de tokens en paralelo y los refina a lo largo de pasos de denoising, lo que desacopla el rendimiento del número de tokens producidos. Por eso Inception puede afirmar 1.107 tokens/seg en GPUs estándar — sin aceleradores especiales, sin trucos de batching — y por eso la verdadera propuesta de producto es un tiempo hasta el primer token inferior a 300 milisegundos para cargas de trabajo interactivas. Para un agente de voz, un pipeline de búsqueda o un subagente de codificación que llama al modelo en cada turno, esa diferencia de latencia es el producto: es la diferencia entre un bucle de voz que se siente en vivo y uno que hace pausas. El problema es que los modelos de lenguaje de difusión son un área de investigación joven, la cifra de 1.107 es de Inception, y ningún laboratorio independiente ha reproducido la velocidad ni medido la deriva de calidad, si existe, que la generación paralela introduce en prompts largos o adversariales.
Donde Grok 4.6 todavía domina el trabajo.
Nada de Mercury 2.5 Preview toca las partes del mercado en las que Grok 4.6 está ganando de verdad. Las mejoras de Grok sobre Grok 4.5 se concentraron en los puntos de referencia de agentes y codificación — DeepSWE subió 11.9 puntos, APEX-Agents 10.4, Terminal-Bench 10.3 — y su ventana de contexto de 500K existe para agentes de horizonte largo que deben mantener toda la tarea en contexto. Mercury 2.5 Preview ofrece llamadas paralelas a herramientas, pero un modelo sin puntuaciones de agente independientes, con un límite de salida de 65,536 tokens y un contexto de 260K no es la herramienta adecuada para una ejecución de ingeniería de software de 50 pasos. Los dos modelos apenas se superponen en su uso: Grok 4.6 es el motor para el trabajo que tiene que llegar a completarse; Mercury 2.5 Preview es el motor para el trabajo que tiene que parecer instantáneo y costar casi nada por llamada.
La ventana de 80% de descuento
Los precios aquí tienen una fecha de caducidad, y eso cambia la decisión. La tarifa de $0.04 / $0.15 de Mercury 2.5 Preview es un 80 % de descuento sobre el precio de lista de $0.20 / $0.75, e Inception ha dicho que la promoción estará vigente hasta el 8 de septiembre de 2026. El precio de $2.00 / $6.00 de Grok 4.6 es un precio de lista estable con una estructura limpia — entrada en caché a $0.50, un nivel prioritario a 2× y una subida de tarifa para prompts largos a partir de 200K tokens que factura toda la solicitud a la tarifa más alta. Si comparas las cifras de hoy, Mercury resulta 50× más barato en entrada y 40× más barato en salida; si el descuento caduca según lo previsto, la brecha real a largo plazo es de 10× en entrada y 5× en salida. Ninguno de los dos planteamientos es engañoso — solo son horizontes temporales distintos, y un pipeline con precios basados en el descuento, sin un punto de reevaluación, es un pipeline que se llevará una sorpresa el 9 de septiembre. El precio de $2.00 / $6.00 de Grok 4.6 es exactamente lo que pagas en OrcaRouter, donde el precio de lista del proveedor se traslada con un margen del 0 % — cuando el proveedor cambia un número, el nuevo valor queda activo en la misma clave ese mismo día, con conmutación automática si una ruta del proveedor limita la tasa.
El veredicto en una línea
Si el trabajo tiene que terminarse y quieres capacidad de vanguardia al mejor precio de su gama, compra Grok 4.6: es un campeón de valor probado, disponible hoy en OrcaRouter a $2.00 / $6.00. Si el trabajo es razonamiento de texto de alto volumen y sensible a la latencia, donde verificar respuestas suficientemente buenas es económico, Mercury 2.5 Preview a $0.04 / $0.15 es una oportunidad de precio que vale la pena probar dentro de la ventana de descuento; solo recuerda que cada afirmación de su columna es de Inception, y la prueba sigue pendiente.


OrcaRouter transmite los precios de lista de los proveedores con un margen del 0% y conmutación automática, por lo que un cambio de precio de un proveedor está activo en la misma clave el mismo día.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
