Tarjeta de título hero para la comparación 'Grok 4.6 vs DeepSeek V4 Pro', subtitulada 'Una guerra de precios de vanguardia, librada con 24 horas de diferencia', con una insignia de 'Comparación · agosto de 2026'.
Guides & Insights

Grok 4.6 vs DeepSeek V4 Pro: Una guerra de precios en la frontera, librada con 24 horas de diferencia

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Dos modelos de frontera se lanzaron con 24 horas de diferencia, y la brecha entre sus listas de precios es la más amplia que ha producido esta generación. Grok 4.6 se lanzó el 12 de agosto de 2026 a 2 $ por millón de tokens de entrada y 6 $ por millón de salida. DeepSeek V4 Pro — la versión de producción formal del buque insignia de D​eepSeek, versión DeepSeek-V4-Pro-0813 — le siguió el 13 de agosto de 2026 a 3 ¥ por millón de tokens de entrada con fallo de caché y 6 ¥ por millón de salida, lo que equivale aproximadamente a 0,42 $ y 0,85 $. Misma categoría, mismas ambiciones de agente, un orden de magnitud de diferencia en el precio. Esto no es una comparación de dos especificaciones; es una comparación de dos estrategias sobre lo que debería costar un modelo con forma de agente, y ambos se han lanzado esta semana.

Esta pieza pone las dos hojas de precios una al lado de la otra, lee las afirmaciones de referencia de cada proveedor con la etiqueta del proveedor puesta, y calcula cuánto cuesta realmente la brecha en una carga de trabajo real — porque sobre el papel estos modelos están más cerca en capacidades que en filosofía, y la diferencia de precio por tarea es donde reside la decisión.

El momento es lo importante.

Que ambos modelos aterrizaran en la misma ventana de 48 horas no es un accidente de calendario. Grok 4.6 es la adaptación agéntica de SpaceXAI de su modelo fundacional de 1.5T: una actualización posterior al entrenamiento con gran peso en aprendizaje por refuerzo en codificación, trabajo de kernel y CAD, con un precio pensado como combustible para los productos Cursor y Grok Bot que la empresa posee. DeepSeek V4 Pro es la formalización de una vista previa que redefinió silenciosamente lo que significaba «agéntico» a una fracción del precio, ahora potenciada para la economía de agentes: las notas de lanzamiento de DeepSeek para la compilación 0813 comienzan con capacidades de agente significativamente mejoradas, añaden soporte para la API de Responses y la integración con Codex, y conservan tanto el modo de pensamiento (por defecto) como el modo sin pensamiento, la salida JSON, las llamadas a herramientas y el formato de la API de Anthropic. Dos empresas muy diferentes concluyeron simultáneamente que el mercado que importa a finales de 2026 es el de los agentes — y fijaron el precio de sus propuestas para bolsillos muy diferentes.

Las dos listas de precios, lado a lado.

Grok 4.6 — $2.00 / $6.00 / $0.50 (entrada en caché) por millón de tokens, contexto de 500K, un incremento de $4 / $12 / $1 por encima de aproximadamente 200K tokens de entrada, y una variante más rápida al doble de la tarifa base.

DeepSeek V4 Pro — ¥3.00 (≈$0.42) por entrada sin caché, ¥0.025 (≈$0.0035) por entrada en caché, ¥6.00 (≈$0.85) por salida por millón de tokens, con una ventana de contexto de 1 millón de tokens y hasta 384K tokens de salida. Su variante más económica, V4 Flash, cuesta ¥1 / ¥2.

Incluso frente a Grok 4.6 — ya la API frontera más barata de su generación — DeepSeek V4 Pro es aproximadamente cinco veces más barato en entrada con cache-miss y siete veces más barato en salida, y aporta una ventana de contexto 2x más grande y una salida máxima mucho mayor al mismo nivel de precio. Los dos no compiten en precio; D​eepSeek ha fijado unilateralmente un nuevo mínimo y Grok es ahora la opción premium en la misma frase. Ese encuadre importa, porque el encuadre anterior — «Grok 4.6 es el modelo de frontera barato» — fue cierto durante exactamente un día.

Two-column scoreboard: Grok 4.6 AA Index 61 (independent), $2/$6, 500K context, DeepSWE v1.1 65.9% (vendor), Terminal-Bench 26% (v3.0), cache-hit input $0.50 vs DeepSeek V4 Pro AA Index none yet, ≈$0.42/$0.85, 1M context, DeepSWE 62.7% (vendor), Terminal-Bench 87.9% (v2.1), cache-hit input ≈$0.0035.

Lo que DeepSeek V4 Pro realmente mejoró

Los números de lanzamiento de DeepSeek son los más dramáticos porque se miden contra su propia vista previa, y el salto de la vista previa al lanzamiento es enorme. Según las propias evaluaciones del proveedor:

DeepSWE — 62.7% en la versión final, frente al 12.8% de la vista previa — una puntuación de horizonte largo en ingeniería de software que la empresa sitúa entre el 58.0% de Opus 4.8 y el 70.0% de Claude Fable 5.

Cybergym — 83.3 %, frente al 52.7 % anterior, superando por poco el 83.1 % de Fable 5 y superando el 78.3 % de Opus 4.8.

Terminal Bench 2.1 — 87,9%, a un punto del 88,0% de Fable 5 y por delante del 85,0% de Opus 4.8.

AutomationBench (público) — 31.8%, frente al 12.8% anterior, por delante tanto de Fable 5 (29.1%) como de Opus 4.8 (27.2%).

Toolathlon-Verified, NL2Repo, DSBench-FullStack y DSBench-Hard — 74,1 %, 61,5 %, 71,1 % y 67,2 % respectivamente, agrupados en la banda de Opus 4.8 / Fable 5 o cerca de ella.

Cada uno de esos es reportado por DeepSeek en su propio conjunto de evaluación. La dirección es inconfundible: la vista previa no estaba lista para bucles de agentes en producción y la versión final afirma estarlo — pero la etiqueta honesta es que ningún laboratorio independiente ha puntuado aún a DeepSeek V4 Pro, y los modelos con los que se compara no son nombrados por una parte externa.

Con qué responde Grok 4.6

El rival de Grok 4.6 es diferente en esencia: es el único de los dos con un marcador independiente. Artificial Analysis lo midió con un 61 en su índice de inteligencia —empatado con GPT-5.6 Sol, por delante de Kimi K3 (60)— antes de que DeepSeek V4 Pro siquiera se lanzara. La tabla de su proveedor afirma un 65,9 % líder en DeepSWE v1.1 y un 69,9 % en CursorBench v3.2, con un punto débil abiertamente admitido del 26 % en Terminal-Bench v3.0. Esos son datos reportados por xAI; ninguno ha sido reproducido de forma independiente al 13 de agosto.

Las discrepancias de versión importan cuando intentas comparar las dos directamente. El 87.9 de D​eepSeek es en Terminal Bench 2.1; el 26% de Grok es en el v3.0 más difícil — exámenes distintos, así que "D​eepSeek aplasta a Grok en terminales" no es una afirmación honesta, y tampoco lo es "Grok lidera en DeepSWE" sin señalar que los dos proveedores usaron versiones de evaluación diferentes y que ninguno de los dos números proviene de un tercero. Lo que sí es comparable es la dimensión independiente: Grok 4.6 tiene una ficha de resultados verificada, DeepSeek V4 Pro todavía no tiene ninguna, y para una decisión de producción, esa asimetría es en sí misma información.

Screenshot of the Artificial Analysis page for Grok 4.6 (high) scoring 61 — the independent scorecard DeepSeek V4 Pro does not yet have.

El costo total de una ejecución de agente larga

Tome una tarea agéntica realista — leer y razonar sobre 500 mil tokens de contexto, escribir 100 mil tokens de salida, lo que es una refactorización de tamaño medio o un pipeline de documentos largo, dentro de las ventanas de ambos modelos:

Grok 4.6 — 0.5M de entrada a $2 = $1.00, más 0.1M de salida a $6 = $0.60. Total: $1.60.

DeepSeek V4 Pro — 0.5M de entrada con fallo de caché a ¥3 = ¥1.50, más 0.1M de salida a ¥6 = ¥0.60. Total: ¥2.10, aproximadamente $0.29.

Eso es una brecha de 5.5x en la misma tarea nominal, antes de cualquier ventaja de caché, y la ventana de 1M de DeepSeek más la salida máxima de 384K también significa que el trabajo cabe en una sola pasada, mientras que la ventana de 500K de Grok 4.6 puede obligar a hacer dos. La pega que impide que esto sea una respuesta de una línea es el costo y el riesgo del razonamiento: el modo de pensamiento de DeepSeek está activado por defecto, así que cada solicitud paga por una traza de razonamiento completa incluso cuando no la quieres, y la confianza en los propios benchmarks del proveedor no ha sido verificada por nadie independiente. Barato por token con razonamiento siempre activo sigue siendo barato por tarea a estas tarifas, pero "barato" y "verificado" son afirmaciones diferentes, y solo uno de estos modelos cumple con la segunda.

Quién debería elegir cuál

La decisión es menos "cuál es mejor" que "qué perfil de riesgo se adapta a la carga de trabajo":

De alto volumen, limitado por costos y dispuesto a manejar cifras no verificadas — DeepSeek V4 Pro es la apuesta de precio mínimo. El contexto de 1M y la salida de 384K lo convierten en el candidato más fuerte para contexto largo y procesamiento por lotes, y la tarifa de entrada en caché de ¥0.025 hace que las canalizaciones de recuperación intensiva sean casi gratuitas. Solo haz tus propias evaluaciones, porque nadie independiente las ha hecho.

Profundidad agéntica con un marcador independiente, en un ecosistema compatible con OpenAI — El 61 de Grok 4.6 está verificado, la dirección de sus benchmarks de codificación y agénticos es consistente, y la debilidad terminal se conoce de antemano. El tiempo de 42 segundos hasta el primer token es el precio que se paga por la calidad verificada.

Screenshot of the OrcaRouter model page for Grok 4.6, the pass-through endpoint where both models sit behind one key at provider list price.

Tráfico mixto — este es un caso de enrutamiento, no de elección. En OrcaRouter, ambos modelos están detrás de una sola clave con precios de paso directo según la lista del proveedor — así que los ¥3/¥6 de DeepSeek siguen siendo ¥3/¥6 en la factura, y Grok 4.6 sigue siendo $2/$6, sin margen alguno en ninguno. Una regla de enrutamiento puede enviar el trabajo de contexto largo y limitado por costos a DeepSeek V4 Pro, y el trabajo agéntico verificado a Grok 4.6; dividir el tráfico por solicitud hasta que tu propia evaluación decida la división, y confiar en el failover automático si el comportamiento de la primera semana de cualquiera de los proveedores contradice sus cifras de lanzamiento. Para un par de modelos de un día en extremos opuestos de una guerra de precios, poder comparar ambos en tu propia carga de trabajo — y cambiar la división sin modificar código — no es una conveniencia. Es la única forma defendible de adoptar cualquiera de los dos.

Comparados en este artículo3

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

providers@orcarouter.ai

Únete a la comunidad

Discordsupport@orcarouter.aiXGitHubYouTube