Una tarjeta de título principal generada para un artículo titulado 'Grok 4.7 vs Grok 4.6 — mismo precio, modelo diferente', con el subtítulo 'Lo que realmente cambió en el lanzamiento del 21 de septiembre' y chips de estadísticas que dicen Terminal-Bench 4.0 38.0% vs 20.3%, AA Index 46 vs 44, y $2/$6 en ambos.
Guides & Insights

Grok 4.7 vs Grok 4.6: el mismo precio de $2/$6, un modelo diferente debajo

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

SpaceXAI lanzó Grok 4.7 el 21 de septiembre de 2026, y lo primero que vale la pena notar es lo que no cambió: el precio. Grok 4.7 cuesta $2 por millón de tokens de entrada y $6 por millón de tokens de salida, exactamente lo que Grok 4.6 ha costado desde su lanzamiento el 12 de agosto de 2026. Misma tarifa, misma ventana de contexto de 500.000 tokens, misma entrada de texto e imagen — y, sin embargo, los dos modelos no están cerca en las evaluaciones que importan para el trabajo agéntico. Según los propios números publicados por SpaceXAI, Grok 4.7 casi duplica a Grok 4.6 en Terminal-Bench 4.0, 38,0% frente a 20,3%. Ese es el panorama completo de esta comparación: un cambio generacional al mismo precio donde casi toda la ganancia recae en un solo lugar, y las partes de Grok 4.6 que molestaban a los equipos de producción siguen ahí.

¿Qué cambió realmente entre los dos modelos?

La propia descripción que hace SpaceXAI del lanzamiento es limitada, y merece la pena citar su forma más que los adjetivos. Grok 4.7 se basa en un modelo base más grande que Grok 4.6, y se le sometió a una ejecución de aprendizaje por refuerzo más prolongada orientada a tareas que "pueden tardar horas en completarse". La empresa afirma que esa ejecución mejoró tres cosas: la autoverificación, el manejo de contextos largos y el comportamiento dentro del entorno Grok Bot. No hay ninguna afirmación sobre una nueva arquitectura, una nueva modalidad ni una pila de servicio diferente.

Ese encuadre importa porque predice dónde aparecen las mejoras en los benchmarks, y aparecen exactamente ahí. Una pasada de RL más larga sobre tareas difíciles de varias horas impulsa mucho más el trabajo de terminal y de repositorio de lo que impulsa un cuestionario de conocimientos. Si esperabas que Grok 4.7 fuera un modelo más amplio que Grok 4.6, las notas de la versión dicen lo contrario — es el mismo modelo en cuanto a forma, entrenado más a fondo hacia el extremo difícil del trabajo agéntico.

La historia de los parámetros es la única pieza de esto que no es una divulgación de un proveedor. Musk dijo a principios de septiembre que Grok 4.7 tiene aproximadamente 2,1 billones de parámetros frente a los 1,5 billones de Grok 4.6, un aumento del 40%, y esa cifra se ha repetido por todas partes desde entonces. Nunca ha aparecido en una hoja de especificaciones de SpaceXAI. Trátala como una afirmación ampliamente difundida sobre el modelo base, no como una especificación confirmada, y ten en cuenta que los recuentos de parámetros dicen muy poco sobre el coste de servicio o la capacidad cuando la arquitectura es dispersa, que es el caso de la línea Grok.

La brecha del benchmark, con la etiqueta de procedencia adjunta

Todas las cifras de esta sección provienen del material de lanzamiento de SpaceXAI. Ninguna de ellas ha sido reproducida de forma independiente en el momento de redactar este texto, y la manera honesta de leerlas es como un conjunto de afirmaciones que resulta ser inusualmente específico —lo que lo vuelve comprobable más adelante, pero no lo convierte en verificado ahora.

• Terminal-Bench 4.0 — Grok 4.7 38,0 % (según el proveedor) frente a Grok 4.6 20,3 %. La mayor diferencia individual de la versión, y la que coincide con la afirmación de "RL más prolongado en tareas más difíciles".

• CursorBench 4.0 — Grok 4.7 46,3 % (según el proveedor) vs. Grok 4.6 40,4 %. Una ganancia real, pero modesta — menos de seis puntos, en un benchmark más cercano al trabajo cotidiano del editor que a las sesiones autónomas de terminal.

• DeepSWE v1.1 — Grok 4.7 71,0 % con esfuerzo de razonamiento alto (según el proveedor) frente a Grok 4.6 65,2 %. De nuevo, una mejora sólida pero poco espectacular.

• EEBench — Grok 4.7 64,0 % (reportado por el proveedor). No se publicó ninguna cifra de Grok 4.6 junto con esta, así que esta no te dice nada sobre la actualización.

• AA-Briefcase v1.1 — Grok 4.7 con 1.657 Elo (según el proveedor), en la evaluación de trabajo de conocimiento profesional.

Lee la lista como un conjunto y el patrón es consistente: Grok 4.7 es considerablemente mejor cuando la tarea es larga y agentiva, y marginalmente mejor cuando la tarea es corta. El salto de Terminal-Bench es aproximadamente el doble; las mejoras en el trabajo de edición son porcentajes de un solo dígito. Si tu carga de trabajo es del tipo autocompletado, pagas los mismos $2/$6 por una pequeña mejora. Si tu carga de trabajo es “ejecutar durante dos horas y volver”, el lanzamiento está dirigido directamente a ti.

Lo que dice hasta ahora la medición independiente

Existe un número independiente, y vale la pena enunciarlo con cuidado porque es fácil malinterpretarlo. Artificial Analysis otorga a Grok 4.7 una puntuación de 46 en su Intelligence Index, versión v4.3.2, lo que lo sitúa en el puesto 16 de 655 modelos de la tabla. Grok 4.6 se sitúa en 44 en la misma escala. Una diferencia de dos puntos en un índice compuesto no es la duplicación que muestra Terminal-Bench, y esa discrepancia es informativa más que contradictoria: el índice combina razonamiento, conocimiento, matemáticas y programación, por lo que una gran ganancia en un segmento agéntico queda diluida por todo lo que el modelo no cambió.

Dos detalles adicionales de la misma página son más útiles que la puntuación principal. Primero, Grok 4.7 generó 240 millones de tokens de salida mientras ejecutaba el índice, frente a una mediana de 92 millones; es un razonador verboso, y con una tarifa de salida de $6 por millón, esa verbosidad es una partida. Segundo, la puntuación compuesta del índice lo sitúa entre los modelos más fuertes de su gama de precios, que es la comparación que realmente importa para un comprador. Artificial Analysis no ha publicado un precio completo para Grok 4.7 en la página del modelo, así que no tomes de ahí su cifra de costo por tarea; usa los $2/$6 del proveedor.

A generated two-column comparison scoreboard for Grok 4.7 and Grok 4.6 with six rows: Terminal-Bench 4.0 38.0% vs 20.3%, CursorBench 4.0 46.3% vs 40.4%, DeepSWE v1.1 71.0% vs 65.2%, AA Intelligence Index 46 vs 44, context 500K on both, and price $2/$6 on both, with a footer noting all benchmark figures are vendor-reported and the index scores are per Artificial Analysis v4.3.2.

El precipicio de precios que ninguno de los dos modelos solucionó.

Esta es la parte de la tabla de tarifas de Grok 4.6 que los equipos de producción aprendieron a odiar, y Grok 4.7 no la cambió. Por debajo de 200,000 tokens de entrada, la tarifa es de $2 de entrada y $6 de salida. Por encima de eso, toda la solicitud se vuelve a tarifar a $4 de entrada y $12 de salida. No los tokens excedentes — toda la solicitud. Una llamada de 210,000 tokens cuesta el doble que una llamada de 199,000 tokens, por 11,000 tokens adicionales.

Con una ventana de contexto de 500.000 tokens en ambos modelos, es fácil caer por ese precipicio. Las ejecuciones de agentes con contexto largo y los prompts de repositorios completos son precisamente las cargas de trabajo para las que se optimizó Grok 4.7, lo que significa que el mejor caso de uso del modelo es también el que más probabilidades tiene de desencadenar la duplicación. Si vas a trasladar trabajo a Grok 4.7 porque maneja mejor las sesiones agénticas largas, presupuesta el reajuste de precios antes de trasladarlo, no después.

También hay un nivel de velocidad que hay que tener en cuenta. SpaceXAI ofrece una variante rápida de Grok 4.7 que duplica la velocidad de salida y duplica el precio indicado. Es un intercambio legítimo para la programación interactiva, y uno malo para el trabajo por lotes — la misma tarea con la misma calidad cuesta el doble por un ahorro de tiempo real que nadie está mirando.

Migrar desde Grok 4.6 sin reescribir

La buena noticia práctica es que esto es un cambio de modelo, no una migración de plataforma. Ambos modelos aceptan texto e imágenes y devuelven texto, ambos usan los mismos niveles de esfuerzo de razonamiento desde bajo hasta xhigh, y la estructura de la solicitud es la que SpaceXAI ha estado sirviendo desde Grok 4.5. El código que llama a Grok 4.6 con un parámetro de esfuerzo no necesita reestructurarse para llamar a Grok 4.7.

Donde el cambio no sale gratis es en la evaluación. Las mejoras de Grok 4.7 se concentran en ejecuciones agénticas largas, así que una suite de pruebas construida a partir de prompts cortos de un solo turno no te mostrará casi nada: verás la mejora del tamaño de CursorBench y concluirás que la actualización no valía el esfuerzo, cuando el argumento a su favor reside en tareas que tu suite nunca ejercita. La medición que realmente lo resolvería es la finalización de tareas en trabajo de varios pasos: parches aceptados, regresiones introducidas, llamadas a herramientas por tarea completada y con qué frecuencia una ejecución necesita rescate humano. Esos son los ejes a los que apuntan los propios números del proveedor, y son los que ningún benchmark publicado cubre para tu base de código.

La verbosidad es lo segundo que hay que medir. Un modelo que emite 240 millones de tokens en un índice estándar va a emitir más tokens en tu carga de trabajo que su predecesor, y a $6 por millón de salida eso puede borrar silenciosamente el valor de una actualización al mismo precio. Haz un seguimiento de los tokens de salida por tarea completada durante una semana antes de comprometerte.

Screenshot of the Artificial Analysis model page for Grok 4.7 (xhigh), showing an Intelligence Index of 46 on index version v4.3.2, a 500k token context window, text and image input with text output, and a verbosity figure of 240M output tokens generated on the index.

Cuál llamar

La decisión es genuinamente sencilla, lo cual es inusual en una comparación de modelos. Grok 4.6 sigue siendo la opción correcta para tráfico de turnos cortos y sensible al costo: chat, clasificación, resumen y asistencia de código a escala de editor, donde las mejoras de Grok 4.7 son pequeñas y su verbosidad es un impuesto. Grok 4.7 es la opción correcta para la carga de trabajo para la que fue creado: codificación agéntica de horizonte largo y trabajo en terminal, donde una tarea se ejecuta durante horas y la autoverificación es la diferencia entre un trabajo terminado y uno atascado.

Ejecutar ambos no es una solución de compromiso aquí, es la respuesta correcta, y es económico hacerlo. Grok 4.6 está en el catálogo de OrcaRouter al precio de lista de SpaceXAI con un margen del 0 % trasladado directamente, así que la tarifa de $2/$6 de arriba es lo que pagas — y como trasladamos el precio de lista del proveedor en lugar de aplicar un margen, cualquier cambio de precio del proveedor se aplica de nuestro lado el mismo día en que se produce. Una sola clave de API cubre Grok 4.6 y más de 200 otros modelos, así que mover el tráfico entre ellos según la tarea es un cambio de configuración en lugar de un segundo contrato. Si quieres probar Grok 4.7 en una ruta de producción antes de confiar en él, el patrón más seguro es mantener el respaldo en Grok 4.6 —un modelo que puedes enrutar hoy— y dejar que la conmutación por error automática entre proveedores devuelva la solicitud cuando el nuevo modelo falle.

Screenshot of the OrcaRouter model page for Grok 4.6 (model ID grok/grok-4.6), showing SpaceXAI's list pricing of $2.00 per million input tokens and $6.00 per million output tokens, a 500K token context window, and the reasoning and vision capability tags.

Qué ver a continuación

Dos cosas zanjarán esta comparación, y ninguna ha sucedido aún. La primera es una reproducción independiente de la cifra de Terminal-Bench 4.0: el 38 % es un salto lo bastante grande como para que alguien vuelva a ejecutarla, y si se mantiene, el argumento a favor de Grok 4.7 en pipelines agénticos es sólido por méritos propios y no por marketing. La segunda es el resto de la hoja de ruta de Grok: SpaceXAI ha secuenciado públicamente Grok 4.8, Grok 4.9 y Grok 5 detrás de este lanzamiento, y la propia vida de Grok 4.6 fue de unas cinco semanas. Apostar por Grok 4.7 como una asunción de plataforma a largo plazo repetiría el error que cometieron los equipos con Grok 4.5.

Por ahora, la mejora al mismo precio es real y la dirección de avance es clara. La cifra que hay que retener es que $2/$6 te compraron un modelo que aproximadamente duplica su rendimiento en trabajo de terminal de horizonte largo y apenas se mueve en cualquier otro ámbito — y eso es una afirmación específica, útil y verificable, más que un salto generacional.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario