
Grok 4.7 obtiene 46 en el Artificial Analysis Intelligence Index y coloca a SpaceXAI en el Top Four
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 217 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAINUEVOGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 51 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Grok 4.7 obtiene 46 en el Artificial Analysis Intelligence Index y coloca a SpaceXAI en el Top Four
Grok 4.7 is out. SpaceXAI released it on Monday, September 21, 2026 — at the same $2 per million input tokens and $6 per million output tokens as Grok 4.6, with the same 500,000-token context window, a later knowledge cutoff and a new top reasoning level. It is live in Cursor and Grok Build, through the vendor's own API, and through third-party coding harnesses, model routers and cloud platforms. Grok 4.5, from July 8, stays below it as the cheaper option, and the models it still has to beat are unchanged: Claude Fable 5.1, Claude Opus 5 and GPT-5.6 Sol all sit above it on Artificial Analysis' v4.3.2 Intelligence Index, where Grok 4.7's first independent score — 46 — lands two points above Grok 4.6 and seven below Claude Fable 5.1. On the same evaluator's AA-Briefcase board for long-horizon knowledge work it lands fourth, behind three Claude entries and ahead of Claude Opus 5 at xhigh effort, at roughly half Claude Opus 5's cost per task — the first independent result in this release that reads as a price-performance win rather than a gap. Eleven days on, the picture has widened at the edges rather than in the middle: since October 1 it has been rolling out inside Grok's own web and mobile apps, where the mode picker now names it on its two hardest entries, and it is listed on OrcaRouter at SpaceXAI's own $2/$6.
Ese es el lanzamiento. Los números más útiles llegaron ese mismo día, del único evaluador de esta historia que no es el proveedor: Artificial Analysis publicó su primera pasada independiente sobre Grok 4.7, y es un resultado de tres partes: un 46 en el Intelligence Index que solo supera a Grok 4.6 por dos puntos, un 56 en el Coding Agent Index que está nueve puntos por delante, y un 1.657 de Elo en AA-Briefcase que está 111 puntos por delante. Esos tres números apuntan en direcciones distintas, y la diferencia entre ellos es lo más interesante de este lanzamiento. Lo que sigue es la especificación enviada, la propia tabla de benchmarks del proveedor con la etiqueta que necesita cada fila, y después las puntuaciones independientes leídas correctamente —incluido lo que dicen sobre la advertencia de preparación que SpaceXAI nunca abordó.
Qué lanzó SpaceXAI el 21 de septiembre
Empecemos por la especificación, porque es inusualmente parecida a la de su predecesor. Grok 4.7 tiene el mismo precio que Grok 4.6: $2 por millón de tokens de entrada y $6 por millón de tokens de salida por debajo de 200.000 tokens de entrada, y sube a $4 de entrada y $12 de salida una vez que una solicitud supera ese umbral, la misma estructura que introdujo Grok 4.6. La ventana de contexto es de 500.000 tokens. El corte de conocimiento es mayo de 2026, tres meses más tarde que el 1 de febrero de 2026 de Grok 4.6. El esfuerzo de razonamiento abarca cuatro niveles —bajo, medio, alto y xhigh—, y las cifras publicadas se citan en xhigh. Una variante rápida funciona al doble de velocidad de salida por el doble de precio.
En el fondo, xAI describe tres cambios en lugar de una nueva arquitectura. El modelo base es más grande que el de Grok 4.6. La ejecución de aprendizaje por refuerzo fue más larga y estuvo ponderada hacia tareas que requieren muchas horas para completarse. Y el modelo fue entrenado para verificar su propio trabajo y retener mejor el contexto largo, incluida una comprensión nativa del arnés de Grok Bot. El resumen de una línea de la propia compañía es «el doble de rápido, a la mitad del precio de modelos comparables» —una afirmación de posicionamiento sobre sus rivales más que una medición, y conviene leerla como tal.
Availability was broad on day one and has widened twice since. At launch: Cursor and Grok Build, the vendor's own API, third-party coding harnesses, model routers and cloud platforms; SpaceXAI's own Grok Build page now says outright to "start building with Grok 4.7". On September 28 Amazon Web Services added it to Amazon Bedrock with the same 500,000-token context window and the same four reasoning-effort levels, served through cross-Region inference profiles, so the model is now reachable through a hyperscaler's own catalog and not only the vendor's API. Then on October 1 it began rolling out inside Grok's consumer web and mobile apps, and two days later that is still where it sits. That last one is unusually quiet: SpaceXAI announced the equivalent step for Grok 4.5 with a blog post titled "Bringing Grok 4.5 to iOS, Android, Web, and X", and has published nothing for Grok 4.7, so the change is visible in the product rather than declared. It is server-side rather than shipped, which the app listings confirm: both Grok's iOS and Android listings moved on October 1 — the App Store build is 1.4.47, released that day, and its release note mentions only "Improvements to Chat, Voice and Imagine", while the Play listing was updated the same day. The change is pushed from the backend rather than built into a binary. Because the rollout is being reported rather than documented, the precise scope is harder to establish than for the Bedrock listing, which has a dated AWS post behind it, and the reporting has already drifted: the accounts tracking this now describe Grok 4.7 as the base model across all modes — Fast, Expert, Build and Heavy — a list that does not match what grok.com actually serves. Read it as the trackers' own reporting rather than as a vendor description. Selected cybersecurity partners get invite-only access to the model's red-team capabilities.
Una corrección al registro que mantuvo este artículo. El recuento de parámetros que circuló durante dos meses —aproximadamente 2,1 billones, alrededor de un 40 % por encima de los 1,5 billones de Grok 4.6— sigue sin aparecer en ninguna ficha técnica. xAI no ha publicado un recuento de parámetros para Grok 4.7, y Artificial Analysis indica que el tamaño del modelo no se ha divulgado. La cifra siempre fue una afirmación de un fundador, y el lanzamiento no la convirtió en una especificación.
La tabla comparativa es de xAI — esto es lo que no lo es
Todas las cifras de la lista a continuación provienen del anuncio del proveedor, y ninguna de ellas se ha reproducido de forma independiente. Léalo con esa etiqueta puesta: estos son los números de xAI sobre las evaluaciones elegidas por xAI, publicados el día del lanzamiento, y la primera semana de cualquier lanzamiento es cuando los benchmarks del proveedor son menos fiables. Las columnas de comparación también son del propio proveedor: Grok 4.6 (high), GPT-5.6 Sol (max) y Claude Fable 5.1 (max), cada uno ejecutado con el nivel de esfuerzo elegido por el proveedor.
• CursorBench 4.0 — Grok 4.7 46,3 %, Grok 4.6 40,4 %, GPT-5.6 Sol 41,7 %, Claude Fable 5.1 51,8 %. Datos reportados por el proveedor.
• DeepSWE v1.1 — Grok 4.7 71,0 % con esfuerzo alto, Grok 4.6 65,2 %, GPT-5.6 Sol 72,7 %, Claude Fable 5.1 70,0 %. Reportado por el proveedor.
• Terminal-Bench 4.0 — Grok 4.7 37,6 %, Grok 4.6 20,3 %, GPT-5.6 Sol 37,3 %, Claude Fable 5.1 57,9 %. Datos reportados por el proveedor, y revisados: la fila de Grok 4.7 indicaba 38,0 % en la tabla del día del lanzamiento y hoy figura como 37,6 % en la página del proveedor.
• EEBench — Grok 4.7 64,0 %, Grok 4.6 53,0 %, GPT-5.6 Sol 39,4 %, Claude Fable 5.1 56,4 %. Según el proveedor.
• Harvey Legal Agent — Grok 4.7 19,6 %, Grok 4.6 15,8 %, GPT-5.6 Sol 2,5 %, Claude Fable 5.1 6,7 %. Según el proveedor.
• HealthBench Professional — Grok 4.7 56,7 %, Grok 4.6 48,5 %, GPT-5.6 Sol 60,5 %, Claude Fable 5.1 62,1 %. Datos reportados por el proveedor.
• AA Briefcase v1.1 — Grok 4.7 1,657, Grok 4.6 1,546, GPT-5.6 Sol 1,487, Claude Fable 5.1 1,678. Esta es la única fila de la tabla que ya no es exclusiva del proveedor: el propio tablero AA-Briefcase de Artificial Analysis publica los mismos 1,657 para Grok 4.7 con esfuerzo xhigh y 1,546 para Grok 4.6 con high. Las columnas de comparación siguen siendo la elección del proveedor de modelos y niveles de esfuerzo.
• GDPval Elo — Grok 4.7 1.695, Grok 4.6 1.605, GPT-6 Astra 1.542, Claude Fable 5.1 1.735. Datos reportados por el proveedor.
La lectura honesta de ese conjunto no es «Grok 4.7 gana». Supera a Grok 4.6 en las ocho, que es lo mínimo que un sucesor te debe. Frente al resto, es un balance mixto: por delante de GPT-5.6 Sol en CursorBench, Terminal-Bench y EEBench, por detrás en DeepSWE; por detrás de Claude Fable 5.1 en CursorBench, Terminal-Bench, HealthBench y ambas medidas de tipo Elo, por delante en EEBench y la evaluación del agente legal Harvey. También ilustra cuánto de un resultado de benchmark es el nivel de esfuerzo: el 71.0 % de DeepSWE es una cifra de esfuerzo alto dentro de una tabla que, por lo demás, se cita en xhigh.
La seguridad es el único ámbito en el que las afirmaciones del proveedor son inusualmente específicas. xAI dice que Grok 4.7 se construyó sobre una pila de salvaguardas totalmente nueva y lo califica como el modelo más sólido que la empresa ha probado en cuanto a rechazos y resistencia a jailbreak. En el benchmark de bioseguridad de LatchBio reporta un 62,4 %; en HackerBench v0.3 reporta que deja pasar el 3,3 % de los prompts riesgosos de doble uso, mientras que rara vez bloquea trabajo de seguridad legítimo. Esas son evaluaciones reportadas por el proveedor sobre el propio lanzamiento del proveedor, y ningún tercero las ha reproducido.
Los primeros números de este artículo que no son del proveedor son los tres que Artificial Analysis publicó el 21 de septiembre, y discrepan entre sí de una manera informativa. En el Intelligence Index, Grok 4.7 obtiene 46 con esfuerzo xhigh en la escala v4.3.2 —puesto 16 en esa tabla de clasificación— frente a 44 de Grok 4.6. Ese aumento de dos puntos es lo que Artificial Analysis dice que basta para llevar a SpaceXAI a los cuatro mejores laboratorios del índice. Lea la posición con precisión: es una afirmación sobre el mejor modelo de un laboratorio, no sobre este, y el modelo en sí todavía está cuatro puntos por debajo del 50 de Claude Fable 5 y siete por debajo del 53 que comparten Claude Fable 5.1 y GPT-6 Astra. Un aumento de dos puntos también está dentro del rango que aparece entre niveles de esfuerzo de un mismo modelo, lo que recuerda que un sucesor que obtiene una puntuación superior a la de su predecesor no es lo mismo que un sucesor que cambia lo que es posible. Una nota adicional sobre cómo leer el número: la versión de la escala importa, porque Artificial Analysis reformuló su índice y los valores 61/62/63 que aparecen en la mayoría de la cobertura de julio y agosto pertenecen a la escala retirada anterior a septiembre de 2026 —no se pueden comparar con estos.
El Coding Agent Index es el segundo número, y es el que se movió. Ejecutándose en el propio harness Grok Build de SpaceXAI con esfuerzo xhigh, Grok 4.7 obtiene 56 frente al 47 de Grok 4.6 —nueve puntos, no dos—, lo que lo sitúa cuarto entre los modelos evaluados en sus harnesses nativos, por detrás de Claude Fable 5.1, GPT-6 Astra y Claude Opus 5, y por delante de GPT-5.6 Sol. El índice es un compuesto de igual ponderación de DeepSWE v1.1, Terminal-Bench 4.0 y SWE-Atlas-QnA sobre 303 tareas, y los tres componentes mejoraron: DeepSWE del 65% al 73%, Terminal-Bench del 18% al 33%, SWE-Atlas-QnA del 58% al 63%. Esta es la primera evidencia independiente de que la corrección que describió xAI —aprendizaje por refuerzo más prolongado y ponderado hacia tareas de varias horas— hizo algo, y es el número que un equipo que elige un agente de programación debería sopesar más, porque se mide en el harness con el que el modelo realmente se distribuye, no en la tabla propia del proveedor.
La advertencia es lo que cuestan los nueve puntos. La propia ejecución de Artificial Analysis generó 240 millones de tokens de salida en el Intelligence Index, frente a una mediana de 94 millones entre los modelos que rastrea —más del doble—, y situó el coste de evaluar una tarea del Index en 3,74 dólares. A 6 dólares por millón de tokens de salida, la verbosidad es la partida que decide si un bucle agéntico es asequible, así que una ganancia de nueve puntos comprada con más del doble de la salida mediana es un verdadero intercambio, y no una mejora gratuita. La misma medición también significa que las puntuaciones principales no deberían leerse como un único veredicto: por token, la ventaja de Grok 4.7 sobre Grok 4.6 es menor de lo que sugiere el delta del índice, y en las evaluaciones de conocimiento general que componen el Intelligence Index es casi el mismo modelo con una factura sustancialmente mayor. El resultado de AA-Briefcase en la siguiente sección es la excepción a eso, y es una excepción considerable.

El segundo tablero independiente: AA-Briefcase, y lo que compra la mitad del coste por tarea
Artificial Analysis publicó un tercer número para Grok 4.7 ese mismo día, y es el que se refiere al trabajo de conocimiento y no al código. En AA-Briefcase —su propia tabla para el trabajo de conocimiento agéntico de horizonte largo, construida a partir de cuatro escenarios de proyectos de varias semanas y 91 entregables evaluados—, Grok 4.7 con esfuerzo xhigh obtiene 1.657 Elo, cuarto en la tabla y solo por detrás de las entradas de Anthropic: Claude Fable 5.1 con esfuerzo máximo (1.678), Claude Opus 5 con esfuerzo máximo (1.673) y Claude Fable 5.1 con esfuerzo xhigh (1.669). Está 16 Elo por detrás de Claude Opus 5 con esfuerzo máximo y, con esfuerzo xhigh, 8 Elo por delante de Claude Opus 5 con esfuerzo xhigh (1.649). Lee la posición con precisión: «solo por detrás de modelos de Anthropic» es la formulación que la propia Artificial Analysis utilizó, y es acertada, pero cuarto no es segundo, y las tres filas que están por encima son todas del mismo proveedor.
La ganancia respecto a la generación anterior es el mayor movimiento individual en el lanzamiento. Frente a Grok 4.6 en esfuerzo alto (1,546), Grok 4.7 en xhigh gana 111 Elo en AA-Briefcase — más de cincuenta veces la ganancia de dos puntos en el Intelligence Index. Artificial Analysis lo atribuye casi por completo a la calidad analítica: 1,994 Elo allí frente a 1,690 para Grok 4.6, mientras que la calidad de presentación baja ligeramente, 1,499 frente a 1,519. Esa es una firma legible: el modelo razona mejor sobre el análisis y formatea el entregable ligeramente peor. La misma dirección aparece en las cifras que Artificial Analysis citó para AA-Briefcase-Lite, el escenario público de diligencia debida que lanzó en Hugging Face — calidad analítica que sube de 1,698 a 1,994, presentación que baja de 1,531 a 1,499. Dos salvedades sobre esa comparación. AA-Briefcase-Lite es explícitamente demostrativo: la propia página de metodología de Artificial Analysis dice que el quinto escenario público "no cuenta para los resultados oficiales de AA-Briefcase". Y las cifras de calidad citadas para él coinciden con las filas de xhigh publicadas en el tablero principal, así que trate el párrafo de Lite como una ilustración de la dirección del recorrido en lugar de un marcador separado.
La línea de costo es donde este resultado cambia una decisión. La medida de costo por tarea de AA-Briefcase es el costo total de ejecutar el envío completo dividido entre sus 91 tareas; al desglosar los totales publicados por Artificial Analysis se obtiene aproximadamente $9.30 por tarea para Grok 4.7 en xhigh frente a aproximadamente $17.79 para Claude Opus 5 en esfuerzo máximo — alrededor de la mitad, por una diferencia de 16 puntos Elo. El propio resumen que hace Artificial Analysis del resultado es que Grok 4.7 se sitúa “justo por detrás de Opus 5, con ~50 % de su costo por tarea”. Ese es el mismo intercambio que describe el resto de este artículo, que llega a la misma respuesta desde otra dirección: Grok 4.7 no supera a la frontera; la deja por debajo en precio. Dos matices, ambos honestos. La factura de tokens es real: en AA-Briefcase-Lite, Artificial Analysis situó el costo de API de producir las presentaciones de ejemplo en unos $8 para Grok 4.7 en xhigh frente a unos $4.40 para Grok 4.6 en xhigh, de modo que el sucesor cuesta aproximadamente un 80 % más que el modelo al que reemplaza por el mismo trabajo. Y las cifras por tarea se calculan a partir del uso de tokens a precios de lista con una tasa representativa de aciertos de caché, así que varían según tu caché: son una estimación de una factura, no tu factura.
Dónde se sitúa Grok 4.7 frente a Grok 4.6 y el resto del sector
• Precio por 1M de tokens — Grok 4.7 $2 de entrada / $6 de salida por debajo de 200K de entrada, $4/$12 por encima; Grok 4.6 idéntico.
• Ventana de contexto — 500,000 tokens para ambos.
• Fecha de corte de conocimiento — mayo de 2026 para Grok 4.7 frente al 1 de febrero de 2026 para Grok 4.6.
• Esfuerzo de razonamiento — bajo / medio / alto / xhigh para Grok 4.7 frente a los niveles publicados de Grok 4.6.
• Puntuación independiente — 46 con esfuerzo xhigh frente a 44, en el Índice de Inteligencia v4.3.2 de Artificial Analysis. Suficiente, dice Artificial Analysis, para situar a SpaceXAI entre los cuatro mejores laboratorios del índice.
• Puntuación de codificación independiente — 56 frente a 47 en el Artificial Analysis Coding Agent Index, cada modelo en su arnés nativo. En cuarto lugar entre los modelos con arnés nativo, por delante de GPT-5.6 Sol.
• Puntuación independiente de trabajo de conocimiento — 1.657 Elo con esfuerzo xhigh frente a 1.546 de Grok 4.6 con alto, en el tablero AA-Briefcase de Artificial Analysis. Cuarto en total, por detrás de tres entradas de Anthropic y por delante de Claude Opus 5 con xhigh.
• Coste por tarea de AA-Briefcase: alrededor de $9,30 frente a alrededor de $17,79 para Claude Opus 5 con esfuerzo máximo, en la misma tabla. Aproximadamente la mitad de la factura por tarea por una diferencia de 16 Elo.
• Tokens de salida por ejecución de Index — 240 millones frente a una mediana de 94 millones entre los modelos que sigue Artificial Analysis. La mejora no sale gratis.
• Evaluación de codificación de proveedores — CursorBench 4.0 46,3 % frente a 40,4 %.
• Velocidad de servicio — una variante rápida con el doble de velocidad de salida por el doble de precio, frente al servicio estándar de Grok 4.6.
• Seguridad — un nuevo conjunto de salvaguardas, con un 62,4 % reportado en el benchmark de bioseguridad de LatchBio; Grok 4.6 se lanzó sin esa afirmación.
Y el campo, en el mismo marcador: Claude Fable 5.1 con 53, Claude Opus 5 con 51, GPT-5.6 Sol con 47, Kimi K3 con 44. La propia predicción de Musk —que Grok 4.7 «debería estar más o menos a la par de Opus 5.0, no de 5.1»— ahora tiene un número debajo, y el número cayó donde él dijo que caería: por debajo de la frontera, no por encima. La brecha medida con Claude Fable 5.1 es de siete puntos; la brecha de precio va en sentido contrario, con Claude Fable 5.1 listado a $10/$50 por millón de tokens frente a los $2/$6 de Grok 4.7 —cinco veces el precio de los tokens de entrada y más de ocho veces el de los tokens de salida—. Esa es la verdadera disyuntiva que se le pide a un equipo, y es una disyuntiva de precio-rendimiento más que una victoria de capacidades. AA-Briefcase es la única tabla de este artículo en la que cambia el orden: ahí Grok 4.7 en xhigh se sitúa por delante de Claude Opus 5 en xhigh, 1.657 a 1.649, aunque aún por detrás de Opus 5 en esfuerzo máximo con 1.673 y por detrás de Claude Fable 5.1 con 1.678. También vale la pena poner las tres puntuaciones independientes una al lado de la otra antes de trazar la línea, porque no apuntan en la misma dirección: siete puntos por detrás en inteligencia general, por delante de GPT-5.6 Sol en el índice de agentes de programación, 111 Elo de ventaja sobre su predecesor en trabajo de conocimiento, y pagando esas mejoras en tokens de salida. Cuál de esos hechos decide tu elección depende de si la carga de trabajo es un agente de programación, un entregable de conocimiento o un prompt de chat, y esa es una división más útil que una única clasificación.
En qué acertaron las filtraciones, y lo único que dejaron sin resolver.
Los artefactos que este artículo siguió hasta septiembre eran reales, y el lanzamiento los convierte en una prueba del valor que tiene ese tipo de evidencia. Aquí está el registro.
• La pull request del catálogo acertó con el precio. La propuesta del 21 de septiembre que añadía Grok 4.7 a los catálogos Zen y Go de un cliente de agentes de código abierto —abierta a las 05:36 UTC, cerrada automáticamente por un bot de cumplimiento a las 07:46 UTC por faltar una sección de la plantilla de pull request, y nunca fusionada— indicaba el modelo a las tarifas publicadas de Grok 4.6. Resultó ser exactamente correcta: $2/$6, sin cambios. Pero el mecanismo importa más que el resultado. El colaborador copió las tarifas del modelo que estaba encima, y esa copia resultó ser la conjetura correcta. Eso es suerte, no autoridad, y las afirmaciones sobre las capacidades de la misma pull request tampoco aportaban información. Una propuesta puede ser correcta y aun así no ser evidencia.
• El rastro de aprovisionamiento era auténtico y no era el lanzamiento. La fila de grok-4.7 en la página de cuotas de modelos de Google Cloud Console, reportada por rastreadores de la comunidad el 16–17 de septiembre, y el slug de compilación fechado grok-4-7-0907 que apareció en un error de configuración de Grok Bot, ambos apuntaban a un modelo que se estaba preparando. Ninguno de los dos tenía una fecha adjuntada por nadie, y ninguno de los dos era el anuncio. Lo que establecen es que se estaba preparando infraestructura de terceros —lo cual, en retrospectiva, era exacto y aun así no era un calendario.
• El número de parámetros nunca se confirmó. Aproximadamente 2,1 billones, alrededor de un 40 % por encima de Grok 4.6, repetido por Musk el 2 de septiembre — y aún ausente de todas las hojas de especificaciones en el lanzamiento. Este es el caso más claro en toda la saga de un número que circuló lo suficiente como para ser tratado como un hecho sin haber tenido nunca una fuente del proveedor.

La ficha anterior registra el estado previo al lanzamiento tal como este artículo lo comprobó por última vez: sin ID de modelo, sin fecha de lanzamiento y sin benchmarks publicados. Desde entonces, cada fila de ella ha quedado superada por el anuncio del 21 de septiembre, y se conserva aquí porque la distancia entre esa ficha y el modelo lanzado al mercado es la verdadera historia de las últimas seis semanas —un lanzamiento de frontera que no produjo ninguna especificación confirmada en absoluto hasta el día en que salió al mercado.
• La salvedad sobre la preparación es la pregunta abierta, y ahora cuenta con evidencia parcial. Musk dijo a mediados de septiembre que Grok 4.7 "termina prematuramente" en tareas de alta dificultad y que su verificación de respuestas "no es lo bastante estricta", lo que atribuyó a una penalización de aprendizaje por refuerzo para respuestas largas fijada demasiado alta, matizado con "posiblemente". El anuncio de lanzamiento no lo aborda. La corrección declarada por xAI es indirecta: un aprendizaje por refuerzo más prolongado, ponderado hacia tareas de varias horas, y una mejor autoverificación es exactamente el cambio que harías para abordar la terminación prematura. El resultado del Coding Agent Index es la primera señal externa de que movió la aguja —56 frente al 47 de Grok 4.6, con Terminal-Bench 4.0 casi duplicándose del 18% al 33%, que es precisamente el extremo de horizonte largo y muchos pasos del rango. No es una respuesta limpia, porque esas mismas puntuaciones del arnés también son las que compran sus ganancias con muchos más tokens de salida. Que el modelo siga abandonando tareas largas y difíciles es algo que cualquiera con acceso a la API puede comprobar, y sigue siendo lo primero que vale la pena probar.
• El corpus de SpaceX sigue sin verificarse. El supuesto complemento de entrenamiento —telemetría de Starlink, registros de presión de la cámara de combustión del Raptor, telemetría de reentrada de la Starship, hilos internos de Slack, tickets de Jira, repositorios de GitHub y registros de ERP— es un reporte de la comunidad sobre lo que dijo Musk, no una divulgación de la empresa. El anuncio de lanzamiento describe un modelo base más grande y una ejecución de aprendizaje por refuerzo más prolongada, y no dice nada sobre el corpus. Si está ahí dentro, ninguna hoja de especificaciones lo confirmará; la única evidencia será si el modelo hace algo en trabajo de ingeniería real que sus pares no puedan hacer.
La línea de tiempo que falló cuatro veces, y lo que el mercado acertó
Grok 4.7 se prometió, en público, en cinco plazos diferentes, y los primeros cuatro expiraron. El 24–25 de julio, Musk dijo unas cuatro semanas, lo que implicaba el 22 de agosto. El 12 de agosto lo revisó a "3 a 4 semanas," lo que implicaba el 2–9 de septiembre. El 2 de septiembre lo redujo a aproximadamente diez días, apuntando al 12 de septiembre. El 11 de septiembre, el día que se agotó, dijo "unos días más". El quinto no era una ventana en absoluto —una fila de grok-4.7 en una página de cuotas de Google Cloud— y fue el que más se acercó a lo correcto: el modelo se lanzó el 21 de septiembre, poco después de la última fecha a la que alguien se había comprometido, y sin una fecha adjunta al artefacto que lo precedió.
El contrato de Kalshi «¿SpaceXAI lanza Grok 4.7 antes del 18 de septiembre?» dejó de negociarse a las 03:59 UTC del 18 de septiembre tras cambiarse de manos por última vez a 65¢, con 1.785 contratos negociados y 1.211 abiertos. Todos los contratos liquidados en los dos mercados principales —las ventanas del 14, 21, 28 y 31 de agosto y del 4, 8 y 11 de septiembre de Kalshi, y los contratos del 12 y el 14 de septiembre de Polymarket— se resolvieron como No. El contrato de Polymarket «¿el próximo modelo Grok (4.7 o superior) lanzado antes del 18 de septiembre?» se situaba en 64 % el 15 de septiembre tras oscilar entre el 42 % y el 88,5 % a lo largo de once días. El mercado acertó al desestimar los picos impulsados por tuits, y acertó en que la ventana del 18 de septiembre cerraría vacía. Se quedó corto por tres días respecto al modelo, que es lo único que un contrato con fecha no puede valorar.
Vale la pena conservar los recuentos de visualizaciones como nota de calibración. La cuenta atrás de Musk del 2 de septiembre, «sale en 10 días», atrajo 10,29 millones de visualizaciones y fue incorrecta. Su marcha atrás del 11 de septiembre atrajo 2,05 millones y también fue incorrecta. Sus publicaciones sobre la hoja de ruta de los días 13 y 14 de septiembre atrajeron alrededor de 1,99 millones y fueron las más cercanas a acertar: describió Grok 4.8, un modelo de aproximadamente 2,5 billones de parámetros entrenado sobre un stack de C++ creado desde cero, como «una mejora notable» respecto a Grok 4.7. El alcance siguió a la confianza, no a la exactitud, durante todo el episodio.
Dos de los elementos de la hoja de ruta son ahora preguntas abiertas en lugar de predicciones. Grok 4.8 no tiene ID de modelo, ni precios, ni ventana de contexto, ni entrada de benchmark en ningún sitio. Y el planteamiento de que Grok 4.7 había sido "renombrado" discretamente como Grok 4.8 —la interpretación de un medio sobre que Musk nombrara el 4.8 mientras el 4.7 llegaba tarde— se resuelve en sentido contrario: el 4.7 se lanzó como 4.7, en el puesto 46 del Índice frente al 44 de Grok 4.6, lo cual es el incremento de un sucesor y no un relanzamiento.
Lo que esto significa para los equipos que llaman a Grok hoy
El panorama práctico cambió el 21 de septiembre, y lo hizo de la forma menos dramática posible: un nuevo ID de modelo con el mismo precio, la misma ventana de contexto, una ganancia de dos puntos en el Índice, una ganancia de nueve puntos en agentes de programación y una ganancia de 111 puntos en trabajo de conocimiento. Dos cambios desde entonces importan más de lo que parecen. Las aplicaciones de Grok ahora ponen el modelo en manos de usuarios comunes, no solo de desarrolladores, y el catálogo de este lado ya lo incluye; juntos convierten la capa de enrutamiento descrita al final de este artículo de un plan en una opción predeterminada. Si tu modelo de costos se basaba en Grok 4.6 a $2/$6, el precio por token sigue siendo correcto para Grok 4.7, pero el recuento de tokens no. La propia ejecución de Artificial Analysis quemó 240 millones de tokens de salida en el Índice de Inteligencia frente a una mediana de 94 millones entre los modelos que rastrea, así que la misma solicitud puede costar bastante más del doble aunque la tarifa sea idéntica, que es el tipo de cambio que nunca aparece en una tabla de precios. Calcula el costo de un bucle agéntico real por tokens de salida, no por la tarifa por millón, antes de concluir que este lanzamiento es gratis. Si tu razón para cambiar es la frontera de precio-rendimiento que el proveedor afirma, la evidencia más sólida para ello ahora es AA-Briefcase y no la tabla del proveedor: cuarto en ese tablero a aproximadamente la mitad del costo por tarea de Claude Opus 5, frente a una brecha de siete puntos en el Índice de Inteligencia con Claude Fable 5.1 y una brecha de precio que va en la otra dirección, de cinco veces en entrada y más de ocho veces en salida. Y si tu carga de trabajo es específicamente un agente de programación, el caso es más fuerte de lo que sugiere el Índice: 56 en el Índice de Agentes de Programación en el arnés Grok Build, por delante de GPT-5.6 Sol, es otra liga comparado con 46 en inteligencia general. Cuál de esos aspectos importa más depende por completo de tu carga de trabajo, y nadie fuera de SpaceXAI ha ejecutado Grok 4.7 en la tuya.
En el catálogo de OrcaRouter, la línea Grok ahora incluye Grok 4.7 junto con Grok 4.6, Grok 4.5 y Grok 4.3, facturados al precio de lista del proveedor con 0% de recargo: $2 por millón de tokens de entrada y $6 por millón de salida, lecturas de entrada en caché a $0,50, y el mismo escalón a $4 de entrada y $12 de salida una vez que una solicitud supera los 200.000 tokens de entrada que cobra SpaceXAI. Eso es lo que se consigue al pasar la tarifa sin tocar: el precio por token en tu modelo de costes es el precio por token en tu factura, y todos los modelos de la familia responden a una sola clave, así que mover una carga de trabajo de Grok 4.6 a Grok 4.7 es un cambio de cadena en lugar de un segundo contrato. Esa página incluye la ventana de contexto de 500.000 tokens y la misma interfaz compatible con OpenAI — Chat Completions y Responses — que ya tiene como objetivo una integración con Grok 4.6.

Esa capa de enrutamiento es también la forma de bajo riesgo de evaluar un modelo cuyos números independientes llegaron el mismo día que los del proveedor. La lista de benchmarks anterior sigue siendo del propio proveedor —sus evaluaciones elegidas, sus niveles de esfuerzo elegidos, sus columnas de comparación elegidas— y nada de ello se ha reproducido. Lo que ha cambiado es que las tres puntuaciones de Artificial Analysis no son del proveedor, así que la pregunta ha pasado de «¿algo de esto es real?» a «a cuál de estos resultados se parece mi carga de trabajo»: el 46 que indica inteligencia general de mitad de tabla, el 56 que indica cuarto entre los agentes de programación con harness nativo, o el 1.657 que indica cuarto en trabajo de conocimiento a la mitad del coste por tarea de los modelos de frontera. Y el número que decide la economía no es un benchmark en absoluto, sino los tokens de salida que consume una ejecución, que solo tu propio tráfico puede valorar en coste: 240 millones por ejecución de Index según la medición de Artificial Analysis, frente a una mediana de 94 millones, y aproximadamente $8 frente a $4,40 por conjunto de presentaciones de ejemplo en su escenario público AA-Briefcase-Lite. La conmutación por error automática te permite dirigir tráfico real al nuevo modelo y recurrir a un proveedor que siga respondiendo si la factura de tokens o el comportamiento de abandono prematuro resultan peores de lo anunciado, lo cual es la diferencia entre probar un modelo no demostrado y apostar una pipeline a él.
Cómo saber primero (la comprobación que funcionó)
Esta sección solía ser una lista de señales que observar durante la espera. La espera ha terminado, así que aquí está esa misma lista contrastada con lo que ocurrió en realidad.
• La lista de modelos fue la confirmación, y se movió. Durante seis semanas, la recomendación en este artículo fue vigilar la lista de modelos del proveedor en lugar de los tuits, porque en el momento en que Grok 4.7 fuera real, la lista añadiría un ID de modelo con precios y una ventana de contexto adjuntos. Eso es lo que ocurrió: grok-4.7 ahora aparece con una ventana de contexto de 500K, precios de $2/$6 por debajo de 200K de entrada y de $4/$12 por encima, una fecha de corte de conocimiento de mayo de 2026 y cuatro niveles de esfuerzo. Cada ventana de Musk, cada argumento sobre la cadencia y cada fecha de mercado no lograron mover esa lista; el lanzamiento la movió.
• Los catálogos de terceros encabezan el anuncio, y son propuestas, no despliegues. El pull request del catálogo del 21 de septiembre fue la versión más clara de esto hasta ahora, y su cierre es instructivo: un colaborador hizo preparativos para un modelo, un bot cerró el cambio por una sección de plantilla faltante dos horas después, y el modelo se lanzó dos días después de eso. Lee ese tipo de artefacto como intención con una marca de tiempo. Está genuinamente aguas arriba del anuncio, y no es disponibilidad.
• Vigila el catálogo de modelos de OrcaRouter. Ahora ha cambiado. Durante todo septiembre, el consejo de este artículo era que una página del modelo grok-4.7 en orcarouter.ai sería la señal de «puedes llamarlo hoy a través de nosotros», porque un modelo solo se lista una vez que un proveedor lo ha incorporado. El catálogo ahora incluye Grok 4.7 a la tarifa del proveedor y sin margen de beneficio, así que la verificación que se le indicó al lector que hiciera ya tiene respuesta: hoy se puede enrutar a través de una sola API.
• For consumer-side visibility, the Grok app has now put Grok 4.7 in front of users who will never open an API console. Read again on October 2, the picker data grok.com serves to a logged-out visitor still names the model on two of its four entries — Expert reads "Thinks hard · Grok 4.7" and Heavy reads "Team of Experts · Grok 4.7" — while Fast, which is the mode the app opens in by default, is described only as "Quick responses" and Auto as choosing between Fast and Expert. The four entries are Auto, Fast, Expert and Heavy. Build is not one of them: Grok Build is a separate terminal product on its own page, and that page is where the model's Build attribution actually comes from — it tells visitors to "install now and start building with Grok 4.7". So the claim that circulated on October 1 and was repeated on October 2 — that Grok 4.7 is now the base model across "Fast, Expert, Build and Heavy" — lists a mode the app does not serve and omits the one it opens in, and it is the trackers' reading rather than the vendor's, because SpaceXAI has posted nothing about this rollout at all. The equivalent Grok 4.5 step got a blog post of its own; this one has a product that changed quietly underneath a news page that did not.
El estado de la cuestión
Grok 4.7 shipped on September 21, 2026, at $2 per million input tokens and $6 per million output tokens with a 500,000-token context window and a May 2026 knowledge cutoff. What has changed in the eleven days since is the availability map rather than the model: Amazon Bedrock added it on September 28, it began rolling out inside Grok's own web and mobile apps on October 1 and was still rolling out there on October 2, and it is now listed on OrcaRouter at SpaceXAI's own rate with no markup. Its independent scores arrived the same day as the launch and still disagree: 46 at xhigh effort on Artificial Analysis' v4.3.2 Intelligence Index, two points above Grok 4.6 and enough to put SpaceXAI in the index's top four labs; 56 on the Coding Agent Index in the Grok Build harness, nine points above Grok 4.6 and fourth among native-harness models ahead of GPT-5.6 Sol; and 1,657 Elo on AA-Briefcase, 111 points above Grok 4.6 and fourth on the board behind three Anthropic entries, at roughly half Claude Opus 5's cost per task. Every benchmark in the vendor's launch table is the vendor's own and unreproduced, with one exception: Artificial Analysis' own AA-Briefcase board publishes the same 1,657, and the vendor has since revised its own Terminal-Bench row from 38.0% down to 37.6%. The coding and knowledge-work gains are real and they cost output tokens — 240 million per Index run against a 94 million median, and about $8 against $4.40 per set of example decks on AA's public due-diligence scenario — which is the number that decides whether this release is cheap. The ~2.1-trillion-parameter figure that circulated for two months still has no vendor source, and the premature-abandonment caveat was never directly addressed, though the Terminal-Bench jump from 18% to 33% in the Grok Build harness is the first outside evidence that the fix worked. Both signals this piece told readers to watch have fired: the vendor's model list gained grok-4.7 with a price and a context window attached, and the catalog here lists it at the same rate. So the winning move is simpler than it was in September — Grok 4.6 at $2/$6 was the answer, and Grok 4.7 at $2/$6 is the same answer with a newer model ID, better coding and knowledge-work scores, a much larger token bill, and a consumer app that names it on its two hardest modes.
Comparados en este artículo3
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
