Una tarjeta de título principal para un artículo que compara GPT-6 Sol con Grok 4.7, que dice 'GPT-6 Sol vs Grok 4.7' con el subtítulo 'El token más barato que cuesta tres veces más', mostrando la estadística '240M vs 77M tokens de salida' con Grok 4.7 a $6.00 de salida y $3.74 por tarea y GPT-6 Sol a $10.00 de salida y $1.06 por tarea.
Guides & Insights

GPT-6 Sol vs Grok 4.7: El token más barato que cuesta tres veces más

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Dos modelos se lanzaron con un día de diferencia en septiembre de 2026, y en la etiqueta de precios no están cerca. Grok 4.7 llegó el 21 de septiembre a $2.00 por millón de tokens de entrada y $6.00 por millón de tokens de salida. GPT-6 Sol llegó el 22 de septiembre con los mismos $2.00 de entrada y $10.00 de salida. La salida de Grok es un 40% más barata. Esa es toda la base sobre la que la mayoría de las comparaciones lo elegirán, y es el número equivocado en el que fijarse.

El número que decide este emparejamiento no está en ninguna de las dos tarifas. Son 240 millones frente a 77 millones: los tokens de salida que generó cada modelo mientras Artificial Analysis ejecutaba su Intelligence Index. Grok 4.7 consumió un poco más del triple de tokens para responder el mismo conjunto de preguntas. Multiplícalo por la tarifa por token y el modelo con la salida más barata termina costando $3.74 por tarea completada frente a $1.06. Más barato por token, más del triple de factura.

Lo que cada modelo realmente es

Grok 4.7 es el sucesor de Grok 4.6 de xAI, posicionado como su modelo más potente para programación y trabajo con conocimiento, con una ventana de contexto de 500.000 tokens, entrada de texto e imágenes, salida de texto y esfuerzo de razonamiento configurable entre bajo, medio, alto y xhigh. xAI no ha divulgado un número de parámetros. Acepta un corte de preentrenamiento reportado como junio de 2026, con entrenamiento complementario hasta agosto.

GPT-6 Sol es el modelo GPT-6 de gama media de OpenAI —por debajo del insignia GPT-6 Astra y por encima del económico GPT-6 Luna—, con una ventana de contexto de 1.050.000 tokens, una entrada máxima de 922.000 tokens, un límite de salida de 128.000 tokens y una fecha de corte de conocimiento del 20 de abril de 2026. Recibe texto e imágenes y genera texto, con un esfuerzo de razonamiento desde none hasta max, y OpenAI ha descrito su precio como permanente en lugar de promocional.

Las ventanas de contexto no están ni cerca. La de Sol es aproximadamente el doble. Eso importa para exactamente una clase de carga de trabajo, y no es la clase que ejecuta la mayoría de la gente.

La tabla de tarifas, y la línea que la invierte

• Entrada — GPT-6 Sol $2.00 por millón de tokens vs Grok 4.7 $2.00 por millón de tokens; idénticos

• Salida — GPT-6 Sol $10.00 por millón de tokens vs Grok 4.7 $6.00 por millón de tokens; Grok es 40% más barato

• Entrada en caché — GPT-6 Sol $0.20 por millón de tokens frente a Grok 4.7 $0.50 por millón de tokens; la lectura de caché de Sol es más barata por un factor de dos y medio, que es lo opuesto de lo que implica la tarifa de salida

• Escrituras en caché — GPT-6 Sol $2.50 por millón de tokens frente a Grok 4.7, una tarifa que no se publica en la misma hoja

• Ventana de contexto — GPT-6 Sol 1.050.000 tokens vs Grok 4.7 500.000 tokens

• Recargo por contexto largo — GPT-6 Sol cobra una solicitud de más de 272.000 tokens de entrada a 2× las tarifas de entrada y de caché y 1,5× la de salida para toda la solicitud, mientras que Grok 4.7 duplica todas las tarifas a partir de 200.000 tokens de entrada, también para toda la solicitud

• Fecha de corte de conocimiento — GPT-6 Sol, 20 de abril de 2026 vs. Grok 4.7, una fecha de corte de preentrenamiento reportada como junio de 2026, con entrenamiento complementario hasta agosto

• Esfuerzo de razonamiento — GPT-6 Sol ninguno, bajo, medio (predeterminado), alto, xhigh, máximo vs Grok 4.7 bajo, medio (predeterminado), alto, xhigh

• Modalidad — texto e imagen de entrada, texto de salida, para ambos

La línea de caché es la que un comprador debería sopesar con calma. La tarifa de salida de Grok es más baja, pero su entrada en caché es dos veces y media la de Sol, y la entrada en caché es donde viven los historiales largos de agentes y los prompts de sistema repetidos. Una carga de trabajo que en su mayoría relee un contexto grande y estable encontrará que los dos están mucho más cerca de lo que sugiere $6 frente a $10, y una vez que se aplica encima la relación de volumen de tokens, el orden se invierte.

A six-row scoreboard card titled 'GPT-6 Sol vs Grok 4.7 - the scoreboard', comparing the two models on output price, cached input, context window, Intelligence Index score, index output tokens and cost per task. The left column lists GPT-6 Sol at $10.00 output, $0.20 cached input, a 1,050,000-token context, an Index of 48, 77M index tokens and $1.06 per task; the right column lists Grok 4.7 at $6.00 output, $0.50 cached input, a 500,000-token context, an Index of 46, 240M index tokens and $3.74 per task. A footer reads 'Vendor list prices; index figures per Artificial Analysis.'

Por qué 240 millones de tokens lo son todo

Artificial Analysis midió Grok 4.7 en xhigh generando aproximadamente 240 millones de tokens de salida durante su ejecución de índice, frente a una mediana de unos 88 millones para los modelos de la misma tabla. Su propio resumen califica el modelo como «notablemente lento y muy verboso». GPT-6 Sol, medido en el mismo entorno, generó 77 millones —descrito en la tabla como «bastante conciso».

El consejo también informa directamente de la consecuencia. Grok 4.7 obtiene 46 en el Intelligence Index a $3.74 por tarea. En su configuración alta, la puntuación también es 46 y el costo es de $2.73 por tarea. GPT-6 Sol obtiene 48 a $1.06 por tarea. El mismo índice, el mismo harness y una diferencia de costo de dos a tres veces y media que ninguna tarifa de precios muestra.

Dos advertencias antes de que trates esas cifras como una comparación directa y limpia. Las dos páginas se capturaron el mismo día, pero las tablas tienen totales diferentes —la página de Grok muestra una clase de 212 modelos, y un listado de Grok aparte reporta un puesto sobre un total de 655—, así que no se garantiza que las dos puntuaciones correspondan a la misma compilación del índice. Y ninguna de las dos cifras es un número del proveedor: Artificial Analysis ejecuta su propio harness, que es justamente la cuestión, pero los ajustes de razonamiento difieren entre los dos listados (xhigh para Grok, max para Sol), así que considera la brecha de coste del quinientos por ciento como el hallazgo y la brecha de dos puntos en el índice como aproximada.

Screenshot of the Artificial Analysis model page for Grok 4.7 (xhigh), captured 23 September 2026, showing an Intelligence Index score of 46, list pricing of $2.00 per million input tokens and $6.00 per million output tokens with a 75% cache discount, a cost of $3.74 per Intelligence Index task, 240 million output tokens generated during the index run, a 500,000-token context window and 39.2 output tokens per second.

Lo que xAI publicó, y lo que nadie ha comprobado

Las propias cifras de lanzamiento de xAI son sólidas y, como todas las cifras de lanzamiento de proveedores, no han sido reproducidas. CursorBench 4.0 con un 46,3 % en xhigh frente al 40,4 % de Grok 4.6. Terminal-Bench 4.0 con un 38,0 % frente al 20,3 % —el mayor incremento individual del lanzamiento. DeepSWE v1.1 con un 71,0 % en high frente al 65,2 %. EEBench con un 64,0 % frente al 53,0 %. Ese es el arnés de pruebas de xAI, la configuración de xAI, los informes de xAI.

Las cifras de OpenAI para GPT-6 Sol siguen el mismo patrón y merecen el mismo descuento. La diferencia es que Sol cuenta con una pieza más de evidencia independiente que Grok: la cifra de coste por tarea de Artificial Analysis, que se calcula a partir del consumo de tokens medido en lugar de la tabla de puntuaciones de un proveedor. Ese es el número que sobrevive a esta comparación.

Lo que nadie ha publicado para ninguno de los dos modelos es una comparación cara a cara en las mismas tareas con el mismo arnés y la misma configuración de esfuerzo. Si ves una, comprueba cuál de esas tres variables se movió.

Cómo tarificar un mes de tráfico de agentes en caché

Toma una carga de trabajo que en su mayoría es contexto estable: un agente de programación con un prompt de sistema de 60.000 tokens y un resumen del repositorio, que se relee en 5.000 llamadas al mes, y cada una devuelve 4.000 tokens de salida. Supón que el almacenamiento en caché funciona y que el prefijo estable se factura a la tarifa de caché.

En GPT-6 Sol: 300 millones de tokens de entrada en caché a $0.20 por millón son $60.00. Veinte millones de tokens de salida a $10.00 por millón son $200.00. Total, $260.00.

En Grok 4.7: los mismos 300 millones de tokens de entrada en caché a $0.50 por millón son $150.00. Veinte millones de tokens de salida a $6.00 por millón son $120.00. Total, $270.00.

Casi idénticos, y eso es con el volumen de tokens mantenido constante, que es la suposición generosa. La verbosidad medida de Grok 4.7 en la ejecución del índice fue tres veces la de Sol. Aplica incluso un multiplicador de 1,5× al volumen de salida y la factura de Grok sube a $330.00 frente a los $320.00 de Sol, y la brecha se amplía a partir de ahí. La tarifa de salida más barata no sobrevive a la caché más la verbosidad; apenas sobrevive a la caché por sí sola.

Nada de esto es una afirmación sobre el precio de ninguno de los dos modelos a través de OrcaRouter — ninguno está en nuestro catálogo. Se puede acceder a GPT-6 Sol mediante la propia API de OpenAI y a Grok 4.7 mediante la de xAI; el resto de la línea Grok, incluido Grok 4.6, se puede enrutar a través de nosotros al precio de lista de xAI bajo el modelo de traspaso. El punto de la aritmética es que la regla de escalado que escribas debe basarse en el costo por tarea completada en tu propio tráfico, no en la tarifa publicada, y una capa de enrutamiento es lo que te permite probar esa regla sin un segundo contrato.

Screenshot of OrcaRouter's model page for Grok 4.6, captured 23 September 2026, showing the model id grok/grok-4.6 from provider SpaceXAI, a 500,000-token context window, text, image and file input, list pricing of $2.00 per million input tokens and $6.00 per million output tokens, and an OpenAI-compatible API served over both /v1/chat/completions and /v1/responses. Grok 4.7 itself does not appear on the catalogue.

Donde cada uno pertenece

• Trabajo de agentes de gran volumen con contexto en caché — GPT-6 Sol. La línea de entrada en caché es 2,5× a favor de Sol y la línea de volumen de salida es peor que la de Grok, y ambas se potencian.

• Trabajo de programación en el que quieras la mejora publicada más potente de Terminal-Bench en la versión — Grok 4.7 es el modelo que tiene la cifra, y es una cifra enorme. Solo presupuesta para los tokens, no para la tarifa.

• Documentos largos de más de 500.000 tokens — GPT-6 Sol, y no hay comparación. La ventana de Grok termina donde la de Sol va por la mitad.

• Rutas sensibles a la latencia: ninguna de las dos. Artificial Analysis sitúa a Grok 4.7 en 39,2 tokens de salida por segundo, lo que describe como notablemente lento. Consulta la propia cifra de velocidad de Sol en el panel actual antes de asumir que es mejor.

• Si te mostraron una comparación por token que termina con «así que Grok es más barato» — terminó un paso demasiado pronto. El siguiente paso es el recuento de tokens.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario