Una tarjeta hero generada para una comparación entre GPT-6.1 Sol y Grok 4.7, con el titular «40 % más barato por token, 5,2 veces la factura», con tres insignias que dicen «Salida de Grok 4.7: $6.00 por 1 M», «Salida de GPT-6.1 Sol: $10.00 por 1 M» y «Tokens de salida en la ejecución del índice: 67 M vs 240 M», y el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

GPT-6.1 Sol vs Grok 4.7: la tarifa de salida más barata de la sala, y la conversación más costosa

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Grok 4.7, el sucesor de Grok 4.6 por parte de x​AI, llegó el 21 de septiembre de 2026 a $2.00 por millón de tokens de entrada y $6.00 por millón de tokens de salida. GPT-6.1 Sol, la actualización de gama media de Open​AI, llegó ocho días después, el 29 de septiembre, a $2.00 de entrada y $10.00 de salida. Las tarifas de entrada son idénticas, la tarifa de salida es un 40% más barata en Grok 4.7, y ahí es donde se detienen la mayoría de las comparaciones. Es el lugar equivocado para detenerse, porque el mismo panel independiente ahora ha medido ambos modelos de principio a fin: Grok 4.7 consumió aproximadamente 240 millones de tokens de salida al completar el Artificial Analysis Intelligence Index; GPT-6.1 Sol consumió 67 millones. Multiplique la tarifa más barata por tres veces y media el volumen y el modelo con el precio más bajo por token cuesta $3.74 por tarea completada frente a $0.72.

Dos modelos, con ocho días de diferencia, y una tabla de tarifas que se invierte

Grok 4.7 es el modelo más potente de x​AI para la programación y el trabajo con conocimiento: una ventana de contexto de 500.000 tokens, hasta 450.000 tokens de salida en una sola respuesta según el propio listado del proveedor, entrada de texto, imágenes y archivos, y esfuerzo de razonamiento configurable en low, medium (predeterminado), high y xhigh. x​AI no ha revelado un recuento de parámetros, y su fecha de corte de preentrenamiento se reporta como junio de 2026, con entrenamiento complementario hasta agosto.

GPT-6.1 Sol es la actualización de un solo escalón de OpenAI para el nivel GPT-6 Sol, situada por debajo de GPT-6 Astra y por encima de GPT-6 Sol: 1.050.000 de contexto —aproximadamente el doble que el de Grok—, con un techo de salida de 128.000 tokens que es más o menos un tercio del de Grok, una fecha de corte de conocimientos del 30 de abril de 2026, y la misma entrada de texto, imágenes y archivos. Su escalera de razonamiento va desde low hasta max, con un valor predeterminado de medium, y ya no acepta none en absoluto.

Una línea por dimensión, ambos lados en cada una:

• Entrada — GPT-6.1 Sol $2.00 por 1M vs. Grok 4.7 $2.00 por 1M; idéntico
• Salida — GPT-6.1 Sol $10.00 por 1M vs. Grok 4.7 $6.00 por 1M; Grok es un 40% más barato
• Entrada en caché — GPT-6.1 Sol $0.10 por 1M vs. Grok 4.7 $0.50 por 1M; Sol es cinco veces más barato, lo contrario de lo que implica la línea de salida
• Ventana de contexto — 1,050,000 tokens vs. 500,000
• Salida máxima en una respuesta — 128,000 tokens vs. 450,000 declarados
• Tramo de contexto largo — se vuelve a tarifar la solicitud completa por encima de 272,000 tokens de entrada a 2× entrada y caché y 1.5× salida vs. cada tarifa duplicada por encima de 200,000 tokens de entrada, también para toda la solicitud
• Esfuerzo de razonamiento — low, medium (predeterminado), high, xhigh, max vs. low, medium (predeterminado), high, xhigh
• Pesos y parámetros — cerrados, no divulgados vs. cerrados, no divulgados; ninguno ofrece un checkpoint
• Índice de inteligencia con el máximo esfuerzo publicado — GPT-6.1 Sol 51.8 en max vs. Grok 4.7 46.4 en xhigh
• Coste por tarea del índice, independiente — $0.72 vs. $3.74
• Tokens de salida en la ejecución del índice — 67 millones vs. 240 millones, frente a una mediana del ranking cercana a 81 millones

Dos líneas de esa lista constituyen toda la comparación. La tasa de salida de Grok 4.7 es genuinamente más baja y su línea de caché es genuinamente cinco veces más alta; y generó tres veces y media los tokens que se midieron. La tabla de tarifas, leída por sí sola, apunta en una dirección. La medición apunta en la otra, por un factor de cinco.

A generated hero card for a GPT-6.1 Sol versus Grok 4.7 comparison, headed '40% cheaper per token, 5.2 times the bill', with two badges reading 'Grok 4.7 output: $6.00 per 1M' and 'GPT-6.1 Sol output: $10.00 per 1M', a footer reading 'Independent figures per Artificial Analysis v4.3.2; Grok at xhigh, Sol at max; AI-generated card', and the OrcaRouter logo in the bottom-right corner.

Dónde Grok 4.7 está realmente por delante

Sería deshonesto publicar este artículo como una derrota aplastante, porque Grok 4.7 gana en evaluaciones reales. Puntuados en paralelo con el máximo esfuerzo publicado en Artificial Analysis v4.3.2 — Grok en xhigh, Sol en max, una diferencia de configuración que conviene tener en cuenta en todo momento:

• GDPval-AA v2.1 — Grok 4.7 Elo 1715,4 frente a GPT-6.1 Sol Elo 1575,1. Una ventaja de 140 puntos de Elo en trabajo de conocimiento económicamente valioso, y la mayor victoria independiente individual para el modelo de tarifa más económica.
• AutomationBench-AA — Grok 4.7 0,6556 frente a GPT-6.1 Sol 0,6487. En la práctica, un empate; nominalmente, de Grok.
• SciCode — Grok 4.7 0,5741 frente a GPT-6.1 Sol 0,5417. Una ventaja de 3,2 puntos en programación científica.
• Terminal-Bench 4.0 — Grok 4.7 0,2576 frente a GPT-6.1 Sol 0,5606. Un déficit de 30 puntos, y la mayor diferencia del emparejamiento.
• Humanity's Last Exam — Grok 4.7 0,4314 frente a GPT-6.1 Sol 0,5292.
• AA-LCR v1.1, razonamiento de contexto largo — Grok 4.7 0,7667 frente a GPT-6.1 Sol 0,83.
• AA-Omniscience — Grok 4.7 32,0 frente a GPT-6.1 Sol 41,5.
• GDP.pdf — Grok 4.7 0,20 frente a GPT-6.1 Sol 0,31.
• CritPt — Grok 4.7 0,1771 frente a GPT-6.1 Sol 0,3171.

Tres de nueve evaluaciones favorecen a Grok 4.7 o terminan en empate, incluida la que resulta más difícil de rebatir: GDPval-AA está diseñado para poner precio al trabajo profesional económicamente valioso, y una ventaja de 140 puntos Elo no es ruido. Si tu carga de trabajo es del tipo que GDPval fue concebido para representar —análisis con gran cantidad de documentos, entregables profesionales, decisiones de criterio con una respuesta correcta—, el modelo con la tarifa más barata también es el mejor modelo en la tabla neutral, y la penalización de coste por tarea es lo que pagas por ello.

Los propios números de lanzamiento de x​AI son elevados y, como todas las cifras de lanzamiento de proveedores, no han sido reproducidos. CursorBench 4.0 con 46.3% en xhigh frente al 40.4% de Grok 4.6; Terminal-Bench 4.0 con 38.0% frente a 20.3%, la mayor ganancia única declarada en el lanzamiento; DeepSWE v1.1 con 71.0% en high frente a 65.2%; EEBench con 64.0% frente a 53.0%. Esos son el harness de x​AI, la configuración de x​AI, el reporte de x​AI — y conviene notar que la afirmación del 38.0% en Terminal-Bench 4.0 se contrapone al 0.2576 del board independiente para el mismo modelo en el mismo benchmark, que es el tipo de discrepancia que cabe esperar entre una configuración ajustada de un proveedor y una ejecución neutral de máximo esfuerzo.

Open​AI's cifras para GPT-6.1 Sol merecen el mismo descuento y tienen la misma debilidad. El único número de esta comparación que ningún proveedor produjo es el coste por tarea completada, porque se calcula a partir del consumo de tokens medido y no de una tabla de puntuaciones. Esa es la cifra que sobrevive.

Por qué 240 millones de tokens lo deciden

Artificial Analysis describe la verbosidad de Grok 4.7 en su propio resumen, y el recuento de tokens que hay detrás de la ejecución del índice es la prueba: 240 millones de tokens de salida frente a una mediana del ranking cercana a 81 millones, aproximadamente tres veces lo que produce un modelo típico en el mismo conjunto de pruebas. Los 67 millones de GPT-6.1 Sol se sitúan muy por debajo de la mediana. Si se juntan las dos proporciones —3,6× el volumen a 0,6× el precio—, la tarifa de salida más barata está comprando más tokens en lugar de una factura más pequeña, que es exactamente el aspecto que tiene una diferencia de costo por tarea de $3,74 frente a $0,72.

El almacenamiento en caché cambia el tamaño del efecto, pero no su dirección, y este es el detalle que hace tropezar a la gente. La entrada en caché de Grok 4.7 cuesta $0.50 por millón frente a los $0.10 de Sol: cinco veces más caro en la línea donde viven los historiales largos de agentes y los prompts de sistema repetidos. Por lo tanto, una carga de trabajo dominada por releer un prefijo grande y estable encuentra que los dos modelos están más cerca de lo que sugiere la comparación entre $6 y $10, y, una vez que se aplica encima la verbosidad de Grok, más separados de lo que sugieren las tarifas de entrada. La línea de caché y la línea de tokens apuntan en la misma dirección aquí, lo cual es inusual y hace que este emparejamiento sea más limpio de lo que implican las tarjetas de tarifas.

Las cláusulas de contexto largo merecen tarificarse por separado porque se activan en puntos distintos. GPT-6.1 Sol vuelve a tarificar toda una solicitud por encima de los 272.000 tokens de entrada; Grok 4.7 hace lo mismo por encima de los 200.000. En una llamada de 250.000 tokens, Grok ya se ha duplicado —4,00 $ y 12,00 $ con una lectura de caché de 1,00 $—, mientras que Sol sigue con sus tarifas estándar de 2,00 $ y 10,00 $. Entre los 200.000 y los 272.000 tokens, el modelo con la tarifa más barata es el más caro por un amplio margen, y esa franja es habitual en el trabajo con documentos.

Donde Grok realmente gana en estructura, más que en puntuación, es en el techo de salida. Una respuesta máxima de 450.000 tokens frente a los 128.000 de Sol es una clase distinta de artefacto: una base de código completa generada, una transcripción larga, una síntesis del tamaño de un libro en una sola llamada. Si hoy estás alcanzando los límites de salida, esa línea decide la comparación y nada de la aritmética de costos anterior aplica: no puedes comprar a ningún precio una capacidad que el otro modelo no tiene.

Ambos están en una misma tecla, que es la parte útil.

Grok 4.7 está en OrcaRouter al propio precio de lista de xAI — $2.00 y $6.00 por millón de tokens, con una lectura de caché de $0.50 y el tramo de 200,000 tokens a $4.00 y $12.00 aplicado exactamente tal como xAI lo publica — y GPT-6.1 Sol llegó a nuestras rutas el día del lanzamiento al precio de OpenAI, $2.00 y $10.00 con la entrada en caché a $0.10 y el tramo de 272,000 tokens sin cambios. No se añade nada a ninguno de los dos: la plataforma traslada el precio de lista del proveedor en lugar de aplicar un recargo, lo que significa que una rebaja de precio del proveedor en cualquiera de los dos lados está vigente aquí el mismo día en que lo está allí, sin una segunda factura y sin un revendedor de por medio.

A screenshot of the OrcaRouter model page for grok/grok-4.7, showing the listing dated 2026-09-21, the model described as SpaceXAI's flagship for coding, agentic tasks and knowledge work, a 500K-token context with up to 450K output tokens, text, image and file input, and the list price of $2.00 input and $6.00 output per million tokens with a 4.03 s median time to first token.

Para este par en particular, eso vale más que la conveniencia. Los dos modelos no coinciden en aquello en lo que son buenos —Grok 4.7 lidera en Elo de trabajo profesional y en programación científica, GPT-6.1 Sol lidera en ejecución en terminal, fiabilidad factual y recuperación de contexto largo—, y la frontera entre esas cargas de trabajo es visible en tu propio tráfico antes de que sea visible en un benchmark. Enviar solicitudes con la forma de GDPval por un lado y ejecuciones de agentes de horizonte largo por otro, detrás de un único endpoint, con conmutación por error automática entre ambos y una regla de enrutamiento que cambias en la configuración en lugar de en un despliegue, es una forma más barata de encontrar esa frontera que un proyecto de evaluación. La fusión de modelos, en la que un panel de modelos responde en conjunto, es la otra opción que ofrece la plataforma si prefieres no elegir por solicitud en absoluto.

A screenshot of xAI's Grok 4.7 developer documentation, showing the model ID grok-4.7, the description 'SpaceXAI's frontier model for coding, agentic tasks, and knowledge work', text and image to text modalities, a 500,000-token context window, and pricing of $2.00 per 1M input tokens and $6.00 per 1M output tokens.

La llamada

• Trabajo agéntico y de terminal de salida larga, bucles de prefijo en caché — GPT-6.1 Sol. Treinta puntos en Terminal-Bench 4.0, una línea de caché cinco veces más barata y un quinto del costo por tarea completada.
• Trabajo de conocimiento profesional, análisis de documentos, tareas de juicio — Grok 4.7 gracias a una ventaja de 140 puntos en el Elo de GDPval-AA, con la factura de tokens presupuestada en lugar de asumida.
• Programación científica — Grok 4.7, por poco, en la división SciCode del tablero. Compruébalo con tu propio conjunto; 3.2 puntos está dentro del rango que un conjunto de prompts diferente puede mover.
• Respuestas individuales por encima de 128,000 tokens de salida — Grok 4.7, y no hay aritmética que lo sustituya.
• Solicitudes entre 200,000 y 272,000 tokens de entrada — GPT-6.1 Sol, porque Grok 4.7 ya ha duplicado toda su solicitud y Sol no.
• La conversación más barata posible — ninguno de estos dos. Ambos son modelos con precios de frontera y apetitos de tokens de frontera; la comparación se trata de cuál termina tu tarea, no de cuál es barato en abstracto.
• Si una comparación termina con "Grok es más barato por token" — terminó un paso demasiado pronto. El siguiente paso es el recuento de tokens, y es 240 millones contra 67.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario