
GPT-6 Sol Pro vs Grok 4.7: el doble de verbosidad, un tercio del precio
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 986 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 196 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 112 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
Los dos modelos más baratos cercanos a la frontera de septiembre de 2026 se lanzaron con un día de diferencia, y lo interesante de ellos no es cuál es más inteligente. GPT-6 Sol — el modelo al que la gente recurre cuando busca GPT-6 Sol Pro, que es ese modelo con su reasoning.mode configurado en pro en lugar de ser un producto aparte — se lanzó el 22 de septiembre de 2026 a 2,00 dólares por millón de tokens de entrada y 10,00 dólares por millón de tokens de salida. Grok 4.7 del proveedor se lanzó el 21 de septiembre con la misma entrada de 2,00 dólares y una salida de 6,00 dólares. En el arnés neutral de Artificial Analysis, los dos quedan separados por dos puntos del índice y por aproximadamente dos dólares por tarea completada, y la razón de esa brecha no es la capacidad. Es cuántos tokens quema cada uno para llegar hasta allí.
Sol generó 77 millones de tokens de salida al ejecutar el Intelligence Index. Grok 4.7 generó 240 millones. Esa proporción —un poco más de tres a uno— es toda la comparación, e invierte la conclusión que te da una tabla de precios por token.
Las dos tarjetas de tarifas, y dónde la barata no es barata
Ambos proveedores publican estas cifras por sí mismos; a ninguno de los dos se le ha fijado un nuevo precio de forma independiente.
• Entrada — GPT-6 Sol $2.00 por millón de tokens vs Grok 4.7 $2.00 por millón de tokens
• Salida — GPT-6 Sol $10.00 por millón de tokens frente a Grok 4.7 $6.00 por millón de tokens
• Entrada en caché — GPT-6 Sol $0.20 por millón de tokens frente a Grok 4.7 $0.50 por millón de tokens; la lectura de caché de Sol es más barata por un factor de dos y medio, lo que es lo contrario de lo que sugiere la tarifa de salida destacada
• Ventana de contexto — GPT-6 Sol 1.050.000 tokens vs Grok 4.7 500.000 tokens
• Recargo por contexto largo — GPT-6 Sol cobra una solicitud de más de 272.000 tokens de entrada a 2× las tarifas de entrada y de caché y 1,5× la de salida para toda la solicitud, mientras que Grok 4.7 duplica todas las tarifas a partir de 200.000 tokens de entrada, también para toda la solicitud
• Fecha de corte de conocimiento — GPT-6 Sol, 20 de abril de 2026 vs. Grok 4.7, una fecha de corte de preentrenamiento reportada como junio de 2026, con entrenamiento complementario hasta agosto
• Esfuerzo de razonamiento — GPT-6 Sol ninguno, bajo, medio (predeterminado), alto, xhigh, máximo vs Grok 4.7 bajo, medio (predeterminado), alto, xhigh
• Modalidad — ambos aceptan entrada de texto e imagen y devuelven texto
La línea de lectura de caché es en la que un comprador debería detenerse a considerar. La tarifa de salida de Grok 4.7 es un 40 % más baja, pero su entrada en caché es un 150 % más alta, y la entrada en caché es donde residen los historiales largos de agentes y los prompts de sistema repetidos. Una carga de trabajo que se dedica sobre todo a releer un contexto grande y estable encontrará que los dos modelos están mucho más cerca de lo que sugiere $6 frente a $10.

El registro independiente, y el único número que lo decide
Artificial Analysis es el único harness que ha medido ambos modelos, y sus cifras merecen presentarse en paralelo porque la divergencia es instructiva.
• Intelligence Index — GPT-6 Sol 48 con esfuerzo máximo frente a Grok 4.7 46 en xhigh; ambos muy por encima de la mediana de 25 de los modelos comparables
• Coste por tarea de indexación — GPT-6 Sol 1,06 $ vs Grok 4,7 3,74 $
• Tokens de salida para la ejecución del índice — GPT-6 Sol 77M vs Grok 4.7 240M, frente a una mediana de 88M
• Velocidad de salida — Grok 4.7 registró 39 tokens por segundo, una cifra que el propio harness califica de notablemente lenta; la cifra de Sol en la misma tabla no se publica en la misma línea de resumen
• Índice de agentes de programación — GPT-6 Sol 57 a 2,99 $ por tarea frente a Grok 4.7 56 con su harness propio Grok Build, nueve puntos más que Grok 4.6
Dos puntos de diferencia en el índice, tres veces y media el costo por tarea. Eso no es una anomalía de precios: es la aritmética de la verbosidad. Grok 4.7 es un modelo que piensa en voz alta de manera extensa; el harness lo marca como "muy verboso" frente a una mediana de 88 millones de tokens, y el costo sigue a los tokens, no a la tarifa.
La comparación de agentes de programación conlleva una salvedad que el marcador oculta. El 56 de Grok 4.7 se mide dentro del propio harness Grok Build de xAI, que es la configuración que xAI distribuye y con la que compara sus resultados. El 57 de Sol se mide en un harness neutral. Una ventaja de uno o dos puntos por usar un harness propio está bien dentro del rango que la elección de harness explica, lo que significa que la lectura honesta es que estos dos están empatados en programación agéntica — no que Sol esté un punto por delante.

Lo que afirma cada proveedor, y lo que ninguno de los dos ha demostrado
El material de lanzamiento de xAI es concreto y es una historia de largo horizonte: Grok 4.7 está construido sobre un modelo base más grande que Grok 4.6 y se le sometió a una ejecución de aprendizaje por refuerzo más prolongada orientada a tareas que "pueden tardar horas en completarse", afinando la autoverificación, el manejo de contexto largo y el comportamiento dentro del entorno Grok Bot. Las cifras reportadas por el proveedor incluyen Terminal-Bench 4.0 con un 38,0 % frente al 20,3 % de Grok 4.6, CursorBench 4.0 con un 46,3 % y DeepSWE v1.1 con un 71,0 %. Todas y cada una de ellas son mediciones propias de xAI y ninguna ha sido reproducida de forma independiente; la cifra independiente de Terminal-Bench 4.0 que circula es sustancialmente inferior a la del proveedor, que es el patrón habitual de esa diferencia.
Las afirmaciones de OpenAI para GPT-6 Sol son las ya cubiertas anteriormente, y llevan la misma etiqueta. Las cifras reportadas por el proveedor son 33.2% en AutomationBench con esfuerzo xhigh frente al 26.9% de Claude Opus 5 en max, a aproximadamente el 9% del costo por tarea, y 68.8% en DeepSWE v1.1 con esfuerzo max — a 1.1 puntos de Claude Fable 5 en xhigh, con un costo por tarea aproximadamente 80% menor. Nótese el objetivo de comparación: los propios gráficos de OpenAI enfrentan a Sol con los modelos de Anthropic, no con Grok 4.7. Ninguno de los dos proveedores ha publicado una comparación directa contra el otro.

Donde la capa de enrutamiento se gana su lugar
OrcaRouter no comercializa ninguno de los dos modelos en esta comparación — Grok 4.7 y GPT-6 Sol están ambos ausentes de nuestro catálogo, así que nada de esto es una afirmación sobre su precio a través de nosotros. Lo que vale una capa de enrutamiento en este emparejamiento concreto es el modo de fallo, más que la lista de precios. La razón para recurrir a Grok 4.7 es su comportamiento agéntico de horizonte largo; la razón para no recurrir a él es que una velocidad de salida de 39 tokens por segundo hace que una ejecución larga de agente sea lo bastante lenta como para importar, y una ejecución lenta es una ejecución que puede agotar el tiempo de espera. Conmutación por error automática entre proveedores significa que un trabajo largo puede enrutarse al modelo que esté realmente disponible sin que esa velocidad se convierta en un punto único de fallo, y el DSL de enrutamiento expresa la elección del modelo como una regla dentro de la llamada en lugar de como una migración — lo cual importa aquí, porque la respuesta correcta para este par depende de si la tarea consume muchos tokens o es sensible a la latencia, y eso es una propiedad de la solicitud, no del trimestre.
La regla de decisión
• Codificación agéntica con un presupuesto fijo — GPT-6 Sol. Capacidad de primer nivel en el índice neutral de codificación, a aproximadamente un tercio del costo por tarea, porque llega hasta ahí con un tercio de los tokens.
• Tareas de horizonte largo en las que la duración de la ejecución es lo esencial — Grok 4.7. El lanzamiento se entrenó específicamente para trabajos de varias horas, y las cifras del proveedor en SWE-Marathon y CursorBench se mueven exactamente en esa dirección.
• Volumen sensible a la latencia — ninguno de los dos, según el registro actual. El costo por tarea de Sol es la mejor cifra, pero los 39 tokens por segundo medidos de Grok 4.7 son una restricción real para cualquier cosa interactiva.
• Cargas de trabajo de contexto largo mayormente en caché — GPT-6 Sol, en la línea de lectura de caché en lugar de la línea de salida. A $0.20 frente a $0.50 por millón de tokens en caché, y con una ventana del doble de tamaño, el argumento se fortalece cuanto más estable sea tu prompt.
• Si tu comparación se construyó a partir de la tabla de tarifas por token, reconstrúyela a partir del costo por tarea. $6.00 frente a $10.00 de salida es el par de números menos informativo de este artículo, y es el par con el que abre cada página existente.
Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
