Tarjeta de título generada que dice GPT-6 vs Grok 4.6, dos niveles intermedios, una factura que diverge por encima de 200K tokens, con tarjetas de estadísticas que dicen precio de entrada $2.00 vs $2.00 por millón, escalón para solicitudes largas 272K vs 200K tokens de entrada, y precio de salida por encima del escalón $15.00 vs $12.00 por millón, con un pie de página que dice tarifas de contexto corto de GPT-6 Sol y Grok 4.6 según la propia tarjeta de tarifas de cada proveedor; escalones de contexto largo según las mismas tarjetas.
Guides & Insights

GPT-6 vs Grok 4.6: Dos niveles intermedios, una factura que diverge por encima de los 200K tokens

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

GPT-6 Sol y Grok 4.6 cuestan lo mismo: $2.00 por millón de tokens de entrada y $6.00 por millón de tokens de salida en la parte superior de las dos columnas. Lo que casi nadie imprime junto a eso es que las columnas dejan de coincidir en distintos puntos de la solicitud. Grok 4.6 empieza a cobrar su tarifa de contexto largo una vez que un prompt supera los 200.000 tokens de entrada; GPT-6 Sol espera hasta los 272.000. Por encima de esas líneas se recalcula el precio de toda la solicitud —no solo el del excedente—, y los dos proveedores lo recalculan en direcciones opuestas, que es la parte que decide una factura en una ejecución larga de agente. GPT-6 Sol y sus hermanos GPT-6 Astra y GPT-6 Luna se lanzaron el 22 de septiembre de 2026; Grok 4.6, el nivel intermedio de la línea de SpaceXAI, se lanzó el 12 de agosto de 2026 y ya se le ha sumado Grok 4.7, así que esta es una comparación entre dos modelos ya lanzados y no el lanzamiento de ninguno de los dos.

Una segunda cosa cambió el 7 de octubre de 2026 que importa para cómo interpretas GPT-6, aunque sea mínimamente: OpenAI comenzó a desplegar GPT-6 en la pestaña principal Chat de ChatGPT, llegando a los niveles gratuitos el 8 de octubre, con los niveles Plus, Pro, Business y Enterprise usando GPT-6 Sol y los niveles Free y Go usando GPT-6 Luna. Eso es un cambio de superficie — los mismos modelos, una audiencia mucho mayor y una nueva capa de interfaz que OpenAI llama Intelligent UI. No modifica ni una sola tarifa de API. Lo que sí significa es que, si estás comparando "GPT-6" con cualquier cosa, ahora estás comparando con un modelo con el que también está hablando un número muy grande de personas en una pestaña del navegador.

En qué se diferencian realmente las dos tarjetas

• Entrada de contexto corto — GPT-6 Sol $2.00 por millón vs Grok 4.6 $2.00 por millón
• Salida de contexto corto — GPT-6 Sol $10.00 por millón vs Grok 4.6 $6.00 por millón
• Umbral de solicitud larga — GPT-6 Sol cambia de precio por encima de 272,000 tokens de entrada vs Grok 4.6 por encima de 200,000
• Entrada de solicitud larga — GPT-6 Sol $4.00 por millón vs Grok 4.6 $4.00 por millón
• Salida de solicitud larga — GPT-6 Sol $15.00 por millón vs Grok 4.6 $12.00 por millón
• Entrada en caché — GPT-6 Sol $0.20 por millón vs Grok 4.6 $0.50 por millón
• Ventana de contexto — GPT-6 Sol 1,050,000 tokens vs Grok 4.6 500,000 tokens
• Modalidades de entrada — ambas aceptan texto, imagen y archivo
• Puntuación en trabajo de conocimiento — GPT-6 Sol 47.6 vs Grok 4.6 44.3 en el Artificial Analysis Intelligence Index
• Terminal-Bench 2.1 — GPT-6 Sol no publicado en la misma revisión vs Grok 4.6 88.4

Lee las dos líneas de salida en conjunto y aparece la forma de la decisión. Grok 4.6 es $4.00 más barato por millón de tokens de salida en cualquier solicitud de menos de 200K, y solo $3.00 más barato por encima de eso. Esa es una diferencia mucho menor de lo que sugiere el 40% del titular, porque ambos modelos recalculan el precio de toda la solicitud en lugar de solo la parte que supera el umbral — un detalle sobre el que vale la pena detenerse, ya que un prompt de 200,001 tokens no se factura como un token a la tarifa cara más 200,000 a la barata.

Entonces, el propio umbral va en la dirección contraria. Grok 4.6 empieza a cambiar de tarifa 72.000 tokens antes que GPT-6 Sol. Para una carga de trabajo que se mantiene de forma constante entre 200K y 272K, Grok 4.6 es el modelo más caro a pesar de su tarifa por token anunciada más barata, y es el único de los dos que se ha movido en absoluto. En qué lado de esa ventana caen tus prompts es una pregunta más útil que cuál de las tarifas anunciadas es más baja.

Generated comparison scoreboard titled GPT-6 vs Grok 4.6, the scoreboard, with six matched rows. GPT-6 Sol: input $2.00 per million, output $10.00 per million, long-request step above 272K input tokens, long-context output $15.00, context window 1,050,000 tokens, Intelligence Index 47.6. Grok 4.6: input $2.00 per million, output $6.00 per million, long-request step above 200K input tokens, long-context output $12.00, context window 500,000 tokens, Intelligence Index 44.3. A footer reads GPT-6 Sol rates per OpenAI's rate card and Intelligence Index per Artificial Analysis; Grok 4.6 rates per SpaceXAI's rate card and Intelligence Index per Artificial Analysis.

La brecha del índice de referencia es menor y más estrecha que la brecha de precios

En el Índice de Inteligencia de Artificial Analysis, que es una medición de terceros y no una tabla de proveedor, GPT-6 Sol se sitúa en 47,6 y Grok 4.6 en 44,3. Una diferencia de 3,3 puntos en una escala de 0 a 100 es real, pero no es el tipo de distancia que haga que un modelo sea incorrecto para una tarea y el otro correcto. Además, se mide con una configuración de razonamiento específica para cada modelo, y GPT-6 Sol expone un esfuerzo de razonamiento configurable, mientras que Grok 4.6 expone el suyo — así que cualquiera que cite un único número de comparación directa está citando un punto en una cuadrícula bidimensional.

Donde los dos realmente se distancian más es en el trabajo agéntico de estilo terminal. En Terminal-Bench 2.1, Grok 4.6 registra 88,4. GPT-6 Sol no tiene ninguna cifra publicada comparable en la revisión que incluye nuestro catálogo, y la lectura honesta de una celda vacía es que la cifra no está publicada —no que el modelo haya tenido un mal desempeño. Si la carga de trabajo es un agente de ejecución prolongada controlado por shell, la evidencia publicada favorece a Grok 4.6, y la evidencia ausente no cuenta como evidencia a favor de ninguno de los dos bandos.

Lo contrario ocurre en la recuperación de conocimiento en contextos largos. GPT-6 Sol registra 83.7 en recuerdo de contexto largo frente a los 80.3 de Grok 4.6, y los proveedores de ambos modelos informan sus propias cifras en otros lugares: SpaceXAI destaca GPQA Diamond con 94.9 para Grok 4.6, y el material de GPT-6 de OpenAI procede en gran medida del proveedor y no ha sido reproducido. Dos reglas evitan confusiones: un número de proveedor es una afirmación, y un número de índice es una medición sobre una revisión con nombre. No son intercambiables y nunca deben promediarse para obtener una única puntuación de «mejor».

El problema del sucesor

Ninguno de estos dos es el modelo más reciente de su propio laboratorio, y fingir lo contrario sería lo más engañoso que podría hacer esta comparación. SpaceXAI lanzó Grok 4.7 el 21 de septiembre de 2026 con la misma tarifa base de 2,00 $/6,00 $, y el Intelligence Index pasó de 44,3 a 46,4. OpenAI lanzó GPT-6.1 Sol el 29 de septiembre de 2026, también a 2,00 $/10,00 $, con el Intelligence Index en 51,8 y una tarifa que incluso mejoró: la entrada en caché bajó de 0,20 $ a 0,10 $ por millón. Artificial Analysis ahora marca su página de GPT-6 Sol como obsoleta y remite a los lectores a GPT-6.1 Sol.

Así que el planteamiento justo no es «cuál de estos dos deberías adoptar», sino «cuál de estos dos, y estás seguro de que no hay una generación más nueva en ninguno de los dos lados». La razón para quedarse en GPT-6 Sol suele ser una integración concreta de hace ocho días, más que una afirmación sobre capacidades; la razón para quedarse en Grok 4.6 es una cifra publicada de agente de terminal que su sucesor aún no ha igualado en público. Ambas son legítimas, y ambas tienen un plazo definido.

OrcaRouter model page for Grok 4.6 (grok/grok-4.6) by SpaceXAI, dated 2026-08-12, showing the model tagged Vision, Tools, JSON and Reasoning, a 500K-token context window with text, image and file input and text output, a list price of $2.00 per million input and $6.00 per million output, and a p50 time to first token of 4.73 seconds.

Ejecutar ambos desde una misma tecla.

Ambos modelos se enrutan a través de OrcaRouter, así que la parte mecánica de mantener dos candidatos activos no cuesta nada: una sola API frente a más de 200 modelos, la misma clave, sin un segundo contrato y sin cambios de código entre ellos. Eso importa aquí más de lo habitual, porque el argumento a favor de un segundo modelo en este enfrentamiento concreto no es una cobertura de capacidades, sino una decisión de enrutamiento: envía la ventana de 200K a 272K a GPT-6 Sol y todo lo más corto a Grok 4.6, y la misma aplicación obtiene la factura más barata a ambos lados de un umbral que ninguno de los dos proveedores te deja elegir.

La conmutación por error automática es la mitad aburrida de la misma configuración. Las ejecuciones de agentes con contexto largo son largas precisamente porque algo mantiene una sesión abierta, y un fallo puntual del proveedor en el minuto cuarenta es el tipo de fallo que sale caro. Una segunda ruta configurada de antemano convierte eso en un reintento en lugar de una nueva ejecución.

Nuestro catálogo incluye ambos al precio de lista de su propio proveedor, sin ningún margen añadido, así que un cambio de tarifa en cualquiera de las dos tarjetas llega a nuestro lado el mismo día en que llega al suyo. Vale la pena decirlo sin rodeos y no como un eslogan: la razón para prestarle atención es que la diferencia de $0.20 frente a $0.50 en la entrada en caché mencionada arriba es exactamente el tipo de línea que los proveedores cambian en silencio, y un traspaso directo significa que nunca tienes que esperar a que un revendedor se ponga al día.

Artificial Analysis model page for GPT-6 Sol (Max), a proprietary OpenAI model released September 2026, carrying a banner stating the model is deprecated and that OpenAI has launched a newer release, GPT-6.1 Sol. The page shows an Intelligence rank of 25 of 225, an output speed of 87.9 tokens per second, $2.00 per million input tokens and $10.00 per million output tokens, a 90% cache discount, a $1.04 blended rate, and a note that the model generated 77 million tokens during the Index evaluation, described as fairly concise.

¿Qué es lo que realmente lo decide?

Si tus prompts son cortos, Grok 4.6 gana en precio de salida por un margen que ningún delta de índice cierra, y su puntuación como agente terminal es el número publicado más alto en cualquiera de las dos columnas. Si tus prompts son largos, el umbral de reajuste de precios posterior de GPT-6 Sol y su ventana más larga valen más que su mayor tarifa de salida, y la línea de entrada en caché cuesta una cuarta parte. Si tus prompts se sitúan entre 200K y 272K, tienes la única carga de trabajo en la que el modelo que parece más barato es el más caro, y la solución es la selección de ruta en lugar de la selección de modelo.

Lo que hay que seguir de cerca no es ninguno de los dos modelos, sino los dos sucesores que ya están en el mercado. Tanto Grok 4.7 como GPT-6.1 Sol restan fuerza al argumento de esperar para tomar una decisión aquí, y una comparación que tiene que volver a ejecutarse cada tres semanas es una comparación que pertenece detrás de un router y no en un documento de arquitectura.

Comparados en este artículo3

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario