Tarjeta de título principal para Grok 4.5 vs GPT-6 Astra con el subtítulo 'Seis veces el precio de etiqueta, tres veces la factura', tarjetas de estadísticas que muestran 'Precio de etiqueta: $2.00 / $6.00 vs $10.00 / $50.00 por 1M', 'Costo por tarea: $1.04 vs $3.26' y 'Primer token: 10.94s vs 342.30s', un pie de página que dice 'Tarifas de proveedores y cifras independientes consultadas el 23 de septiembre de 2026', y el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

Grok 4.5 vs. GPT-6 Astra: seis veces el precio de etiqueta, tres veces la factura

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Ponga a Grok 4.5 y GPT-6 Astra uno al lado del otro en sus tarifas y la brecha parece absurda: $2,00 frente a $10,00 por millón de tokens de entrada, $6,00 frente a $50,00 por millón de salida. Someta a esos mismos dos al Índice de Inteligencia de Artificial Analysis y la brecha se reduce a algo sobre lo que un equipo realmente puede discutir: $1,04 por tarea completada frente a $3,26. El múltiplo del precio de etiqueta es 5x en entrada y 8,3x en salida. El múltiplo de la factura, medido con conteos reales de tokens, es un poco más de 3x. Y la dimensión en la que estos dos modelos difieren más no es ninguna de esas. Es el tiempo que se espera hasta el primer token, donde la medición independiente es de 10,94 segundos frente a 342,30.

Eso es todo el enfrentamiento en un solo párrafo, y es la razón por la que esta página no es una coronación en ninguna de las dos direcciones. GPT-6 Astra es el modelo más inteligente por un margen claro y reproducible. Grok 4.5 es el más barato por un margen que es real pero considerablemente menor de lo que sugiere su lista de precios. Todo lo demás —velocidad, eficiencia de tokens, contexto, los benchmarks de programación— o se divide, empata o resulta que se mide con dos reglas distintas.

Ninguno de estos es un modelo nuevo.

Merece la pena decirlo con claridad, porque muchas páginas de comparación se leen como si ambos hubieran llegado la semana pasada.

xAI lanzó Grok 4.5 el 8 de julio de 2026. Está construido sobre la base V9 de 1,5 billones de parámetros y se coentrenó con Cursor usando datos de sesiones de desarrolladores en lugar de solo código estático, y de ahí proviene su reputación en codificación agéntica. Cuenta con una ventana de contexto de 500.000 tokens. Su propia lista de modelos del proveedor todavía lo incluye hoy, junto con dos sucesores —xAI ha lanzado desde entonces Grok 4.6 y Grok 4.7—, así que considera Grok 4.5 como el nivel de $2/$6 de la línea Grok y no como su tope.

OpenAI anunció GPT-6 Astra el 3 de septiembre de 2026, con un despliegue gradual a lo largo de los días siguientes, y sigue siendo el modelo insignia de OpenAI: una ventana de contexto de 1 millón de tokens (el catálogo de OrcaRouter indica 1.050.000 de entrada y 128.000 de salida máxima), una fecha de corte de conocimiento del 30 de abril de 2026 y un posicionamiento claro en el trabajo agéntico de largo horizonte —uso de computadoras, investigación, tareas científicas y de ciberseguridad—. Según la propia OpenAI, es el primer modelo que supera su umbral de ciberseguridad «Critical», lo que también explica por qué el acceso empresarial está desactivado de forma predeterminada hasta que un administrador lo habilite.

Ambos están disponibles de forma general en las API de sus proveedores. Ninguno de los dos se está lanzando. Lo único que se movió esta semana es la familia en torno a uno de ellos, y eso llega al final de este artículo porque cambia la recomendación, no la comparación.

Las tarjetas de tarifas, incluido el nivel que nadie cotiza.

• Entrada, contexto corto — Grok 4.5 $2.00 por 1M vs GPT-6 Astra $10.00 por 1M

• Salida, contexto corto — Grok 4.5 $6.00 por 1M vs GPT-6 Astra $50.00 por 1M

• Entrada en caché — {{1}}Grok 4.5{{/1}} $0.30 por 1M vs {{2}}GPT-6 Astra{{/2}} $1.00 por 1M

• Entrada de contexto largo — Grok 4.5 $4.00 por 1M vs GPT-6 Astra $20.00 por 1M

• Salida de contexto largo — Grok 4.5 $12.00 por 1M vs GPT-6 Astra $75.00 por 1M

• Ventana de contexto — Grok 4.5 500.000 tokens frente a GPT-6 Astra 1.000.000 tokens

La cláusula que importa es la que casi ninguna página de comparación imprime. En Grok 4.5, una vez que el prompt de una solicitud alcanza los 200.000 tokens, toda la solicitud se vuelve a tarificar al nivel más alto: la documentación de xAI es explícita en que se "factura a la tarifa más alta por todos los tokens de la solicitud", no solo por los tokens que superan el límite. Así que la ventana de 500.000 tokens es real, pero aproximadamente el 60 % superior se factura al doble. La página de precios de OpenAI para Astra muestra la misma estructura de dos columnas, corto/largo, sin indicar dónde se sitúa su punto de transición, así que considere la columna de contexto largo como la que se aplica una vez que trabaja a escala y confirme el límite con su propia factura.

Screenshot of xAI's own documentation page for Grok 4.5 (docs.x.ai, model id grok-4.5) captured 23 September 2026, showing 'At a glance' with Modalities Text, Image to Text, a Context window of 500,000 and Pricing of $2.00 and $6.00, supported Capabilities of function calling, structured outputs and reasoning, and a Pricing block giving Input Tokens $2.00 / 1M tokens, Cached tokens $0.30 / 1M tokens and Output Tokens $6.00 / 1M tokens, above a 'Higher context pricing' control reading 'We charge different rates for requests which exceed the 200K context window'.

Dos multiplicadores por nivel de servicio se aplican sobre las cifras de Astra: Batch y Flex funcionan a la mitad de la tarifa estándar, y el modo Fast funciona al doble — $20.00 de entrada y $100.00 de salida en contexto corto. Grok 4.5 no tiene nivel de batch en la hoja de xAI; sus palancas son el descuento por caché y el procesamiento prioritario a 2x.

Nuestra propia postura sobre todo esto es deliberadamente aburrida: OrcaRouter traslada el precio de lista del proveedor con un margen del 0 %, así que ambas tarifas anteriores están vigentes de nuestro lado el mismo día en que cualquiera de los dos proveedores las cambie, y los tokens en caché se facturan a la tarifa de caché del proveedor en lugar del precio completo. No hay un segundo número que cuadrar.

Lo que realmente cuesta una carga de trabajo

Los precios de etiqueta no son una buena referencia aquí, porque los dos modelos no usan la misma cantidad de tokens para completar el mismo trabajo. Tomemos una tarea de agente de programación con un contexto de repositorio de 120.000 tokens y una respuesta de 25.000 tokens. En Grok 4.5, eso es $0,24 de entrada y $0,15 de salida, así que $0,39. En GPT-6 Astra, son $1,20 y $1,25, así que $2,45. Una diferencia de 6,3 veces.

Ahora lleva el prompt más allá del umbral de contexto largo: 300 000 tokens de entrada, 20 000 de salida. Grok 4.5 cobra $1,20 más $0,24, o $1,44. GPT-6 Astra cobra $6,00 más $1,50, o $7,50. La diferencia se reduce a 5,2x, porque ambos proveedores duplican la tarifa de entrada y el multiplicador de salida de Astra se reduce en el nivel superior.

Ninguno de esos es lo que mide Artificial Analysis, y su cifra es la más útil. Al ejecutar el Intelligence Index completo, el costo promedio por tarea completada es de $1.04 para Grok 4.5 con esfuerzo alto y de $3.26 para GPT-6 Astra con esfuerzo máximo. La razón por la que el múltiplo cae a 3.1x cuando los precios de entrada difieren en 5x es la eficiencia de tokens: en todo el índice, Grok 4.5 generó 77M tokens de salida y Astra generó 60M. Astra es el modelo más conciso, así que cierra parte de una brecha que abrió en precio. Si has estado citando "cinco veces más barato" en un documento de presupuesto, 3x es la cifra que aparecerá en la factura.

La velocidad es un empate. La latencia no.

Este es el hallazgo que nos sorprendió, y va en contra de la intuición de que el modelo barato es el rápido.

Artificial Analysis mide Grok 4.5 en 55 tokens de salida por segundo y GPT-6 Astra en 58. Eso es una diferencia del 5% en la misma revisión del índice, y el propio resumen de AA describe a ambos como más lentos que el promedio: la mediana de comparación es de 74 tokens por segundo. Si el rendimiento es tu criterio de selección, estos dos modelos no se diferencian. Dilo con claridad en lugar de fabricar un ganador: en el único dato de velocidad medido de la misma manera para ambos, están igualados.

La latencia los separa violentamente. AA sitúa el tiempo hasta el primer token de respuesta de Grok 4.5 en 10,94 segundos, con 20,01 segundos de extremo a extremo; GPT-6 Astra, en 342,30 segundos, con 350,91 segundos de extremo a extremo. Eso es aproximadamente 31 veces, y en una solicitud síncrona es la diferencia entre un spinner y una pausa para el café.

Dos advertencias honestas antes de que alguien haga presupuestos basándose en eso. Primero, esas son cifras que incluyen el razonamiento —el «tiempo hasta el primer token de respuesta» de AA cuenta deliberadamente el tiempo de pensamiento del modelo—, así que describen una tarea difícil, no un turno de chat. Segundo, no son de esfuerzo equiparado: la entrada publicada de Astra es con esfuerzo máximo, la de Grok 4.5 con esfuerzo alto, y un ajuste de esfuerzo es exactamente el control que mueve este número. El propio listado de OrcaRouter para GPT-6 Astra muestra un p50 de tiempo hasta el primer token de 8,31 segundos y un p95 de 10,00 segundos en tráfico real, lo cual es un punto de medición completamente distinto: primer token en llamadas de producción reales, no primer token de respuesta en una tarea de benchmark. Los dos no son comparables y no deberían ponerse en la misma frase como comparación.

Two-column comparison scoreboard for Grok 4.5 vs GPT-6 Astra. Grok 4.5 column: AA Index 39 (high), price per 1M $2.00 / $6.00, cached input $0.30, cost per task $1.04, speed 55 tok/s, first answer token 10.94s. GPT-6 Astra column: AA Index 53 (max), price per 1M $10.00 / $50.00, cached input $1.00, cost per task $3.26, speed 58 tok/s, first answer token 342.30s. Footer: 'Index, cost, speed and latency per Artificial Analysis, index v4.3.2, read 23 September 2026. Prices per the vendors' own rate cards.'

Benchmarks de programación: comprueba la versión antes de citarla

Busca esta comparativa y encontrarás el 83,3 % de Grok 4.5 en Terminal-Bench 2.1 frente al 57,9 % de GPT-6 Astra en Terminal-Bench 4.0. Son benchmarks distintos que llevan el mismo nombre. No se pueden comparar, y las páginas de comparación que los apilan no te están diciendo nada.

La mayoría de las cifras de codificación publicadas por ambos proveedores tienen este problema. La hoja de xAI para Grok 4.5 reporta SWE-bench Pro 64,7 %, Terminal-Bench 2.1 83,3 %, DeepSWE 1.0 62,0 % y DeepSWE 1.1 53 %. La hoja de OpenAI para Astra reporta Terminal-Bench 4.0 57,9 %, OSWorld 2.0 72,6 %, FrontierMath Tier 4 97,6 % y ARC-AGI-3 99,9 %. Todas reportadas por los proveedores, y casi ninguna de ellas se solapa.

Hay un solo lugar donde los dos coinciden realmente en el mismo harness: DeepSWE v1.1 de Datacurve, que ejecuta cada modelo a través del mismo scaffold mini-swe-agent en 113 tareas originales y libres de contaminación. Ahí, GPT-6 Astra obtiene un 74,1 % a aproximadamente 6,52 $ por tarea, mientras que Grok 4.5 se queda en el 53 %. Ese es el resultado individual más limpio de esta página, y favorece a Astra de forma decisiva. Una advertencia adicional específica para Grok 4.5: la cifra de CursorBench de xAI se excluyó de la comparación pública después de que se descubriera que una base de código anterior se había filtrado en el entrenamiento, así que considera cualquier cifra de CursorBench para este modelo como no utilizable.

Comportamiento agéntico y llamada a herramientas

Los dos toman rutas distintas hacia el mismo destino, y la diferencia es arquitectónica más que una puntuación.

Las características de GPT-6 Astra orientadas a desarrolladores asumen que estás construyendo un orquestador. Admite llamadas asíncronas a herramientas, por lo que esperar a una herramienta no bloquea al modelo para que siga realizando otro trabajo; control a mitad de tarea mediante WebSockets, de modo que una ejecución en curso puede redirigirse sin reiniciarla; y esfuerzo de razonamiento ajustable a mitad de conversación. En Codex añade un mecanismo de preservación del contexto que mantiene notas a través de las ventanas de contexto mientras el contexto anterior sigue siendo consultable. Según se informa, la propia tarjeta de sistema de OpenAI señala que el modelo es más difícil de supervisar que su predecesor, lo cual es una razón para tratar los registros de llamadas a herramientas y el estado del sistema —no la narración del modelo— como tu evidencia de auditoría.

La historia agéntica de Grok 4.5 tiene menos que ver con nuevas primitivas y más con dónde fue entrenado. El coentrenamiento con Cursor en sesiones reales de edición y depuración de múltiples archivos es lo que xAI atribuye a su eficiencia de tokens en tareas de software, y es la razón por la que el modelo aparece como predeterminado en superficies de programación en lugar de como un buque insignia de propósito general. La llamada a funciones, la salida estructurada, el streaming y el almacenamiento en caché de prompts son compatibles; la llamada a herramientas sigue la forma compatible con OpenAI, por lo que integrarlo en un cliente existente es solo un cambio de URL base.

No existe un benchmark agéntico independiente compartido en el que ambos aparezcan con un esfuerzo equiparable, así que no vamos a inventarnos un ganador aquí. Lo que sí se puede decir es que la superficie de llamada de herramientas de Astra es la más expresiva de las dos para trabajo de horizonte largo, y la economía de tokens por tarea de Grok 4.5 es la más atractiva para trabajo de alto volumen.

Elige Grok 4.5 si

• Estás ejecutando trabajo de gran volumen o alta frecuencia en el que el costo por tarea domina la decisión, y un 39 en el AA Intelligence Index supera tu umbral de calidad.

• Tus prompts se mantienen por debajo de los 200.000 tokens. Ahí es donde la ventaja de precio de Grok 4.5 es más amplia y nunca se activa el reajuste de precios para contexto largo.

• Quieres un descuento de caché que haga un trabajo real. A $0,30 por millón de tokens de entrada en caché frente al $1,00 de Astra, las cargas de trabajo con prefijos repetidos —prompts de sistema largos, contexto de repositorio compartido— se abaratan rápidamente.

• Necesitas una latencia de primer token inferior a un minuto en tareas difíciles y no puedes permitirte una espera de varios minutos.

Elige GPT-6 Astra si

• La tarea es el producto, y la factura es un error de redondeo al lado de una respuesta equivocada. Catorce puntos de índice en este extremo de la curva representan una diferencia real de capacidad, no una de marketing.

• Estás trabajando genuinamente más allá de los 500.000 tokens. La ventana de Astra es aproximadamente el doble que la de Grok 4.5, y es la única de las dos que la alcanza sin una cláusula de reajuste de precios.

• Necesitas uso de computadora, investigación profunda o la postura de ciberseguridad — incluidos los controles desactivados por defecto a nivel empresarial que acompañan al umbral Critical de OpenAI.

• Estás escribiendo código de orquestador que necesita llamadas a herramientas asíncronas y control durante la ejecución, en lugar de una simple llamada de solicitud-respuesta.

Qué se movió esta semana y por qué cambia la recomendación

El 22 de septiembre de 2026, OpenAI lanzó GPT-6 Sol y GPT-6 Luna a 2,00/10,00 y 0,10/0,50 dólares por millón de tokens, y describió las tarifas como permanentes en lugar de promocionales. Sol es el modelo de gama media para programación y análisis, a aproximadamente una quinta parte del precio de entrada de Astra.

Eso importa para esta decisión concreta. Si la razón por la que sopesabas Grok 4.5 frente a GPT-6 Astra era el precio, la comparación honesta del lado de OpenAI ya no es Astra — Astra es el buque insignia, y Sol ahora ocupa el nivel en el que Grok 4.5 compite realmente. Grok 4.5 sigue siendo más barato que Sol en salida ($6.00 frente a $10.00) y lo iguala en entrada ($2.00 cada uno), así que no ha quedado desplazado; pero una comparación escrita antes de esta semana comparaba un modelo económico con un buque insignia y llamaba al resultado una cuestión de precio.

Lo mismo ocurre del lado de xAI: la propia lista de modelos de xAI incluye grok-4.6 y grok-4.7 junto con grok-4.5, por lo que Grok 4.5 es una opción dentro de una familia en lugar de la frontera actual.

Screenshot of the OrcaRouter model page for GPT-6 Astra, model id openai/gpt-6-astra, captured 23 September 2026, showing INPUT $10.00 and OUTPUT $50.00 per 1M tokens, a p50 time to first token of 8.31s and p95 of 10.00s over seven days, traffic of 300.7M tokens over seven days, a 1M-token context with 128K maximum output, an OpenAI-compatible base URL of https://api.orcarouter.ai/v1, the catalogue date 2026-09-04, and the English-language interface with the language switcher on EN.

Cuál es el argumento real a favor del enrutamiento en lugar de elegir. La pila de dos modelos que no deja de aparecer en los escritos de profesionales —enviar el grueso al modelo barato, escalar la cola difícil al caro— es una decisión de enrutamiento, y es una que puedes expresar como configuración en lugar de una reescritura. OrcaRouter pone ambos modelos detrás de una sola API y una sola clave, con el precio de lista del proveedor trasladado sin margen (0 %), conmutación automática por fallo entre proveedores y un DSL de enrutamiento que te permite enviar el trabajo por debajo de un umbral a grok/grok-4.5 y escalarlo a openai/gpt-6-astra cuando una tarea falla o cruza una línea de tamaño. Puedes probar la ruta cara en una porción estrecha del tráfico sin apostar una canalización de producción a ella.

La versión corta

GPT-6 Astra es el mejor modelo. No hay comparación, y esta página no valdría nada si pretendiera lo contrario: 53 frente a 39 en la misma revisión del índice, 74,1 % frente a 53 % en la única prueba comparativa de programación que ambos han realizado.

Grok 4.5 es el modelo más económico, pero a 3,1x por tarea completada en lugar del 5x a 8,3x que sugiere su lista de precios, porque Astra gasta menos tokens para lograrlo. Y en el único dato de velocidad medido de forma idéntica para ambos, están igualados.

La decisión no es qué modelo gana. Es si una diferencia de 14 puntos en el índice vale aproximadamente el triple de la factura en tu carga de trabajo específica — y si la respuesta es la misma para cada solicitud que envías.

Comparados en este artículo2

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario