Tarjeta de título que dice GPT-6 Astra vs Solar Pro 4, con la bajada 'Doce puntos de índice, una ventana de 512K en un lado y una relación de precios que cambia el domingo', sobre una ilustración generada de dos máquinas cúbicas brillantes con etiquetas de precio al pie
Guides & Insights

GPT-6 Astra vs Solar Pro 4: Doce puntos de índice y una relación de precios que cambia el domingo

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

En las dos evaluaciones realizadas de forma independiente que este par tiene en común, GPT-6 Astra supera a Solar Pro 4 por un amplio margen en conocimiento general y por uno más estrecho allí donde los modelos se usan realmente. Artificial Analysis sitúa a GPT-6 Astra en 54,7 en su Intelligence Index y en 96,1 en GPQA Diamond; ese mismo evaluador sitúa a Solar Pro 4 en 42 y 86,8. En el trabajo agéntico, la brecha se reduce a once y seis puntos en Terminal-Bench 2.1 y τ²-Banking. Mientras tanto, la historia de precios conlleva una fecha límite que casi nadie le asoció: la promoción actual de Solar Pro 4 termina a las 00:00 UTC del domingo, 11 de octubre de 2026, cuando el modelo pasa de $0,09 a $0,15 por millón de tokens de entrada y de $0,36 a $0,60 por millón de tokens de salida. Así que la pregunta que esta comparación debe responder no es cuál modelo es mejor. Es si una brecha de capacidad de unos doce puntos y medio justifica entre 42 y 139 veces la tarifa de salida, y esa respuesta es una propiedad de tu carga de trabajo y no de ninguno de los dos modelos.

Las tarjetas de tarifas, incluida la que cambia este fin de semana.

El precio de lista de Solar Pro 4 es de $0,30 por entrada, $0,06 por entrada en caché y $1,20 por salida por millón de tokens, y Upstage lo ha ofrecido por debajo del precio de lista de forma continua desde su lanzamiento. La tarifa en la propia página de precios de Upstage es explícita, así que no hay necesidad de adivinar contra qué número presupuestar:

• Promoción de Upstage hasta el 11 de octubre de 2026, 00:00 UTC — $0.09 de entrada, $0.018 en caché, $0.36 de salida por 1M de tokensbr /> • Promoción de Upstage a partir del 11 de octubre de 2026 en adelante — $0.15 de entrada, $0.03 en caché, $0.60 de salida por 1M de tokens, listada sin fecha de finalización, lo que significa que hay que presupuestar en consecuenciabr /> • Precio de lista de Upstage — $0.30 de entrada, $0.06 en caché, $1.20 de salida por 1M de tokensbr /> • GPT-6 Astra hasta 272.000 tokens de entrada — $10.00 de entrada, $1.00 en caché, $12.50 de escritura en caché, $50.00 de salida por 1M de tokensbr /> • GPT-6 Astra por encima de 272.000 tokens de entrada — $20.00 de entrada, $2.00 en caché, $25.00 de escritura en caché, $75.00 de salida por 1M de tokens, aplicado a toda la solicitud una vez superado el umbral

Leído como ratios, esto es 11× en entrada y 5,6× en salida con las tarifas posteriores a la promoción de Solar Pro 4, 33× y 42× frente a su precio de lista, y 111× y 139× si los dos modelos se miden con las cifras promocionales de hoy. La diferencia es tan grande porque ambos lados de la fracción se mueven: la tarjeta de Astra está en la cima del mercado y Solar Pro 4 actualmente está cerca del fondo de este.

Las reglas de contexto largo son la otra línea que vale la pena leer dos veces, porque no son simétricas. El umbral de Astra se sitúa en 272.000 tokens y su regla es un reajuste de precio de toda la solicitud: cada token de una solicitud larga se factura al doble en la entrada y a 1,5× en la salida, no solo los tokens que superan el límite. La tarjeta de Upstage no incluye un escalón equivalente, así que una solicitud de 400.000 tokens a Sol Pro 4 se factura exactamente a la misma tarifa por token que una de 4.000 tokens. Si tus prompts superan habitualmente un cuarto de millón de tokens, la entrada efectiva de Astra es de $20,00 en lugar de $10,00, y la brecha que pagas se amplía en la carga de trabajo exacta en la que compite un modelo de contexto de 512K.

De dónde viene la diferencia de doce puntos

Ambos modelos cuentan con cifras de terceros, lo que hace que esta comparación sea más sencilla que la mayoría en este nivel. El patrón entre ambos es consistente: las mejoras de Solar Pro 4 respecto a su propio predecesor se concentraron en tareas agénticas, y es ahí donde está más cerca de Astra.

• Intelligence Index — GPT-6 Astra 54.7, Solar Pro 4 42br /> • GPQA Diamond, ciencia de nivel de posgrado — Astra 96.1, Solar Pro 4 86.8br /> • Terminal-Bench 2.1, operar una terminal real — Astra 88.4, Solar Pro 4 75.1br /> • τ²-Banking, uso de herramientas frente a políticas — Astra 41.4, Solar Pro 4 35.0br /> • Recuperación de contexto largo, AA-LCR — Astra 80.7, Solar Pro 4 71br /> • Costo de ejecutar la tarea de evaluación promedio — Astra $0.0516, Solar Pro 4 entre $0.0039 y $0.0155br /> • Tiempo de reloj por tarea de evaluación — Astra aproximadamente 8.6 minutos, en un modelo que devuelve alrededor de 70 tokens por segundo

La línea del coste por tarea es la que replantea el argumento. Ejecutar una sola tarea de evaluación difícil en Solar Pro 4 cuesta entre cuatro y trece centavos, según el nivel de la promoción que corresponda, frente a cinco centavos en Astra con tarifas estándar. «Cuarenta y dos veces el precio de salida» y «trece veces el coste por tarea» son ambas afirmaciones verdaderas sobre el mismo par de modelos, y la segunda es la cifra que aparece en una factura. La diferencia es que Astra, según las mediciones de Artificial Analysis, llega a su respuesta con menos tokens que los que usaba el predecesor de Solar Pro 4 —43.000 tokens de salida por tarea— y sigue siendo el modelo más caro para completar una tarea, aunque ni de lejos 42 veces más.

Dos advertencias sobre la columna de Solar Pro 4. Es más lento que Astra en tiempo de reloj por tarea, incluso usando menos tokens, y sus puntuaciones agénticas publicadas vienen con una salvedad que conviene conocer: en la evaluación de su predecesor, mejoró su puntuación de honestidad en gran medida al negarse a responder, intentando responder el 41 % de las preguntas frente al 92 % de Pro 3. Para un agente que tiene que actuar, una negativa suele ser mejor que una respuesta incorrecta dada con confianza, pero cambia cómo se lee cualquier comparación de tasas de aprobación.

Comparison card with two columns. GPT-6 Astra: Intelligence Index 54.7, $10.00/$50.00 per 1M, long-context tier $20.00/$75.00 above 272K in, cached input $1.00, 1,050,000 context and 128,000 max output, Terminal-Bench 2.1 88.4. Solar Pro 4: Intelligence Index 42, promotion $0.09/$0.36 to 11 October 2026, then $0.15/$0.60, list $0.30/$1.20, 512,000 context and 128,000 max output, Terminal-Bench 2.1 75.1

La comparativa que no te ofrece la tarjeta de ninguno de los dos proveedores

Las filas de referencia anteriores coinciden: cada lado ejecutó la misma evaluación. Las filas ausentes son las interesantes, porque los dos proveedores discrepan sobre qué publicar.

• Esfuerzo de razonamiento — Astra expone cinco niveles con nombre (bajo, medio, alto, xhigh, max); Solar Pro 4 documenta un reasoning_effort como parámetro con al menos un ajuste medio, y el material de Upstage sobre la escala es escasobr /> • Arquitectura — La cantidad de parámetros de Astra no se divulga; la cantidad de parámetros de Solar Pro 4 tampoco se divulga, así que ninguna de las dos partes ofrece la divulgación sobre economía de servicio que sí ofrecen sus hermanos más económicosbr /> • Comportamiento de contexto largo bajo carga — Astra publica un umbral de costo y una puntuación de recall documentada; Upstage publica la ventana y ninguna evaluación de recall propiabr /> • Superficie de entrada — Astra acepta texto, imagen y archivo; Solar Pro 4 es un modelo de textobr /> • Techo de modalidad — 128,000 tokens de salida máximos en ambos lados, lo cual es un punto inusual para que un modelo económico alcance la paridad y es la especificación más útil de la ficha de Solar Pro 4 para trabajo de generación larga

La línea de esfuerzo de razonamiento importa más de lo que parece. Un modelo que te permite bajar el presupuesto de pensamiento es un modelo cuyo precio efectivo por solicitud fácil está muy por debajo de su tarifa anunciada, porque pagas por menos tokens de razonamiento en trabajos que no los necesitan. Ambos proveedores exponen el parámetro; ninguno publica cuánto cuestan los niveles en tokens, lo que significa que la única forma de encontrar el multiplicador real entre estos dos modelos es medirlo con tu propio tráfico.

Text card headed 'Cost per token is not cost per finished task' with rows: average evaluation task $0.0516 on GPT-6 Astra and $0.0039-$0.0155 on Solar Pro 4; input $0.09 vs $10.00 per 1M; output $0.36 vs $50.00 per 1M; roughly 8.6 minutes wall clock per task on GPT-6 Astra

El punto de equilibrio, dicho sin rodeos.

Ignora los puntos de índice por un momento y mantén la carga de trabajo fija. Si tu aplicación es extracción, clasificación, resumen o salida estructurada sobre documentos de hasta medio millón de tokens, Solar Pro 4 hace el trabajo a un ritmo que Astra no puede igualar, y no necesita en absoluto la escalera de razonamiento — ninguna diferencia de calidad plausible en una tarea de extracción JSON justifica un 42× en la salida. Si tu aplicación es un agente de horizonte largo que planifica, llama a herramientas, se recupera de un paso fallido y tiene que terminar, la brecha de once puntos en Terminal-Bench y la brecha de seis puntos en τ²-Banking son los números que predicen si termina, y una ejecución de agente fallida cuesta el precio completo de la ejecución más el reintento.

El caso verdaderamente difícil es el intermedio: tareas de razonamiento breves, difíciles y de un solo intento, donde la ventaja de Astra en GPQA es grande y su costo por tarea sigue siendo de solo unos pocos centavos. Allí, el factor decisivo no es la tarifa, sino el recuento de tokens, y la única medición que lo responde es ejecutar tus propios prompts en ambos modelos y leer el uso. Ese es también el caso donde una reducción de precios golpea con más fuerza, porque el modelo más barato es el que se prueba contra el caro, y un cambio del 67 % en la tarifa del modelo más barato cambia la aritmética de la prueba entre el lunes y hoy.

Text card headed 'Which tier gets your traffic' with rows mapping extraction and summarisation to Solar Pro 4, single-shot hard reasoning to GPT-6 Astra decided on tokens per answer, long-horizon agent runs to GPT-6 Astra on Terminal-Bench 2.1 88.4 vs 75.1, and prompts beyond 272K tokens to either with Astra repricing the whole request to $20.00/$75.00

Por qué esto es una decisión de enrutamiento en lugar de una orden de compra

GPT-6 Astra está en el catálogo de OrcaRouter como openai/gpt-6-astra a las tarifas de lista de OpenAI, traspasadas con un 0 % de margen, que es exactamente la razón por la que una comparación como esta se resuelve en una regla en lugar de en un contrato. La familia Solar de Upstage es un caso distinto, y la línea honesta es la que siempre usamos: OrcaRouter no enruta ningún modelo de Upstage, así que Solar Pro 4 no está disponible aquí —proviene de la propia API de Upstage y de varias plataformas de terceros, y la tabla de precios anterior es suya, no nuestra.

En este emparejamiento, la verdadera función de un router es la separación por niveles. El modelo barato y el modelo caro se sitúan detrás de un único endpoint compatible con OpenAI, una regla de enrutamiento envía el tráfico de extracción al nivel que le corresponde, y la conmutación por error automática promueve una llamada al modelo más potente cuando el más barato falla o devuelve una salida que tu parser rechaza. Ese último mecanismo es la respuesta práctica al riesgo de enrutamiento incorrecto que crea esta comparación: el modo de fallo costoso no es elegir el modelo equivocado, sino elegir el modelo equivocado y pagar por ello dos veces.

Qué hacer antes del domingo

Si Solar Pro 4 es un candidato para tu stack, esta es la semana más barata que vas a tener para probarlo. La tarifa promocional se mantiene hasta las 00:00 UTC del 11 de octubre, la tarifa posterior a la promoción de $0.15 y $0.60 ya está un tercio por debajo de la de lista, y la evidencia publicada por el propio modelo —las cifras de Terminal-Bench y τ²-Banking— describe trabajo que puedes reproducir con tu propio conjunto de tareas en una tarde. Ejecuta ambos modelos con los mismos prompts, mantén constantes los ajustes de razonamiento y registra tokens por tarea completada en lugar de tokens por llamada. El número que salga es el único múltiplo que importa, y no será 42×. Luego decide, con el conocimiento de que si gana el lado más barato, el precio al que lo estabas probando vence el domingo, y si gana el lado caro, los doce puntos y medio del índice son los que estás pagando.

GPT-6 Astra está en el catálogo de OrcaRouter como openai/gpt-6-astraa las tarifas de lista de OpenAI, aplicadas sin ningún margen de beneficio (0 %).