
Step 5 Preview vs GPT-6 Astra: diez veces el precio de entrada por nueve puntos de índice
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Estos dos modelos se anunciaron con diecisiete días de diferencia y con precios pensados para planetas distintos. Step 5 Preview, el modelo de mezcla dispersa de expertos de 600B parámetros de StepFun anunciado el 20 de septiembre de 2026, cobra $1.00 por millón de tokens de entrada y $2.70 por millón de tokens de salida. GPT-6 Astra, el buque insignia del proveedor lanzado el 3 de septiembre de 2026, cobra $10.00 y $50.00 por las mismas unidades por debajo de un umbral de entrada de 272K tokens — y $20.00 y $75.00 por encima de él. Eso es diez veces el precio de entrada y aproximadamente dieciocho veces el precio de salida para un modelo que obtiene nueve puntos más en el índice independiente Intelligence Index, 53 frente a 44. Que Astra sea mejor no está en duda. Que la diferencia valga treinta dólares extra por millón de tokens de salida en tu carga de trabajo sí lo está, y la respuesta cambia dos veces a lo largo de este artículo.
Para qué sirve cada modelo
Step 5 Preview está diseñado y comercializado para el trabajo agéntico: codificación con IA, ingeniería de software, trabajo profesional del conocimiento y finanzas. La arquitectura está ajustada para ello: 600 mil millones de parámetros totales con aproximadamente 27 mil millones activos por token, un contexto de 1 millón de tokens, entrada de texto e imágenes, y razonamiento con pensamiento extendido. StepFun se saltó toda la línea Step 4.x para llegar hasta aquí, pasando directamente de Step-3.7-Flash a Step 5.
GPT-6 Astra es el buque insignia de propósito general de OpenAI: un contexto de 1M de tokens, hasta 128K tokens de salida, entrada en texto, imágenes y archivos, salida en texto, una fecha de corte de conocimiento del 30 de abril de 2026, y compatibilidad con flujos de trabajo de razonamiento, programación y agentes. Es el modelo al que recurre una empresa cuando la respuesta tiene que ser correcta y la factura de tokens no es la restricción determinante.
• Índice de Inteligencia — Step 5 Preview 44 vs GPT-6 Astra 53
• Parámetros — Step 5 Preview 600B en total / 27B activos frente a GPT-6 Astra no revelados
• Contexto y límite de salida — ambos con contexto de 1 M de tokens; Astra indica una ventana de 1.050.000 tokens y un límite de salida de 128 K, StepFun no ha publicado ningún límite de salida
• Modalidad de entrada — texto e imágenes frente a texto, imágenes y archivos
• Velocidad de salida — Step 5 Preview 99,8 tokens/seg vs GPT-6 Astra 59,3 tokens/seg
• Precio por 1M de tokens — $1.00 de entrada / $2.70 de salida frente a $10.00 de entrada / $50.00 de salida por debajo de 272K de entrada, y sube a $20.00 / $75.00 por encima de eso
• Caché — descuento del 95% de Step 5 Preview frente al descuento de lectura del 90% de GPT-6 Astra, con una tarifa de escritura en caché de $12.50 por millón
• Coste por tarea del Intelligence Index — Step 5 Preview 0,71 $ vs GPT-6 Astra 3,26 $

La factura, línea por línea
El precio de Step 5 Preview es fijo y barato: $1.00 de entrada, $2.70 de salida, con un descuento de caché del 95 % que deja la entrada en caché cerca de $0.05 por millón de tokens. Con una mezcla de aciertos de caché de 7:2:1 de entrada y salida —la convención que usa este blog para el tráfico de agentes—, la tarifa combinada queda cerca de $0.51 por millón de tokens, y el coste por tarea del Intelligence Index es de $0.71, el 27.º de 200. La advertencia es la verbosidad: el modelo produjo 160 M de tokens de salida en ese Index frente a una mediana de 92 M, así que los recuentos brutos de tokens superan lo que sugiere el precio de tarifa.
El precio de GPT-6 Astra es escalonado, y el escalón es la parte que vale la pena leer con atención. Por debajo de 272K tokens de entrada por solicitud, es de $10.00 y $50.00; por encima, $20.00 y $75.00. El escalón se selecciona según el propio recuento de tokens de entrada de cada solicitud, lo que importa más de lo que parece para un modelo que se vende por su contexto de 1M de tokens: una sola llamada de contexto grande cruza el límite y duplica la tarifa de toda la solicitud. Las lecturas de caché son $1.00 por millón, un descuento del 90%, y las escrituras de caché son $12.50 por millón. Con la misma mezcla 7:2:1, la tarifa combinada queda cerca de $7.70 por millón de tokens, y el costo por tarea de Index es $3.26, el 71.º de 200.
Astra va en la dirección opuesta en cuanto a verbosidad, y es el modelo conciso aquí: 60 M de tokens de salida en el Index frente a los 160 M de Step 5 Preview, puesto 27 de 200 en esa métrica. Menos tokens a una tarifa más alta reducen la brecha de un modo que el múltiplo bruto exagera. No la cierra — la cifra de coste por tarea ya compensa en conjunto la verbosidad, el comportamiento de la caché y el precio, y 3,26 $ frente a 0,71 $ sigue siendo una diferencia de 4,6 veces.
Qué compran los nueve puntos del índice
Las cifras destacadas de Astra son propias de OpenAI y no se han reproducido: 96,1 en GPQA Diamond, 72,6 % en OSWorld 2.0, 97,6 % en FrontierMath Tier 4, 57,2 % en Humanity's Last Exam con herramientas, y alrededor del 57,9 % en Terminal-Bench 4.0. La cifra de ARC-AGI-3 es la que hay que tratar con cuidado —OpenAI informa de un 99,9 % bajo su propio arnés adaptador de proveedor y un 62,7 % en el arnés estándar, y una variación de 37 puntos entre arneses es una afirmación sobre el arnés al menos tanto como sobre el modelo.
Los números publicados de Step 5 Preview se sitúan en el mismo territorio en las tareas agénticas para las que fue construido, y conllevan la misma advertencia: 33.3% en Terminal-Bench 4.0, 80.5 en ProgramBench, 67.7 en DeepSWE v1.1 y 49.0 en StepCodeBench, todos de StepFun y ninguno reproducido de forma independiente. Diferentes proveedores, diferentes harnesses, ninguna ejecución compartida — que es precisamente por lo que la brecha de nueve puntos medida de forma independiente es el número más útil que cualquiera de estos.
Esa brecha es real y no es pequeña. En una clasificación de 200 modelos, 53 y 44 ocupan la tercera y la vigesimocuarta posición, y la separación se manifiesta como una clase distinta de tarea en lugar de como una puntuación distinta en la misma tarea: las victorias publicadas de Astra se agrupan en razonamiento de horizonte largo y uso de computadora, que es donde la parte superior de la clasificación se despega. Si tu carga de trabajo vive ahí, los nueve puntos valen más que la factura.
Una salvedad sobre la puntuación de Astra. Artificial Analysis revisa el Intelligence Index, y las cifras para el mismo modelo varían entre instantáneas tomadas con semanas de diferencia —52,8, 53 y 54,7 aparecen todas en material publicado sobre este modelo dentro del mismo mes. El 53 que figura en la página actual del modelo es el número que se debe usar, y cualquier comparación que ponga una instantánea más antigua de Astra junto a una cifra actual de Step 5 Preview está midiendo con dos reglas distintas.

Velocidad y latencia son dos cuestiones diferentes
En cuanto a la velocidad de generación, la tabla independiente es inequívoca: 99,8 tokens de salida por segundo para Step 5 Preview frente a 59,3 para GPT-6 Astra, que además es más lento que el promedio de 70 tokens por segundo de los modelos medidos. En un bucle de codificación interactivo, esa es la diferencia entre una sugerencia y una pausa, y se acumula a lo largo de una sesión igual que un descuento de caché.
La latencia es la historia más complicada, y un único número induce a error al respecto. Astra enruta el razonamiento antes de emitirlo, por lo que el tiempo hasta el primer token y el tiempo hasta una respuesta utilizable no son la misma medición, y las cifras publicadas al respecto varían mucho según se cuente o no el razonamiento. En nuestro propio tráfico de los últimos siete días, la mediana del tiempo hasta el primer token de GPT-6 Astra es de 6,72 segundos, con un percentil 95 de 10,00 segundos — la cifra que un cliente experimenta realmente a través de nuestro endpoint. Artificial Analysis sitúa el tiempo hasta el primer token de Step 5 Preview en 2,96 segundos en su propio entorno de pruebas, y esas dos cifras no se miden de la misma manera, por lo que no deberían restarse entre sí.
Dónde recae en realidad la asimetría de caché
Ambos modelos descuentan considerablemente los prefijos repetidos y ambos cobran por escribirlos, y la diferencia entre ellos es de 20 veces en la lectura. El descuento de caché del 95% de Step 5 Preview sitúa la entrada en caché cerca de $0.05 por millón de tokens. GPT-6 Astra lee la caché a $1.00 por millón —un descuento del 90% sobre una tarifa base diez veces mayor— y la escribe a $12.50 por millón.
Para un bucle de agente que reenvía el mismo prompt del sistema y el contexto del repositorio en cada turno, la tasa de lectura es lo que se acumula, y el descuento más profundo en el modelo más barato vale más que el descuento menos profundo en el caro. La mezcla de Astra aún se sitúa cerca de $7.70 por millón de tokens frente a los $0.51 de Step 5 Preview con la misma mezcla 7:2:1 — una diferencia de quince veces que una sesión larga no cierra, sino que amplía.
Ejecutar ambos desde una misma tecla.
GPT-6 Astra ya está disponible en OrcaRouter bajo openai/gpt-6-astra a las tarifas de lista de OpenAI — $10.00 y $50.00 por millón por debajo del umbral de 272K, $20.00 y $75.00 por encima de este — transferidas sin ningún margen añadido, de modo que un cambio de precios del proveedor se refleja de inmediato en nuestro lado el mismo día, en lugar de en el siguiente ciclo de facturación. Nuestra propia telemetría de siete días en ese endpoint muestra la mediana de 6,72 segundos y el percentil 95 de 10,00 segundos de tiempo hasta el primer token citados arriba, junto con 277,9 millones de tokens de tráfico a través de él durante la última semana.
Step 5 Preview no está en nuestro catálogo y no lo enrutamos. Se ejecuta en la API y el Studio propios de StepFun, y ese es el único lugar donde se ejecuta hasta que llegue el punto de control del 15 de octubre. Esa asimetría no es un defecto de la comparación; es la comparación. La mitad barata de este enfrentamiento es la mitad que tienes que ir a buscar a otro sitio, y la mitad que puedes poner en producción hoy se encuentra detrás de una sola API para más de 200 modelos: GPT-6 Astra a las tarifas indicadas, GLM-5.3 a $1,26 y $3,96, DeepSeek V4 Pro, Claude Opus 5 y el resto, con conmutación por error automática entre proveedores que mantiene una ruta estable cuando la capacidad de un proveedor se mueve y el DSL de enrutamiento que permite que una tarea empiece barata y escale solo cuando tiene que hacerlo. Esa regla de escalado es la verdadera respuesta a una diferencia de precio de diez veces: la mayor parte de una carga de trabajo no necesita lo más alto de la tabla, y una capa de enrutamiento es la forma de dejar de pagar por la parte que no lo necesita.

Quién debería elegir cuál
Si tu carga de trabajo es un agente de horizonte largo que tiene que resolver bien una tarea difícil —uso de computadora, investigación de múltiples pasos, trabajo donde una respuesta incorrecta cuesta más que los tokens—, la ventaja de nueve puntos de GPT-6 Astra es la parte más barata de la decisión, y la factura es lo que cuesta la capacidad. Ejecútalo como objetivo de escalado, no como la opción predeterminada, y presta atención al umbral de 272K: una sola solicitud de tamaño excesivo duplica la tarifa de todo lo que contiene.
Si tu carga de trabajo es texto agéntico de gran volumen —generación de código, refactorizaciones, extracción estructurada, el bucle interno de un asistente de programación—, Step 5 Preview va por delante en todo lo que importa a la factura y al reloj, y es poco probable que nueve puntos de índice sobrevivan al contacto con una distribución de tareas que no esté en la cima de la tabla. El problema no es el rendimiento: el modelo es propietario, sin licencia publicada, sin concesión de uso comercial y sin checkpoint hasta el 15 de octubre. Puedes llamarlo; no puedes poseerlo, ajustarlo ni distribuir un derivado de él.
Si la respuesta no es obvia, el patrón es una división por niveles en lugar de una elección. Dirige el tráfico general a un modelo de nivel medio y reserva Astra para las solicitudes que necesitan la cima de la tabla — ambos extremos de esa regla están detrás de una sola clave de nuestro lado, así que la división cuesta una regla de enrutamiento en lugar de un segundo contrato. Pagar tarifas de gama alta por un trabajo que un modelo de nivel medio termina correctamente es el error del que realmente trata esta comparación.
