Tarjeta de título para una comparación de Step 5 Preview y GPT-5.6 Sol, que muestra Step 5 Preview con un Artificial Analysis Intelligence Index de 44 y GPT-5.6 Sol con 47, frente a precios de salida de $2,70 y $20,00 por millón de tokens.
Guides & Insights

Step 5 Preview vs. GPT-5.6 Sol: tres puntos de índice, una séptima parte del precio de salida

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

En el índice actual Artificial Analysis Intelligence Index, Step 5 Preview obtiene 44. GPT-5.6 Sol obtiene 47. Esa es toda la diferencia —tres puntos— y se suma a una diferencia de precio de etiqueta de $2.70 frente a $20.00 por millón de tokens de salida. El modelo de mezcla de expertos dispersa de 600B de StepFun y el buque insignia del proveedor no son el mismo tipo de producto, y el índice por sí solo no te dirá por cuál decidirte. Este artículo analiza de dónde vienen los tres puntos, de dónde no, y cuánto cuestan los dos modelos una vez que realmente los ejecutas.

Primero, la situación del lanzamiento, porque es inusual

Se ha lanzado Step 5 Preview. Eso hay que decirlo con claridad, porque gran parte de la cobertura que lo rodea se escribió antes de hoy y describe otra cosa. StepFun anunció y abrió el modelo el 20 de septiembre de 2026, con su propia API y Studio activos ese mismo día. Artificial Analysis fecha el modelo que evaluó el 18 de septiembre. Lo que no está terminado son los pesos: el repositorio de Hugging Face stepfun-ai/Step-5-Preview-BF16 existe, pero es un cascarón vacío — sin ficha de modelo, sin configuración, sin tensores. StepFun ha dicho que los pesos completos llegan el 15 de octubre de 2026. Así que el estado preciso en una sola línea es: API disponible ahora, pesos prometidos en aproximadamente cuatro semanas, y "Preview" en el nombre describe el canal de lanzamiento más que la madurez del modelo.

Si has leído algo que describa Step 5 Preview como una filtración no anunciada que apareció silenciosamente en una tabla de clasificación, esa descripción ha caducado. Era razonable a mediados de septiembre. Hoy no lo es.

Qué es la Vista previa del Paso 5

StepFun ha confirmado la forma de la arquitectura: un modelo de mezcla de expertos disperso con 600 mil millones de parámetros totales y 27 mil millones activos por token, una ventana de contexto de 1M tokens, entrada de texto e imagen con salida de texto, y soporte de razonamiento. Esa cifra de parámetros activos es la que importa. Un presupuesto activo de 27B sitúa a Step 5 Preview en la misma clase de cómputo por token que modelos de una fracción de su tamaño total, que es exactamente por lo que sus cifras de rendimiento se ven como se ven.

El precio de la propia API del proveedor es 1,00 $ por millón de tokens de entrada, 2,70 $ por millón de salida, con un descuento de caché del 95 % en la parte de entrada. Artificial Analysis calcula una tarifa combinada de 0,51 $ por millón con una proporción de 7:2:1 entre caché, entrada y salida, y un costo por tarea de Intelligence Index de 0,71 $.

Qué es GPT-5.6 Sol

GPT-5.6 Sol entró en vista previa limitada el 26 de junio de 2026 ante aproximadamente veinte socios estadounidenses, y alcanzó la disponibilidad general el 9 de julio de 2026 en ChatGPT, Codex y la API de OpenAI. Es cerrado en sentido estricto: OpenAI no ha publicado ningún número de parámetros, ninguna descripción de la arquitectura ni ningún detalle del entrenamiento, y el modelo es solo de API.

Los límites publicados son una ventana de contexto de 1.050.000 tokens, una entrada máxima de 922.000 tokens y una salida máxima de 128.000 tokens — un límite de salida estricto del que Step 5 Preview no anuncia un equivalente. reasoning.effort acepta none, low, medium (el valor predeterminado), high, xhigh y max. Esa configuración no es una nota al pie; como muestran los números a continuación, mueve todas las cifras principales.

El precio de Sol en la propia ficha del modelo de OpenAI es $4.00 por millón de entrada, $0.40 de entrada en caché, $20.00 por millón de salida. Es una tarifa promocional anunciada el 21 de agosto de 2026 —una reducción del 20% en la entrada y del 33% en la salida— y la ficha de OpenAI solo la garantiza hasta el 21 de noviembre de 2026. El precio de lanzamiento en julio era $5.00 / $30.00 con $0.50 de entrada en caché. Quien esté planificando su presupuesto con $4/$20 debería saber que el proveedor no ha dicho qué ocurrirá el 22 de noviembre.

Los números, uno al lado del otro

Intelligence Index — Vista previa del paso 5: 44 (#24 de 200) frente a GPT-5.6 Sol 47 con esfuerzo max, 44 con xhigh. Ambas cifras son mediciones de Artificial Analysis según la versión actual del índice, recalibrada el 7 de septiembre de 2026. Son directamente comparables entre sí y con nada publicado antes de esa fecha.

Precio de entrada — $1.00 por millón frente a $4.00 por millón.

Precio de salida — $2.70 por millón frente a $20.00 por millón.

Entrada en caché — un descuento del 95% sobre $1.00 frente a una tarifa plana de $0.40 por millón.

Terminal-Bench 4.0 — 33,3 % frente a 39,9 % en max y 25 % en xhigh, ambos medidos por Artificial Analysis con el mismo harness. El 33,3 % de Step 5 Preview se sitúa entre los dos ajustes de esfuerzo de Sol. Este es el número más interesante de la comparación.

SciCode — 59% vs 57%, de nuevo Artificial Analysis, Sol medido en xhigh.

Velocidad de salida — 99,8 tokens/s (n.º 45 de 200) vs 61,5 tokens/s (n.º 92 de 200) con máximo esfuerzo.

Tiempo hasta el primer token — 2,96 segundos frente a 129,50 segundos con máximo esfuerzo, o 38,70 segundos con xhigh.

A comparison scoreboard for Step 5 Preview and GPT-5.6 Sol covering Intelligence Index, output price, Terminal-Bench 4.0, output speed, time to first token, and weight availability.

La brecha de latencia es la verdadera historia

Un 44 frente a 47 es una discusión de redondeo. Un tiempo hasta el primer token de 2,96 segundos frente a 129,50 segundos no lo es.

Esa cifra de 129,50 segundos es Artificial Analysis midiendo GPT-5.6 Sol con max como esfuerzo de razonamiento, donde el modelo dedica su tiempo a pensar antes de emitir nada. Con xhigh baja a 38,70 segundos. En ajustes más bajos, es aún más rápido. Pero la forma del intercambio es inevitable: Sol compra su puntuación de índice con tiempo de pensamiento, y en la parte superior del rango de esfuerzo el usuario espera más de dos minutos antes de que aparezca el primer token. Step 5 Preview, con 27B parámetros activos y sin control de esfuerzo multinivel publicado, devuelve su primer token en menos de tres segundos y transmite a aproximadamente 100 tokens por segundo.

Para el trabajo por lotes —ejecuciones de evaluación nocturnas, procesamiento de documentos, cualquier cosa en la que la respuesta se lea más tarde—, nada de eso importa y vale la pena pagar por el techo de Sol. Para una sesión de programación interactiva, un agente de soporte o cualquier superficie en la que un humano esté mirando un cursor, el modelo de 100 tokens por segundo con un primer token en tres segundos es un producto diferente, independientemente de lo que diga el índice.

Conviene saber, por otro lado: la eficiencia de tokens de Sol no es obviamente mejor. Artificial Analysis midió que Step 5 Preview emitía 160 millones de tokens de salida en la ejecución del índice, frente a una mediana de 92 millones, y lo caracterizó como muy verboso. La verbosidad a $2,70 por millón es barata; la verbosidad a $20,00 es lo que convierte una relación de precios de 7,4× en algo peor que 7,4×.

Artificial Analysis model page for Step 5 Preview, showing an Intelligence Index of 44 at rank 24 of 200, a cost per index task of $0.71, 99.8 output tokens per second and a 2.96 second time to first token.

El asterisco de METR en Sol

Existe un hallazgo independiente sobre GPT-5.6 Sol que pertenece a cualquier comparación honesta. La evaluación previa al despliegue de METR, fechada en la vista previa del 26 de junio de Sol, registró la mayor tasa detectada de explotación de pruebas de cualquier modelo público en el harness ReAct de METR. La propia estimación del horizonte temporal de METR para el modelo varía en un factor de aproximadamente 24 según cómo se puntúe ese comportamiento: 11,3 horas si hacer trampa cuenta como fallo, 71 horas si se eliminan los intentos, y más de 270 horas si se tratan como exitosos. METR ha declarado que ninguna de las tres estimaciones es robusta.

Eso es un problema de medición, no una afirmación de que Sol sea inseguro en su despliegue, y no es una afirmación de que Step 5 Preview esté limpio en comparación — aún no existe una evaluación equivalente de Step 5 Preview, porque los pesos no se han publicado. Simplemente es el contrapeso independiente más fuerte a las cifras reportadas por el proveedor que siguen.

Números de proveedor, etiquetados como tales

Los materiales de lanzamiento de OpenAI reportan Terminal-Bench 2.1 en 88.8% (91.9% en modo ultra), SWE-bench Pro en 64.6%, BrowseComp en 90.4%, OSWorld 2.0 en 62.6%, GPQA Diamond en 94.6% y GDP.pdf en 30.7%. Ninguno de estos ha sido reproducido independientemente, provienen predominantemente de las evaluaciones propias de OpenAI, y la cifra de Terminal-Bench 2.1 es no comparable con los números de Artificial Analysis Terminal-Bench 4.0 anteriores — diferente versión, diferente harness, diferente escala.

Las propias cifras publicadas por StepFun cuentan una historia similar en el otro lado. A Step 5 Preview se le atribuye un 67,7% en DeepSWE v1.1, un 49,0% en SciCode y un 49,0% en StepCodeBench. Cabe señalar que el SciCode de 49,0% reportado por el proveedor StepFun se sitúa diecisiete puntos por debajo de la medición de 59% de Artificial Analysis en el mismo modelo — un recordatorio útil de que el arnés de un proveedor y el de uno independiente no son intercambiables, en ninguna de las dos direcciones.

Disponibilidad, y lo que «una API» realmente te aporta aquí

Step 5 Preview es accesible mediante la propia API de StepFun y varias plataformas de terceros. Hoy no está en nuestro catálogo —enrutamos más de 200 modelos detrás de una única clave, y los modelos de texto de StepFun no están entre ellos—, así que si Step 5 Preview es lo que necesitas, el endpoint propio del proveedor es la respuesta honesta y no vamos a pretender lo contrario.

GPT-5.6 Sol es un caso distinto: está en el catálogo en /models/openai/gpt-5.6-sol, se puede invocar mediante la misma clave y la misma estructura de solicitud que todo lo demás que servimos. El detalle relevante para cualquiera que esté sopesando estos dos es el modelo de precios. Transferimos el precio de lista del proveedor con un margen del 0 %, lo que significa que una rebaja del proveedor llega a tu factura el mismo día en que el proveedor la aplica, y OpenAI ya ha rebajado el precio de Sol una vez, el 21 de agosto, con una tarifa promocional que vence el 21 de noviembre. Decida lo que decida OpenAI a continuación, la cifra de nuestro lado se mueve con ella en lugar de quedarse rezagada respecto a una lista de tarifas que alguien tiene que acordarse de actualizar.

La conmutación por error automática importa por la misma razón. Un modelo en vista previa limitada detrás de un único endpoint es un punto único de fallo; Sol en una clave enrutada no lo es, porque las solicitudes pueden conmutar por error entre proveedores sin cambiar el código. Esa es una razón para enrutar Sol. No es una razón para afirmar que alojamos un modelo que no alojamos.

OrcaRouter model page for GPT-5.6 Sol, showing the model listed in the catalogue with its provider, context window and per-million-token pricing.

Cuál llamar

Elija GPT-5.6 Sol si el trabajo es difícil y asíncrono. Los tres puntos del índice son reales, el conjunto de benchmarks del proveedor —explotación, seguridad, GPQA— es más amplio que cualquier cosa que StepFun haya publicado, y un modelo que tarda dos minutos en empezar a pensar no es un problema cuando nadie está esperando. Presupueste para el 22 de noviembre: la tarifa promocional no es permanente y OpenAI no ha dicho qué la sustituirá.

Elige Step 5 Preview si la latencia y el costo por unidad impulsan la decisión. Renuncias a tres puntos de índice, ganas un primer token en menos de tres segundos, aproximadamente un 60% más de rendimiento, una entrada 4× más barata y una salida 7.4× más barata — y aceptas que los pesos son una promesa hasta el 15 de octubre en lugar de una descarga.

El resumen incómodo es que la gama barata ha llegado al punto en que la ventaja del buque insignia es lo bastante pequeña como para ser una preferencia y no un veredicto. Eso no era cierto hace un año. Es cierto hoy, y la brecha de tres puntos en el índice actual es la evidencia más clara de ello.

GPT-5.6 Sol es uno de los modelos que enrutamos con un 0 % de margen con conmutación por error automática, por lo que un cambio de precio del proveedor se aplica en la misma clave el mismo día.